热点事件持续更新
Qwen3.8-27B量化方案实现12GB显存本地部署
1 篇报道1 个报道来源6 小时前更新
先了解这件事
AI 综述
2026年10月7日,Reddit r/LocalLLaMA 用户 /u/bodhi371 发帖称,使用 ISTA-DASLab 的 Qwen3.8-27B-GSQ-RCO IQ3_S 量化版本(约 11GB),在配备 AMD 9900X 处理器和 RTX 4070 Super 12GB 显卡的设备上,通过原版 llama.cpp 成功运行 Qwen3.8-27B 模型。该方案在 64k 上下文长度下实现约 18 tok/sec 的解码速度和约 500-600 tok/sec 的 prefill 速度,显存占用约 12GB,另需约 8GB 内存。这表明通过高压缩比量化,27B 规模的模型可在消费级 12GB 显存硬件上以可用速度本地运行。目前仅此一篇报道,暂无后续进展。
AI 根据报道生成 · 6 小时前更新
最新进展10月7日 07:16
用户用IQ3_S量化在12GB显存4070S上跑通Qwen3.8-27B,解码约18 tok/s。报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- Reddit r/LocalLLaMA (开源AI)Qwen3.8-27B 量化方案实现 12GB VRAM + 8GB RAM 本地运行,解码约 18 tok/sec
/u/bodhi371 用 ISTA-DASLab Qwen3.8-27B-GSQ-RCO IQ3_S 量化(约 11GB),在 9900X + 4070S 12GB 上以原版 llama.cpp 跑通 Qwen3.8-27B,64k 上下文解码约 18 tok/sec、prefill 约 500-600 tok/sec。
本事件热度走势
当前热度 9·可比范围峰值 10(10月7日 08:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。