跳到正文
热点事件持续更新

Qwen3.8-27B量化方案实现12GB显存本地部署

1 篇报道1 个报道来源6 小时前更新

先了解这件事

AI 综述

2026年10月7日,Reddit r/LocalLLaMA 用户 /u/bodhi371 发帖称,使用 ISTA-DASLab 的 Qwen3.8-27B-GSQ-RCO IQ3_S 量化版本(约 11GB),在配备 AMD 9900X 处理器和 RTX 4070 Super 12GB 显卡的设备上,通过原版 llama.cpp 成功运行 Qwen3.8-27B 模型。该方案在 64k 上下文长度下实现约 18 tok/sec 的解码速度和约 500-600 tok/sec 的 prefill 速度,显存占用约 12GB,另需约 8GB 内存。这表明通过高压缩比量化,27B 规模的模型可在消费级 12GB 显存硬件上以可用速度本地运行。目前仅此一篇报道,暂无后续进展。

AI 根据报道生成 · 6 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. Reddit r/LocalLLaMA (开源AI)
    Qwen3.8-27B 量化方案实现 12GB VRAM + 8GB RAM 本地运行,解码约 18 tok/sec

    /u/bodhi371 用 ISTA-DASLab Qwen3.8-27B-GSQ-RCO IQ3_S 量化(约 11GB),在 9900X + 4070S 12GB 上以原版 llama.cpp 跑通 Qwen3.8-27B,64k 上下文解码约 18 tok/sec、prefill 约 500-600 tok/sec。

本事件热度走势

当前热度 9·可比范围峰值 10(10月7日 08:00)·近 24 小时可比范围变化 –

02.557.51010月7日08:0010月7日10:0010月7日11:0010月7日13:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。