跳到正文
原文
Reddit r/LocalLLaMA (开源AI)· /u/bodhi371·· 6 小时前AI 评分60

Qwen3.8-27B 量化方案实现 12GB VRAM + 8GB RAM 本地运行,解码约 18 tok/sec

Qwen3.8-27B with just 12GB VRAM + 8GB RAM - ~18 tok/sec

AI 导读

/u/bodhi371 用 ISTA-DASLab Qwen3.8-27B-GSQ-RCO IQ3_S 量化(约 11GB),在 9900X + 4070S 12GB 上以原版 llama.cpp 跑通 Qwen3.8-27B,64k 上下文解码约 18 tok/sec、prefill 约 500-600 tok/sec。

来源:Reddit r/LocalLLaMA (开源AI) · reddit.com