Reddit r/LocalLLaMA (开源AI)· /u/bodhi371·· 6 小时前AI 评分60
Qwen3.8-27B 量化方案实现 12GB VRAM + 8GB RAM 本地运行,解码约 18 tok/sec
Qwen3.8-27B with just 12GB VRAM + 8GB RAM - ~18 tok/sec
AI 导读
/u/bodhi371 用 ISTA-DASLab Qwen3.8-27B-GSQ-RCO IQ3_S 量化(约 11GB),在 9900X + 4070S 12GB 上以原版 llama.cpp 跑通 Qwen3.8-27B,64k 上下文解码约 18 tok/sec、prefill 约 500-600 tok/sec。
来源:Reddit r/LocalLLaMA (开源AI) · reddit.com