跳到正文
原文
Reddit r/LocalLLaMA (开源AI)· /u/Bulky-Priority6824·· 2 小时前AI 评分26

llama.cpp 跑 Qwen 3.8 FN GSQ RCO IQ1 还有多少优化空间?

QFN llama.cpp Any juice left to squeeze?

AI 导读

一位用户在 2x 5060ti 16GB 加 32GB DDR4 内存上用 llama.cpp 运行 Qwen3.8-Flash-Next-GSQ-RCO-IQ1 量化模型(27.58 GB,ctx-size 98304),询问配置是否还有优化余地。实测 prompt 250.4 tok/s、生成 30.5 tok/s,并完整公开了启动参数与采样设置。

来源:Reddit r/LocalLLaMA (开源AI) · reddit.com