热点事件持续更新
用户实测 mainline llama.cpp 多GPU速度反超 ik_llama.cpp
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026年10月7日,Reddit r/LocalLLaMA 有用户发帖称,社区普遍认为 ik_llama.cpp 比 mainline llama.cpp 快,但在其 4 卡非对称多 GPU 混合平台上实测结果相反。该用户使用 mainline llama.cpp 运行 Qwen 3.8 Flash-Next 177B 模型(IQ3_XXS 量化,约 89 GB),测得 prompt eval 速度为 19.70 tokens/sec、生成速度为 10.86 tokens/sec;而 ik_llama.cpp 在同一平台上仅达到 prompt eval 5.48 tokens/sec、生成 8.43 tokens/sec,mainline 两项指标均明显领先。该帖仅为单一用户的实测分享,目前尚无其他独立测试或官方回应证实或解释这一差异的具体原因。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 10:17
Reddit 用户实测显示多GPU平台上 mainline llama.cpp 性能全面超过 ik_llama.cpp。报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- Reddit r/LocalLLaMA (开源AI)为什么都说 ik_llama.cpp 比 Mainline 快?我的多 GPU 混合平台上 Mainline 反而完胜
Reddit 用户在 4 卡非对称多 GPU 平台上实测发现,mainline llama.cpp 跑 Qwen 3.8 Flash-Next 177B(IQ3_XXS,约 89 GB)时 prompt eval 达 19.70 tokens/sec、生成 10.86 tokens/sec,远超 ik_llama.cpp 的 5.48 和 8.43 tokens/sec。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。