Reddit r/LocalLLaMA (开源AI)· /u/vulcan4d·· 3 小时前AI 评分21
为什么都说 ik_llama.cpp 比 Mainline 快?我的多 GPU 混合平台上 Mainline 反而完胜
Why is ik_llama.cpp said to be faster than Mainline? On my hybrid multi-GPU rig, Mainline easily beats it
AI 导读
Reddit 用户在 4 卡非对称多 GPU 平台上实测发现,mainline llama.cpp 跑 Qwen 3.8 Flash-Next 177B(IQ3_XXS,约 89 GB)时 prompt eval 达 19.70 tokens/sec、生成 10.86 tokens/sec,远超 ik_llama.cpp 的 5.48 和 8.43 tokens/sec。
来源:Reddit r/LocalLLaMA (开源AI) · reddit.com