跳到正文
原文
Reddit r/LocalLLaMA (开源AI)· /u/vulcan4d·· 3 小时前AI 评分21

为什么都说 ik_llama.cpp 比 Mainline 快?我的多 GPU 混合平台上 Mainline 反而完胜

Why is ik_llama.cpp said to be faster than Mainline? On my hybrid multi-GPU rig, Mainline easily beats it

AI 导读

Reddit 用户在 4 卡非对称多 GPU 平台上实测发现,mainline llama.cpp 跑 Qwen 3.8 Flash-Next 177B(IQ3_XXS,约 89 GB)时 prompt eval 达 19.70 tokens/sec、生成 10.86 tokens/sec,远超 ik_llama.cpp 的 5.48 和 8.43 tokens/sec。

来源:Reddit r/LocalLLaMA (开源AI) · reddit.com