Reddit r/LocalLLaMA (开源AI)· /u/pand5461·· 3 小时前AI 评分27
试用某新推理引擎后得出结论:还是用 llama.cpp
Need maybe say "Use llama.cpp"
AI 导读
一位 r/LocalLLaMA 用户测试某新推理引擎时发现,IQ3_S 量化模型在长生成约 10k token 后退化,陷入"Need maybe include…"的重复循环。同一模型在 llama.cpp 中则能正常生成连贯回答,无退化问题。
来源:Reddit r/LocalLLaMA (开源AI) · reddit.com