Reddit r/LocalLLaMA (开源AI)· /u/Training_Visual6159·· 2 小时前AI 评分30
Strata 实现 MoE 缓存,性能远超 llama.cpp
Imma just say it, Strata absolutely clowned llama.cpp
AI 导读
开源推理项目 Strata 在约两周内实现了 MoE 缓存,带来 5-10x prefill 和 3-4x decode 提速,而用户呼吁 llama.cpp 加该功能近一年无果。发帖者建议在 8-16gb 显卡 + 64gb ram 上使用 Strata 运行 Qwen-3.8-flash-next,速度约 2000/70 t/s 以上,可媲美或超过 27b 模型。
来源:Reddit r/LocalLLaMA (开源AI) · reddit.com