热点事件持续更新
Strata 实现 MoE 缓存,推理速度远超 llama.cpp 引热议
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
开源推理项目 Strata 成为 r/LocalLLaMA 讨论焦点。网友发帖称,Strata 在约两周内实现了 MoE 缓存功能,带来 5-10 倍 prefill 提速和 3-4 倍 decode 提速;而社区此前呼吁 llama.cpp 增加类似功能已近一年,但一直没有结果。发帖者建议,在配备 8-16GB 显存显卡和 64GB 内存的环境下,使用 Strata 运行 Qwen-3.8-flash-next 模型,速度可达约 2000 t/s prefill 和 70 t/s decode 以上,性能可媲美甚至超过 27B 模型。该消息显示 Strata 在特定场景下的推理性能已明显超过 llama.cpp。
AI 根据报道生成 · 1 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
10月3日
- Reddit r/LocalLLaMA (开源AI)Strata 实现 MoE 缓存,性能远超 llama.cpp
开源推理项目 Strata 在约两周内实现了 MoE 缓存,带来 5-10x prefill 和 3-4x decode 提速,而用户呼吁 llama.cpp 加该功能近一年无果。发帖者建议在 8-16gb 显卡 + 64gb ram 上使用 Strata 运行 Qwen-3.8-flash-next,速度约 2000/70 t/s 以上,可媲美或超过 27b 模型。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。