热点事件持续更新
ik_llama.cpp fork 发布 MoE 优化:专家驻留与混合执行
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026年10月6日,Reddit r/LocalLLaMA 报道,基于 ik_llama.cpp 的 fork 项目 k_llama.cpp 完成了针对 MoE(混合专家)模型的优化,主要包含三项更新:一是新增带宽自适应的 CPU/GPU 混合执行能力;二是新增可配置的专家驻留 VRAM 上限参数(--moe-resident-mib N),允许用户控制驻留在显存中的专家数量;三是新增 Q2_0 量化格式支持。报道称该项目基于 ik_llama.cpp,而事件早先的标题将该优化归于 ik_llama.cpp 本身,后续报道称优化实际来自其 fork 项目 k_llama.cpp。报道未提及其他进展或后续计划,事件目前状态即上述三项功能的发布。
AI 根据报道生成 · 2 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
10月6日
- Reddit r/LocalLLaMA (开源AI)k_llama.cpp 发布 MoE 优化:专家驻留、CPU/GPU 混合执行与 Q2_0 支持
基于 ik_llama.cpp 的 fork k_llama.cpp 完成 MoE 优化,新增带宽自适应 CPU/GPU 混合执行、可配置专家驻留 VRAM 上限(--moe-resident-mib N)和 Q2_0 量化支持。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。