跳到正文
热点事件持续更新

ik_llama.cpp fork 发布 MoE 优化:专家驻留与混合执行

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月6日,Reddit r/LocalLLaMA 报道,基于 ik_llama.cpp 的 fork 项目 k_llama.cpp 完成了针对 MoE(混合专家)模型的优化,主要包含三项更新:一是新增带宽自适应的 CPU/GPU 混合执行能力;二是新增可配置的专家驻留 VRAM 上限参数(--moe-resident-mib N),允许用户控制驻留在显存中的专家数量;三是新增 Q2_0 量化格式支持。报道称该项目基于 ik_llama.cpp,而事件早先的标题将该优化归于 ik_llama.cpp 本身,后续报道称优化实际来自其 fork 项目 k_llama.cpp。报道未提及其他进展或后续计划,事件目前状态即上述三项功能的发布。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月6日
  1. Reddit r/LocalLLaMA (开源AI)
    k_llama.cpp 发布 MoE 优化:专家驻留、CPU/GPU 混合执行与 Q2_0 支持

    基于 ik_llama.cpp 的 fork k_llama.cpp 完成 MoE 优化,新增带宽自适应 CPU/GPU 混合执行、可配置专家驻留 VRAM 上限(--moe-resident-mib N)和 Q2_0 量化支持。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。