Reddit r/LocalLLaMA (开源AI)· /u/IceFog72·· 3 小时前AI 评分33
k_llama.cpp 发布 MoE 优化:专家驻留、CPU/GPU 混合执行与 Q2_0 支持
k_llama.cpp MoE Optimizations: Expert Residency, Hybrid CPU/GPU Execution, Q2_0 Support
AI 导读
基于 ik_llama.cpp 的 fork k_llama.cpp 完成 MoE 优化,新增带宽自适应 CPU/GPU 混合执行、可配置专家驻留 VRAM 上限(--moe-resident-mib N)和 Q2_0 量化支持。
来源:Reddit r/LocalLLaMA (开源AI) · reddit.com