热点事件持续更新
AgrillaMoE:16GB显卡2-bit量化跑Qwen3.6-35B MoE
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026年10月5日,Reddit r/LocalLLaMA 上出现项目 AgrillaMoE。作者将 llama.cpp 服务端 fork 为 AgrillaMoE,专用于在 16GB GPU 上以 2-bit 量化运行 Qwen3.6-35B-A3B,并支持 MoE 扩展,配合 Unsloth 量化方案。在租用的 V100 16GB 显卡上,使用 UD-Q2_K_XL 2-bit 量化达到约 57-60 tok/s 的推理速度。该项目兼容 OpenAI 和 Anthropic API,可直接对接 Claude Code 使用。目前尚无后续报道或独立验证。
AI 根据报道生成 · 2 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- Reddit r/LocalLLaMA (开源AI)AgrillaMoE:在 16GB GPU 上以 2-bit 量化运行 Qwen3.6-35B-A3B 并支持 MoE 扩展
作者将 llama.cpp 服务端 fork 为 AgrillaMoE,专用于 Qwen3.6-35B-A3B 配合 Unsloth 量化。在租用的 V100 16GB 上用 UD-Q2_K_XL 2-bit 量化达到约 57-60 tok/s,兼容 OpenAI 和 Anthropic API,可直接对接 Claude Code。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。