跳到正文
热点事件持续更新

AgrillaMoE:16GB显卡2-bit量化跑Qwen3.6-35B MoE

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月5日,Reddit r/LocalLLaMA 上出现项目 AgrillaMoE。作者将 llama.cpp 服务端 fork 为 AgrillaMoE,专用于在 16GB GPU 上以 2-bit 量化运行 Qwen3.6-35B-A3B,并支持 MoE 扩展,配合 Unsloth 量化方案。在租用的 V100 16GB 显卡上,使用 UD-Q2_K_XL 2-bit 量化达到约 57-60 tok/s 的推理速度。该项目兼容 OpenAI 和 Anthropic API,可直接对接 Claude Code 使用。目前尚无后续报道或独立验证。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. Reddit r/LocalLLaMA (开源AI)
    AgrillaMoE:在 16GB GPU 上以 2-bit 量化运行 Qwen3.6-35B-A3B 并支持 MoE 扩展

    作者将 llama.cpp 服务端 fork 为 AgrillaMoE,专用于 Qwen3.6-35B-A3B 配合 Unsloth 量化。在租用的 V100 16GB 上用 UD-Q2_K_XL 2-bit 量化达到约 57-60 tok/s,兼容 OpenAI 和 Anthropic API,可直接对接 Claude Code。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。