热点事件持续更新
15个本地模型工具调用基准实测:qwen3.8-27b第一,Bonsai 27B垫底
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026年10月5日,一位用户在 Reddit r/LocalLLaMA 发布了针对 15 个本地模型的 agent/工具使用能力实测。测试使用 Toolery 基准,每个模型跑 429 次试验,全部通过 LM Studio 本地服务完成。结果显示,qwen3.8-27b 以 71.8% 的成绩排名第一;bonsai-27b 以 50.5% 垫底,其中在 Very Hard 场景下成功率仅 22.2%。目前该实测为单一报道披露的结果,尚无后续进展。
AI 根据报道生成 · 1 小时前更新
最新进展10月5日 03:39
Toolery 基准实测发布:qwen3.8-27b 以 71.8% 居首,bonsai-27b 50.5% 垫底。报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- Reddit r/LocalLLaMA (开源AI)15 个本地模型 agent/工具使用实测:Bonsai 27B 垫底
一位用户用 Toolery 基准测试了 15 个本地模型的 agent/工具使用能力,每模型跑 429 次试验,全部通过 LM Studio 本地服务。qwen3.8-27b 以 71.8% 排名第一,bonsai-27b 以 50.5% 垫底,在 Very Hard 场景仅 22.2%。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。