跳到正文
热点事件持续更新

15个本地模型工具调用基准实测:qwen3.8-27b第一,Bonsai 27B垫底

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月5日,一位用户在 Reddit r/LocalLLaMA 发布了针对 15 个本地模型的 agent/工具使用能力实测。测试使用 Toolery 基准,每个模型跑 429 次试验,全部通过 LM Studio 本地服务完成。结果显示,qwen3.8-27b 以 71.8% 的成绩排名第一;bonsai-27b 以 50.5% 垫底,其中在 Very Hard 场景下成功率仅 22.2%。目前该实测为单一报道披露的结果,尚无后续进展。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. Reddit r/LocalLLaMA (开源AI)
    15 个本地模型 agent/工具使用实测:Bonsai 27B 垫底

    一位用户用 Toolery 基准测试了 15 个本地模型的 agent/工具使用能力,每模型跑 429 次试验,全部通过 LM Studio 本地服务。qwen3.8-27b 以 71.8% 排名第一,bonsai-27b 以 50.5% 垫底,在 Very Hard 场景仅 22.2%。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。