跳到正文
热点事件持续更新

实测Qwen3.8 27B纯文字加法能力

1 篇报道1 个报道来源20 小时前更新

先了解这件事

AI 综述

2026年10月5日,Simon Willison发布了一项针对本地模型 Qwen3.8-27B-Q4_K_M.gguf 的基准测试,检验其能否只用英文单词表达整数加法的结果。测试结果显示,在关闭推理模式下,模型在 5,070 个测试用例中的数值准确率为 23.57%,且随位数增加而明显下降:1-3 位数的准确率为 97.04%,而 10-13 位数仅为 6.44%;不过输出格式的符合率达到 96.17%。在开启推理模式的对照测试中,模型表现大幅提升,在 169 例配对测试中答对 167 例。该测试表明,该模型在纯文字加法任务上,开启推理可显著改善数值准确率,但位数越大错误率越高。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. Simon Willison
    Qwen3.8 27B 用英文单词做加法的基准测试

    一项基准测试检验本地 `Qwen3.8-27B-Q4_K_M.gguf` 模型能否只用英文单词表达整数加法结果。关闭推理时在 5,070 个用例上数值准确率为 23.57%,从 1-3 位数的 97.04% 降至 10-13 位数的 6.44%,格式符合率 96.17%;开启推理后在 169 例配对测试中答对 167 例。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。