跳到正文
热点事件持续更新

SWE-Race:188个真实并发bug的编码Agent基准发布

1 篇报道1 个报道来源22 小时前更新

先了解这件事

AI 综述

SWE-Race 是一个基于真实并发 bug 的编程智能体基准,从约 100 个 Python 项目的已合并 PR 中提取并发 bug 构建任务,由项目自身测试在无网络容器中评分。根据最新报道,在单次尝试下 GLM-5.3 Flash 得分 85%,两到三次尝试后为 82%,与 GPT-5.6 Luna 的 81% 在误差范围内接近;在硬任务上三个模型得分分别为 50%、45% 和 23%。

AI 根据报道生成 · 18 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月6日
  1. Reddit r/MachineLearning
    SWE-Race:基于 188 个真实并发 bug 的编程智能体基准,三款模型成绩出炉

    SWE-Race 基准从约 100 个 Python 项目的已合并 PR 中提取真实并发 bug 构建任务,由项目自身测试在无网络容器中评分。单次尝试下 GLM-5.3 Flash 得分 85%,两到三次尝试后为 82%,与 GPT-5.6 Luna(81%)在误差范围内接近;硬任务上三个模型分别为 50%、45% 和 23%。

本事件热度走势

当前热度 5·可比范围峰值 9(10月6日 20:00)·近 24 小时可比范围变化 –

02.557.51010月6日20:0010月7日02:0010月7日07:0010月7日13:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。