热点事件持续更新
SWE-Race:188个真实并发bug的编码Agent基准发布
1 篇报道1 个报道来源22 小时前更新
先了解这件事
AI 综述
SWE-Race 是一个基于真实并发 bug 的编程智能体基准,从约 100 个 Python 项目的已合并 PR 中提取并发 bug 构建任务,由项目自身测试在无网络容器中评分。根据最新报道,在单次尝试下 GLM-5.3 Flash 得分 85%,两到三次尝试后为 82%,与 GPT-5.6 Luna 的 81% 在误差范围内接近;在硬任务上三个模型得分分别为 50%、45% 和 23%。
AI 根据报道生成 · 18 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
10月6日
- Reddit r/MachineLearningSWE-Race:基于 188 个真实并发 bug 的编程智能体基准,三款模型成绩出炉
SWE-Race 基准从约 100 个 Python 项目的已合并 PR 中提取真实并发 bug 构建任务,由项目自身测试在无网络容器中评分。单次尝试下 GLM-5.3 Flash 得分 85%,两到三次尝试后为 82%,与 GPT-5.6 Luna(81%)在误差范围内接近;硬任务上三个模型分别为 50%、45% 和 23%。
本事件热度走势
当前热度 5·可比范围峰值 9(10月6日 20:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。