热点事件持续更新
SWE-sweep:让模型主动发现并修复代码库bug的基准
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
Meta、Stanford、Harvard、UW 的研究者联合推出 SWE-sweep 基准,用于测试大模型 agent 能否在用户遇到之前主动发现并修复真实代码库中的 bug,并按隐藏的真实 bug 集合对模型打分。项目以 MIT 许可开源,榜单与论文计划持续更新。最新报道(2026-10-03,Reddit r/LocalLLaMA)指出,目前测试结果中 Luna xhigh 在成本效率上表现突出、难以被超越,且各模型整体得分普遍低于预期,榜单与论文将在下周继续更新。
AI 根据报道生成 · 1 小时前更新
最新进展10月3日 00:05
新基准SWE-sweep发布:Luna xhigh成本效率领先,模型得分普遍低于预期,榜单下周更新。报道时间线
沿着报道,了解事件的不同侧面。
10月3日
- Reddit r/LocalLLaMA (开源AI)SWE-sweep:测试大模型在用户遇到 bug 之前就发现并修复它们的新基准
Meta、Stanford、Harvard、UW 的研究者联合推出 SWE-sweep 基准,让 agent 在真实代码库中主动查找并修复 bug,按隐藏的真实 bug 集合打分。目前 Luna xhigh 在成本效率上难以超越,且模型得分普遍低于预期。项目以 MIT 许可开源,榜单与论文下周将继续更新。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。