跳到正文
热点事件持续更新

SWE-sweep:让模型主动发现并修复代码库bug的基准

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

Meta、Stanford、Harvard、UW 的研究者联合推出 SWE-sweep 基准,用于测试大模型 agent 能否在用户遇到之前主动发现并修复真实代码库中的 bug,并按隐藏的真实 bug 集合对模型打分。项目以 MIT 许可开源,榜单与论文计划持续更新。最新报道(2026-10-03,Reddit r/LocalLLaMA)指出,目前测试结果中 Luna xhigh 在成本效率上表现突出、难以被超越,且各模型整体得分普遍低于预期,榜单与论文将在下周继续更新。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月3日
  1. Reddit r/LocalLLaMA (开源AI)
    SWE-sweep:测试大模型在用户遇到 bug 之前就发现并修复它们的新基准

    Meta、Stanford、Harvard、UW 的研究者联合推出 SWE-sweep 基准,让 agent 在真实代码库中主动查找并修复 bug,按隐藏的真实 bug 集合打分。目前 Luna xhigh 在成本效率上难以超越,且模型得分普遍低于预期。项目以 MIT 许可开源,榜单与论文下周将继续更新。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。