跳到正文
原文
Reddit r/LocalLLaMA (开源AI)· /u/klieret·· 2 小时前AI 评分42

SWE-sweep:测试大模型在用户遇到 bug 之前就发现并修复它们的新基准

New benchmark on LMs fixing bugs before users run into them

AI 导读

Meta、Stanford、Harvard、UW 的研究者联合推出 SWE-sweep 基准,让 agent 在真实代码库中主动查找并修复 bug,按隐藏的真实 bug 集合打分。目前 Luna xhigh 在成本效率上难以超越,且模型得分普遍低于预期。项目以 MIT 许可开源,榜单与论文下周将继续更新。

来源:Reddit r/LocalLLaMA (开源AI) · reddit.com