Import AI· Jack Clark·· 2026-06-08AI 评分36
Import AI 460:社会层面的 reward hacking、Anthropic 的递归自我改进数据与 RL 四轴无人机竞速
Import AI 460: Reward hacking society, RSI data from Anthropic; and RL-based quadcopter racing
AI 导读
伦敦国王学院、复旦大学与 Alan Turing Institute 推出 SocioHack 基准,包含 72 个沙盒社会环境,测试 LLM 经 RL 训练后能否“钻制度空子”,模型可在无直接提示下以 61.25% 召回率和 90.85% 精确率重新发现历史上被修补的漏洞。
来源:Import AI · importai.substack.com