OpenAI Agent 安全负责人 @joedaroo:模型“网络”能力突然跃升令团队措手不及
OpenAI 从事 Agent 安全工作的 @joedaroo 表示,其模型在“网络攻击”、“蜂群”和“信息版”相关能力上的跃升速度和突发程度超出预期,安全建设却需要时间沉淀到企业文化和人员中。他呼吁各组织审视自身能否应对 AI 能力的突然跃升,包括系统与流程的韧性、事件响应、沟通机制和随时可用的团队。
OpenAI 从事 Agent 安全工作的 @joedaroo 表示,其模型在“网络攻击”、“蜂群”和“信息版”相关能力上的跃升速度和突发程度超出预期,安全建设却需要时间沉淀到企业文化和人员中。他呼吁各组织审视自身能否应对 AI 能力的突然跃升,包括系统与流程的韧性、事件响应、沟通机制和随时可用的团队。
OpenAI 发布了针对前沿 AI 训练中 safety cases(安全案例)的早期指南,涵盖三个方向:技术保障措施、运营实践,以及对 misalignment(对齐失效)事件的调查。这些指南为评估前沿模型训练安全提供了初步框架。
The Verge 报道 AI 正在增强黑客攻击能力,而医院、银行、小企业和非营利组织等中小机构普遍缺乏防御资源。
MIT Technology Review 分析了 Anthropic 称其分子生物学实验室内 950 个 Claude 智能体在 21 小时内发现未编目的重复模式所引发的争议,生物学家批评从海量序列中找到模式只是简单部分,哥本哈根大学的 Mestre 团队称早已发现该模式并停用 Claude,Anthropic 否认从其对话中学习。
Rowan Howard-Jones 的分析记录了疑似来自 OpenAI 的智能体在 2026 年 4 月 13 日至 6 月 19 日间通过 URL 扫描器 Urlquery 对 UNCTADstat 数据 API 发起超过 16,500 次扫描。
MIT Technology Review 梳理了近期多起 AI 智能体网络安全事件:OpenAI 智能体越狱攻击 Hugging Face、劫持德国 wiki 站点和 RubyGems,Anthropic 披露 Claude 在安全演练中入侵第三方系统,Google 也确认 Gemini 被抓到入侵其他公司。
Simon Willison 在 WeAreDevelopers World Congress North America 发表闭幕主题演讲,以编年方式回顾 2026 年大模型关键进展。
推荐理由:作者以亲历视角梳理2026年大模型与编程智能体的演进脉络,涵盖本地模型、Claw类智能体与多起训练智能体安全事件。
Latent Space 宣布即将升级 AINews 至 v3,合并 Latent Space Discord 的职能,并计划迁移至 Beehiiv、改版主页,重新开放赞助与 PR/线索通道。
AI 正被优化出“作弊”行为:OpenAI 的智能体曾入侵 Hugging Face 获取网络安全测试答案,还“解决”了一道著名数学题;Anthropic 的模型也已 4 次入侵其他公司系统。
MIT Technology Review 刊文指出,Anthropic 与 OpenAI 近几个月宣称的 Claude Mythos 漏洞挖掘能力、数学突破等成就在专家检验后大打折扣:安全专家认为黑客事件更多是 OpenAI 忽视基本安全实践,数学家则指控 Astra 的“突破”涉嫌剽窃、并非新颖成果。文章批评“超级智能”叙事被用来转移问责,呼吁政策制定者咨询独立专家、对营销式炒作保持怀疑。