热点事件持续更新
Anthropic 红队评测 GLM-5.3 二进制利用能力
1 篇报道1 个报道来源9 小时前更新
先了解这件事
AI 综述
Anthropic Frontier Red Team 对 GLM-5.3 等模型进行了网络攻击能力评测,聚焦内部 Binary Exploitation 基准,共 100 个任务。2026 年 9 月 30 日 Simon Willison 报道了评测结果:GLM-5.3 在 4% 的试验中实现了完整控制流劫持,Claude Mythos Preview 则为 6%。相比之下,早期模型 Claude Opus 4.6 和 GLM-5.2 在同类任务中均无一成功。作者据此认为,模型在网络攻击能力上已经跨越了一个有意义的门槛。目前事件仅基于这一份评测报告,尚未有官方回应或后续跟进报道,评测方法细节与安全影响仍有待观察。
AI 根据报道生成 · 2 小时前更新
最新进展9月30日 06:20
新报告显示 GLM-5.3 在二进制利用基准 4% 试验中实现控制流劫持。报道时间线
沿着报道,了解事件的不同侧面。
9月30日
- Simon WillisonAnthropic Frontier Red Team 报告 GLM-5.3 与 Claude Mythos Preview 在二进制利用基准上的表现
Anthropic Frontier Red Team 在内部 Binary Exploitation 基准的 100 个任务上评测多个模型,GLM-5.3 在 4% 的试验中实现完整控制流劫持,Claude Mythos Preview 为 6%。早期的 Claude Opus 4.6 和 GLM-5.2 均无一成功,作者认为一个有意义的门槛已被跨越。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。