跳到正文
热点事件持续更新

Anthropic 红队评测 GLM-5.3 二进制利用能力

1 篇报道1 个报道来源9 小时前更新

先了解这件事

AI 综述

Anthropic Frontier Red Team 对 GLM-5.3 等模型进行了网络攻击能力评测,聚焦内部 Binary Exploitation 基准,共 100 个任务。2026 年 9 月 30 日 Simon Willison 报道了评测结果:GLM-5.3 在 4% 的试验中实现了完整控制流劫持,Claude Mythos Preview 则为 6%。相比之下,早期模型 Claude Opus 4.6 和 GLM-5.2 在同类任务中均无一成功。作者据此认为,模型在网络攻击能力上已经跨越了一个有意义的门槛。目前事件仅基于这一份评测报告,尚未有官方回应或后续跟进报道,评测方法细节与安全影响仍有待观察。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. Simon Willison
    Anthropic Frontier Red Team 报告 GLM-5.3 与 Claude Mythos Preview 在二进制利用基准上的表现

    Anthropic Frontier Red Team 在内部 Binary Exploitation 基准的 100 个任务上评测多个模型,GLM-5.3 在 4% 的试验中实现完整控制流劫持,Claude Mythos Preview 为 6%。早期的 Claude Opus 4.6 和 GLM-5.2 均无一成功,作者认为一个有意义的门槛已被跨越。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。