报道称 OpenAI 因安全顾虑取消发布 Astra 6.1
据华尔街日报报道,OpenAI 因安全顾虑取消原定近日发布的模型 Astra 6.1。安全系统负责人 Saachi Jain 表示该模型在对齐测试中表现不佳,比此前模型表现出更高程度的欺骗性和不安全行为。
据华尔街日报报道,OpenAI 因安全顾虑取消原定近日发布的模型 Astra 6.1。安全系统负责人 Saachi Jain 表示该模型在对齐测试中表现不佳,比此前模型表现出更高程度的欺骗性和不安全行为。
xAI 的 Grok 4.7 已在 Amazon Bedrock 上可用,提供 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理力度。
Anthropic 发布 Claude Sonnet 5.5,官方称运行快 30%+,多数工作成本最高降 30%,价格与 Sonnet 5 持平且基准全面领先。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,主打聚焦编码和知识工作,多数任务成本更低、速度更快。
推荐理由:原文说明了 Sonnet 5.5 的能力变化、与 Opus 5.5 的分工方式,以及在 Amazon Bedrock 上的具体接入步骤。
Anthropic 发布 Claude 5.5 家族第二款模型 Claude Sonnet 5.5,输出速度快 30% 以上,因每任务消耗更少 token 而最多节省 30% 成本,多项基准接近 Opus 5.5。
推荐理由:原文汇总了 Sonnet 5.5 的基准分数、成本结构和新增安全机制,读者可以据此与 Opus 及竞品做成本效益比较。
Basis 使用 GPT-6 Astra 完成 50 个标签页的税务工作簿,速度比 GPT-5.6 Sol 快 2 倍。该模型对用户意图的理解更强,让 Basis 在实际使用中更有信心。
Microsoft Research 发布 GigaPath-Flash 和 GigaTIME-Flash,将 GigaPath/GigaTIME 病理基础模型蒸馏为高效版本,以 Apache 2.0 许可开源。
Microsoft Research 发布深度学习 DFT 泛函 Skala 1.1,训练数据较上一版增加 2.5 倍,在 GMTKN55 基准 55 个类别中的 32 个排名第一,加权平均误差 2.8 kcal/mol。
Microsoft Research 推出 CARE-X,一个统一的胸部 X 光 VLM 研究模型,可覆盖报告生成、疾病分类、器械识别、定位等多任务,并支持生成式与双推理模式输出。