跳到正文

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 1–1 条 · 共 1 条
9月29日周二
  1. The Decoder77

    Anthropic 发布 Claude Sonnet 5.5,基准接近 Opus 5.5 且每任务成本最多降低 30%

    Anthropic 发布 Claude 5.5 家族第二款模型 Claude Sonnet 5.5,输出速度快 30% 以上,因每任务消耗更少 token 而最多节省 30% 成本,多项基准接近 Opus 5.5。

    推荐理由:原文汇总了 Sonnet 5.5 的基准分数、成本结构和新增安全机制,读者可以据此与 Opus 及竞品做成本效益比较。