跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 21–27 条 · 共 27 条
6月23日周二
  1. Mistral AI64

    Mistral 发布 OCR 4 文档理解模型,新增边界框与置信度输出

    Mistral 发布 OCR 4 文档理解模型,在提取文本之外新增边界框、分块类型分类和逐词置信度,支持 170 种语言。人工盲测中标注者对其偏好平均胜率 72%,OlmOCRBench 总分 85.20;可单容器自托管,API 定价 $4/千页,Batch API 半价 $2/千页,Document AI 为 $5/千页。

    推荐理由:官方披露了结构化输出、多语言覆盖和基准局限说明,读者可据此判断它是否适合接入自己的 RAG 或智能体管线。

5月22日周五
  1. Mistral AI71

    Mistral 发布 Mistral Medium 3.5,并推出 Vibe 云端远程编码智能体

    Mistral 发布 128B 稠密开源权重模型 Mistral Medium 3.5(公开预览),256k 上下文窗口,SWE-Bench Verified 得分 77.6%,成为 Mistral Vibe 与 Le Chat 的默认模型。

    推荐理由:原文给出新模型的参数规模、基准分数和定价,并说明云端异步编码智能体的实际接入方式,便于评估能否纳入现有工作流。

5月16日周六
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3.5 系列,率先推出 3.5 Flash

    Google DeepMind 发布 Gemini 3.5 模型系列,主打智能体执行能力,首个模型 3.5 Flash 当天开放。该模型在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)、MCP Atlas(83.6%)等编码与智能体基准上超过 Gemini 3.1 Pro,输出速度是其他前沿模型的 4 倍。

    推荐理由:官方给出 3.5 Flash 的基准数据和开放渠道,读者可以据此评估它在智能体工作流里替代现有模型的可行性。

5月12日周二
  1. Google DeepMind71

    Google DeepMind 在 Nature 发布基于 Gemini 的多智能体系统 Co-Scientist

    Google DeepMind 在 Nature 发表 Co-Scientist 研究,介绍一个基于 Gemini 构建的多智能体系统,可迭代生成、辩论和进化科学假设,并将通过实验性工具 Hypothesis Generation 向个人研究者开放,未来几周开始推出。

    推荐理由:原文说明了多智能体的生成、辩论与进化机制和真实合作案例,读者可以据此了解 AI 辅助提出科学假设的具体做法。

5月6日周三
3月17日周二
  1. Mistral AI61

    Mistral 发布开源 Lean 4 证明智能体 Leanstral(120B-A6B)

    Mistral 发布 Leanstral,一个面向 Lean 4 的开源代码智能体,权重以 Apache 2.0 许可开放,激活参数约 6B,可通过 Mistral Vibe 和免费 labs-leanstral-2603 API 端点使用,并将发布技术报告和评测套件 FLTEval。

    推荐理由:以 FLTEval 真实 PR 证明任务对比 Claude 系列与开源模型,并给出运行成本数字,读者可据此评估性价比。

1月28日周三
  1. Mistral AI67

    Mistral 发布 Mistral Vibe 2.0 终端编码智能体,由 Devstral 2 驱动

    Mistral 发布 Mistral Vibe 2.0,是其终端原生编码智能体的大版本升级,由 Devstral 2 模型家族驱动。新增自定义子智能体、多选项意图澄清、斜杠命令技能、统一智能体模式和自动更新;产品上线 Le Chat Pro 和 Team 套餐,支持按量付费或自带 API key。

    推荐理由:官方发布给出了 Vibe 2.0 的新能力清单和各档定价,读者可以据此评估它对现有终端编码工作流的适配程度。