GRASP:让世界模型实现更长时程的梯度规划
Berkeley AI Research 提出基于梯度的规划器 GRASP,用于让学习到的世界模型支持长时程规划。它通过把轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代中直接注入随机性以探索、并重塑梯度以避开高维视觉模型中脆弱的 state-input 梯度,解决长时程 rollout 中梯度爆炸/消失与不良局部极小值问题。
Berkeley AI Research 提出基于梯度的规划器 GRASP,用于让学习到的世界模型支持长时程规划。它通过把轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代中直接注入随机性以探索、并重塑梯度以避开高维视觉模型中脆弱的 state-input 梯度,解决长时程 rollout 中梯度爆炸/消失与不良局部极小值问题。
Google DeepMind 发布 Gemini 3.1 Flash TTS 文本转语音模型,主打可控性、表现力和音质提升。
推荐理由:原文给出音频标签控制方式和具体成绩,读者可以据此判断新版 TTS 在表现力与可控性上的实际变化。
Google DeepMind 发布由 Gemini 驱动的实验性 AI 指针,并提出四条交互原则:保持工作流、指向即上下文、自然指代交流、把像素变成可操作实体。用户现可在 Google AI Studio 和 Chrome 中用指针加语音向 Gemini 提问,Googlebook 的 Magic Pointer 也即将推出。
推荐理由:文章给出 AI 指针的四条交互原则,并结合 Chrome 与 Googlebook 说明落地入口,读者可据此理解指针交互的变化。
Mistral AI 发布其首个文本转语音模型 Voxtral TTS,4B 参数,支持 9 种语言。人类评测显示自然度优于 ElevenLabs v2.5 Flash、与 ElevenLabs v3 质量相当;模型延迟 70ms,10 秒参考音频即可克隆声音,支持零样本跨语言语音适配,可通过 API 使用($0.016 per 1k characters),并提供带参考声音的开放权重版本。
推荐理由:官方给出人评对比、延迟数字和架构细节,读者可据此评估其语音智能体场景的可用性。
Mistral AI 推出 Forge,帮助企业基于专有知识训练前沿级 AI 模型,覆盖 pre-training、post-training 和强化学习等模型生命周期阶段。
Mistral 发布开源模型 Mistral Small 4,将 Magistral 推理、Pixtral 多模态和 Devstral 智能体编码能力统一到一个模型中,采用 Apache 2.0 许可证。
推荐理由:原文给出了完整的架构参数、效率对比和部署配置,读者可以据此评估一个开源混合推理模型是否值得替换现有专用模型组合。
Mistral AI 宣布作为创始成员加入 NVIDIA Nemotron Coalition,双方计划结合 Mistral AI 的模型架构与全栈平台、NVIDIA 的算力和合成数据管线共同开发开源前沿模型。
Mistral 发布 Leanstral,一个面向 Lean 4 的开源代码智能体,权重以 Apache 2.0 许可开放,激活参数约 6B,可通过 Mistral Vibe 和免费 labs-leanstral-2603 API 端点使用,并将发布技术报告和评测套件 FLTEval。
推荐理由:以 FLTEval 真实 PR 证明任务对比 Claude 系列与开源模型,并给出运行成本数字,读者可据此评估性价比。
Berkeley AI Research 介绍 SPEX(Spectral Explainer)与 ProxySPEX 两种算法,利用稀疏性和低阶性等结构观察,用尽可能少的消融实验识别 LLM 特征、数据和模型内部组件中的关键交互,将交互发现规模提升到比以往方法高数个数量级。
Google 与 Beth Israel Deaconess Medical Center 合作,在真实门诊环境中对对话式诊断 AI 系统 AMIE 开展前瞻性单中心可行性研究,100 名成年患者完成了就诊前与 AMIE 的问诊交互,由医生通过视频实时监督,全程未触发预设的四项安全停止标准。
推荐理由:原文给出真实门诊中 AMIE 的安全数据与诊断准确率,读者可以据此了解对话式医疗 AI 落地临床的证据进展。
Mistral 基于开源编码助手 Vibe 构建了一个自主智能体,可读取 Rails 源文件并生成或改进 RSpec 测试,在 CI/CD 流水线中无人工干预运行。
Mistral 发布 Mistral Vibe 2.0,是其终端原生编码智能体的大版本升级,由 Devstral 2 模型家族驱动。新增自定义子智能体、多选项意图澄清、斜杠命令技能、统一智能体模式和自动更新;产品上线 Le Chat Pro 和 Team 套餐,支持按量付费或自带 API key。
推荐理由:官方发布给出了 Vibe 2.0 的新能力清单和各档定价,读者可以据此评估它对现有终端编码工作流的适配程度。
Mistral AI 团队排查 vLLM 在 P/D 分离部署(经 NIXL/UCX)下 Mistral Medium 3.1 的内存泄漏,生产级流量下系统内存以每分钟 400 MB 线性增长,数小时后触发 OOM。
推荐理由:原文完整记录从 Heaptrack、pmap、BPFtrace 到 GDB 的逐层排查路径,读者可迁移用于追踪堆外内存泄漏。
Berkeley AI Research 在 NeurIPS 2025 论文中提出直接基于信息量评估与优化成像系统的框架,利用已知噪声模型从测量数据估计互信息。该指标在彩色摄影、射电天文、无透镜成像和显微成像四个领域均能预测下游解码性能,优化所得设计可媲美 SOTA 端到端方法,且内存、算力更省,无需任务专用解码器设计。
Mistral 发布 Mistral OCR 3,在表单、扫描件、复杂表格和手写内容上对 Mistral OCR 2 的整体胜率为 74%。
推荐理由:官方公布了对 Mistral OCR 2 的胜率提升和定价细节,读者可据此评估其在文档解析流程中的替代价值。
Mistral 发布 Mistral 3 系列模型,包含 Mistral Large 3(675B 总参数、41B 激活的 MoE)和 Ministral 3 系列(3B、8B、14B),全部以 Apache 2.0 许可开源,并发布 base、instruct 及 reasoning 变体。
推荐理由:原文给出了各型号参数、开源许可和部署路径,读者可以据此判断哪个尺寸适合自己的场景。
Berkeley AI Research 提出一种基于“分治”而非时序差分(TD)学习的强化学习算法,用于 off-policy RL。传统 TD 学习通过 bootstrapping 使误差沿整个轨迹累积,难以扩展到长时序任务;n-step TD 也只能线性减少 Bellman 递归次数。
Mistral 发布 Mistral AI Studio,将支撑其大规模 AI 系统的基础设施、可观测性和运维规范打包给企业团队。
Mistral AI 官宣完成 17 亿欧元 C 轮融资,投后估值 117 亿欧元,本轮由 ASML 领投。
推荐理由:融资由 Mistral AI 官方公布,给出了金额、估值和 ASML 领投的战略合作背景,读者可了解其后续方向。
Mistral 宣布在 Le Chat 推出 Memories 记忆功能 beta 版,采用自动保存与可见、可溯源召回的混合方式,支持随时关闭、隐身聊天、编辑删除单条记忆以及导出导入。同时上线 Memory Insights 轻量提示词帮助用户探索记忆内容,移动端可通过 App Store 或 Google Play 下载体验,后续将按类别整理记忆并优化召回速度。
Mistral AI 为 Le Chat 发布 20+ 安全的 MCP 驱动连接器(beta)和 Memories(beta)功能。
Mistral 展示了用 LoRA 微调 Pixtral-12B 处理卫星图像的效果,在 Aerial Image Dataset(AID)的 8000 训练样本和 2000 测试样本分类任务上,相比未微调的基线模型显著提升。
Mistral AI 发布 Codestral 25.08,并推出涵盖补全、语义检索和智能体工作流的企业编码栈,包含 Codestral Embed、Devstral 和 Mistral Code IDE 插件。
Mistral AI 联合 Carbone 4 和 ADEME 完成 AI 模型首个综合生命周期分析(LCA),披露 Mistral Large 2 训练及 18 个月使用的环境足迹。
Mistral 发布语音理解模型 Voxtral,含 24B 和 3B 两个版本,均以 Apache 2.0 许可开源并上线 API,定价低至每分钟 $0.001。
推荐理由:开源语音理解模型同时给出基准对比和每分钟定价,读者可以据此评估它相对 Whisper 和商用 API 的成本与性能位置。
Mistral AI 推出 AI for Citizens 合作计划,帮助各国政府和公共机构因地制宜地利用 AI 改造公共服务、推动创新。该计划针对封闭“一刀切”AI 带来的供应商锁定、地缘政治风险与数据主权问题,提供自托管、AI 数据中心、SaaS 和 serverless API 等多种部署选择,并支持模型协同训练与本地化定制。目前已在法国、卢森堡、新加坡、荷兰、瑞士等多国政府与公共部门落地。
Mistral AI 发布 AI 基础设施服务 Mistral Compute,提供私有集成栈,涵盖 GPU、编排、API、产品与服务,形态从裸金属服务器到全托管 PaaS。作为 NVIDIA 重要合作伙伴,首批提供数万块 GPU 并计划快速扩展;其强调主权与可持续发展,采用脱碳能源并满足欧洲监管要求,首批合作伙伴包括 BNP Paribas、Orange、Thales、SNCF 等。
Mistral AI 发布首个推理模型 Magistral,分为 24B 参数开源的 Magistral Small(Apache 2.0)和企业版 Magistral Medium。
推荐理由:官方同时发布开源与企业版推理模型并给出透明推理和多语言能力细节,读者可以据此评估其在多步推理场景的适用性。
Mistral AI 发布 Mistral Medium 3,定位 SOTA 性能、成本降低 8 倍的新一级模型,在多项基准上达到 Claude Sonnet 3.7 的 90% 以上,价格 $0.4 input / $2 output per M token。
推荐理由:官方给出基准对比、价格与最低 4 GPU 部署要求,读者可据此评估它在成本和企业落地上与竞品的差距。
Mistral 介绍用「LLM as a Judge」评估 RAG 系统的方法:由 judge LLM 按数值、二元或定性量表给 generator LLM 的答案打分,再取平均得到总分。
Mistral AI 发布开源模型 Mistral Small 3.1(24B),文本性能提升,新增多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens 每秒,官方称在同类对比中超过 Gemma 3 和 GPT-4o Mini。
推荐理由:原文给出性能数字、开源许可与部署门槛,读者可以据此评估这款 24B 模型在端侧和私有部署中的适用性。