Google DeepMind 发布 Gemini Robotics-ER 1.6,强化机器人具身推理
Google DeepMind 发布 Gemini Robotics-ER 1.6,面向机器人具身推理,在指向、计数、成功检测等空间与物理推理能力上较 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash 明显提升。
Google DeepMind 发布 Gemini Robotics-ER 1.6,面向机器人具身推理,在指向、计数、成功检测等空间与物理推理能力上较 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash 明显提升。
Google Research 推出 ConvApparel 数据集,用于量化并弥合 LLM 用户模拟器与真实人类行为的真实感差距。该数据集包含超过 4,000 段人机多轮对话(近 15,000 turns),采用“Good/Bad”双智能体采集协议,并配有逐轮的满意度、挫败感等第一人称标注。
Google Research 发布两个学术 AI 智能体框架:PaperVizAgent(原 PaperBanana)用于从论文文本生成可发表的学术图表,由检索、规划、风格、可视化、评审五个 Agent 协作迭代生成;ScholarPeer 则模拟资深审稿人,结合网络文献检索自动评审论文。
Google Research 提出一个评估 25 个 LLM 行为倾向对齐的框架,将 IRI、ERQ 等标准化心理问卷改编为情境判断测试(SJT),由 550 名参与者中每人 10 名标注者提供人类偏好分布。
Google DeepMind 发布 Gemma 4 开源模型,称其为迄今最智能的开放模型,采用 Apache 2.0 许可证。
推荐理由:官方发布给出四个尺寸、排行榜名次和部署路径,读者可以据此评估在自有硬件上跑前沿推理能力的可行性。
Google Research 在论文《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》中研究 AI 评测的广度与深度权衡,即标注条目数量 N(100 至 50,000)与每条标注者数量 K(1 至 500)如何影响可复现性。
Mistral AI 发布 Spaces,一款能脚手架项目、启动开发环境、生成配置并部署 staging 的 CLI。核心设计包括:每个交互式输入都提供等价 flag 和智能默认值、显式化 CWD 与配置路径等隐式状态、插件注册表作为唯一数据源,以及每次 init 生成 context. 和 AGENTS.md 供 Agent 读取。
Google DeepMind 发布由 Gemini 驱动的实验性 AI 指针,并提出四条交互原则:保持工作流、指向即上下文、自然指代交流、把像素变成可操作实体。用户现可在 Google AI Studio 和 Chrome 中用指针加语音向 Gemini 提问,Googlebook 的 Magic Pointer 也即将推出。
推荐理由:文章给出 AI 指针的四条交互原则,并结合 Chrome 与 Googlebook 说明落地入口,读者可据此理解指针交互的变化。
Google 宣布推出 Vibe Coding XR,将 Gemini 与网页版 XR Blocks 框架结合,通过专门系统提示词和精选代码模板,把自然语言在 60 秒内转化为可感知物理的 Android XR 应用。该工作流支持深度感知、手部交互和物理模拟,并提供桌面 Chrome 模拟器用于快速原型测试。团队将在 ACM CHI 2026 的 Google 展位进行现场演示,应用现已可试用。
Google Research 推出压缩算法 TurboQuant(将亮相 ICLR 2026),在高维向量压缩中实现模型大小大幅缩减且零精度损失,支持 KV cache 压缩与向量搜索。
Google Research 在 Earth AI 计划下推出自监督框架 S2Vec,用 S2 Geometry 将地球划分为层级 cell 并把建成环境要素栅格化为多层图像,再通过 masked autoencoding 学习通用 embedding。
Mistral AI 发布其首个文本转语音模型 Voxtral TTS,4B 参数,支持 9 种语言。人类评测显示自然度优于 ElevenLabs v2.5 Flash、与 ElevenLabs v3 质量相当;模型延迟 70ms,10 秒参考音频即可克隆声音,支持零样本跨语言语音适配,可通过 API 使用($0.016 per 1k characters),并提供带参考声音的开放权重版本。
推荐理由:官方给出人评对比、延迟数字和架构细节,读者可据此评估其语音智能体场景的可用性。
Mistral AI 推出 Forge,帮助企业基于专有知识训练前沿级 AI 模型,覆盖 pre-training、post-training 和强化学习等模型生命周期阶段。
Mistral 发布开源模型 Mistral Small 4,将 Magistral 推理、Pixtral 多模态和 Devstral 智能体编码能力统一到一个模型中,采用 Apache 2.0 许可证。
推荐理由:原文给出了完整的架构参数、效率对比和部署配置,读者可以据此评估一个开源混合推理模型是否值得替换现有专用模型组合。
Mistral AI 宣布作为创始成员加入 NVIDIA Nemotron Coalition,双方计划结合 Mistral AI 的模型架构与全栈平台、NVIDIA 的算力和合成数据管线共同开发开源前沿模型。
Google 与 Cornell 合作在 PNAS 发表研究,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和一个自建 RAG 系统回答高温超导(cuprate)专家级问题,由 12 位专家基于 67 个问题、按 6 项指标以 0-2 分盲评。
Mistral 发布 Leanstral,一个面向 Lean 4 的开源代码智能体,权重以 Apache 2.0 许可开放,激活参数约 6B,可通过 Mistral Vibe 和免费 labs-leanstral-2603 API 端点使用,并将发布技术报告和评测套件 FLTEval。
推荐理由:以 FLTEval 真实 PR 证明任务对比 Claude 系列与开源模型,并给出运行成本数字,读者可据此评估性价比。
Berkeley AI Research 介绍 SPEX(Spectral Explainer)与 ProxySPEX 两种算法,利用稀疏性和低阶性等结构观察,用尽可能少的消融实验识别 LLM 特征、数据和模型内部组件中的关键交互,将交互发现规模提升到比以往方法高数个数量级。
Google 宣布在 Flood Hub 上推出 Urban Flash Flood 城市山洪预报,用 AI 方法提前最多 24 小时预测城市山洪风险。
Google Research 推出 Groundsource,利用 Gemini 从新闻报告中提取结构化数据,发布了覆盖 150 多国、2000 年至今共 260 万条记录的城市山洪开放数据集。
Google 与 Beth Israel Deaconess Medical Center 合作,在真实门诊环境中对对话式诊断 AI 系统 AMIE 开展前瞻性单中心可行性研究,100 名成年患者完成了就诊前与 AMIE 的问诊交互,由医生通过视频实时监督,全程未触发预设的四项安全停止标准。
推荐理由:原文给出真实门诊中 AMIE 的安全数据与诊断准确率,读者可以据此了解对话式医疗 AI 落地临床的证据进展。
Mistral 基于开源编码助手 Vibe 构建了一个自主智能体,可读取 Rails 源文件并生成或改进 RSpec 测试,在 CI/CD 流水线中无人工干预运行。
Mistral 发布 Voxtral Transcribe 2,包含 Voxtral Mini Transcribe V2 与 Voxtral Realtime 两款语音转写模型,支持说话人分离、上下文偏置、词级时间戳和 13 种语言。
推荐理由:官方发布两款语音转写模型,给出延迟、错误率、价格和开放权重等具体参数,便于对比选型。
Mistral 发布 Mistral Vibe 2.0,是其终端原生编码智能体的大版本升级,由 Devstral 2 模型家族驱动。新增自定义子智能体、多选项意图澄清、斜杠命令技能、统一智能体模式和自动更新;产品上线 Le Chat Pro 和 Team 套餐,支持按量付费或自带 API key。
推荐理由:官方发布给出了 Vibe 2.0 的新能力清单和各档定价,读者可以据此评估它对现有终端编码工作流的适配程度。
Mistral AI 团队排查 vLLM 在 P/D 分离部署(经 NIXL/UCX)下 Mistral Medium 3.1 的内存泄漏,生产级流量下系统内存以每分钟 400 MB 线性增长,数小时后触发 OOM。
推荐理由:原文完整记录从 Heaptrack、pmap、BPFtrace 到 GDB 的逐层排查路径,读者可迁移用于追踪堆外内存泄漏。
Berkeley AI Research 在 NeurIPS 2025 论文中提出直接基于信息量评估与优化成像系统的框架,利用已知噪声模型从测量数据估计互信息。该指标在彩色摄影、射电天文、无透镜成像和显微成像四个领域均能预测下游解码性能,优化所得设计可媲美 SOTA 端到端方法,且内存、算力更省,无需任务专用解码器设计。
Mistral 发布 Mistral OCR 3,在表单、扫描件、复杂表格和手写内容上对 Mistral OCR 2 的整体胜率为 74%。
推荐理由:官方公布了对 Mistral OCR 2 的胜率提升和定价细节,读者可据此评估其在文档解析流程中的替代价值。
Mistral AI 发布 Devstral 2(123B,修改版 MIT 许可)和 Devstral Small 2(24B,Apache 2.0)两款开源编码模型,均支持 256K 上下文窗口,SWE-bench Verified 分别达到 72.2% 和 68.0%。
推荐理由:官方给出两款模型的参数规模、SWE-bench Verified 成绩、许可协议和部署门槛,便于读者评估开源编码模型的性价比与落地方式。
Mistral 发布 Mistral 3 系列模型,包含 Mistral Large 3(675B 总参数、41B 激活的 MoE)和 Ministral 3 系列(3B、8B、14B),全部以 Apache 2.0 许可开源,并发布 base、instruct 及 reasoning 变体。
推荐理由:原文给出了各型号参数、开源许可和部署路径,读者可以据此判断哪个尺寸适合自己的场景。
Mistral AI 宣布通过多项长期战略承诺扩展在德国的业务,包括与 SAP 建设面向德国和欧洲的全主权 AI 技术栈,将模型集成进 SAP AI Foundation,并与 Helsing 加速开发面向国防安全的视觉-语言-动作模型。公司还将在未来几个月于德国开设办公室并大幅扩充本地团队。
Berkeley AI Research 提出一种基于“分治”而非时序差分(TD)学习的强化学习算法,用于 off-policy RL。传统 TD 学习通过 bootstrapping 使误差沿整个轨迹累积,难以扩展到长时序任务;n-step TD 也只能线性减少 Bellman 递归次数。
Mistral 发布 Mistral AI Studio,将支撑其大规模 AI 系统的基础设施、可观测性和运维规范打包给企业团队。
Mistral AI 官宣完成 17 亿欧元 C 轮融资,投后估值 117 亿欧元,本轮由 ASML 领投。
推荐理由:融资由 Mistral AI 官方公布,给出了金额、估值和 ASML 领投的战略合作背景,读者可了解其后续方向。
Mistral 宣布在 Le Chat 推出 Memories 记忆功能 beta 版,采用自动保存与可见、可溯源召回的混合方式,支持随时关闭、隐身聊天、编辑删除单条记忆以及导出导入。同时上线 Memory Insights 轻量提示词帮助用户探索记忆内容,移动端可通过 App Store 或 Google Play 下载体验,后续将按类别整理记忆并优化召回速度。
Mistral AI 为 Le Chat 发布 20+ 安全的 MCP 驱动连接器(beta)和 Memories(beta)功能。
Mistral 展示了用 LoRA 微调 Pixtral-12B 处理卫星图像的效果,在 Aerial Image Dataset(AID)的 8000 训练样本和 2000 测试样本分类任务上,相比未微调的基线模型显著提升。
Mistral AI 发布 Codestral 25.08,并推出涵盖补全、语义检索和智能体工作流的企业编码栈,包含 Codestral Embed、Devstral 和 Mistral Code IDE 插件。
Mistral AI 联合 Carbone 4 和 ADEME 完成 AI 模型首个综合生命周期分析(LCA),披露 Mistral Large 2 训练及 18 个月使用的环境足迹。
Mistral 为 Le Chat 发布一批新功能,包括预览版 Deep Research 深度研究报告、基于 Voxtral 的语音模式、由 Magistral 驱动的多语言推理 Think 模式、Projects 项目管理,以及与 Black Forest Labs 合作的图像编辑。功能已在 chat.mistral.ai 和移动应用开放,无需信用卡。
推荐理由:Mistral 官方一次性说明 Le Chat 五项新功能的具体用途和背后模型,读者可对照判断哪些适合纳入自己的日常使用。
Mistral 发布语音理解模型 Voxtral,含 24B 和 3B 两个版本,均以 Apache 2.0 许可开源并上线 API,定价低至每分钟 $0.001。
推荐理由:开源语音理解模型同时给出基准对比和每分钟定价,读者可以据此评估它相对 Whisper 和商用 API 的成本与性能位置。