LeRobot v0.6.0 发布:世界模型策略、奖励模型 API 与六大仿真基准
Hugging Face LeRobot 团队发布 v0.6.0,引入 VLA-JEPA、FastWAM、LingBot-VA 等世界模型策略,新增 GR00T N1.7、MolmoAct2、EO-1、EVO1 等 VLA,以及统一奖励模型 API(Robometer、TOPReward)。
Hugging Face LeRobot 团队发布 v0.6.0,引入 VLA-JEPA、FastWAM、LingBot-VA 等世界模型策略,新增 GR00T N1.7、MolmoAct2、EO-1、EVO1 等 VLA,以及统一奖励模型 API(Robometer、TOPReward)。
Photoroom 发布 PRX 系列第 4 篇,详解 7B 文生图模型的预训练数据管道:混合公开与内部数据集、用 VLM 重新生成长标注、构建可流式训练语料。
Hugging Face 官方博客总结 🤗 Kernels 项目近数月的主要更新。Hub 新增 kernel 仓库类型并支持浏览全部 kernels;安全方面引入可信发布者机制(默认仅加载可信发布者的 kernel。
Google DeepMind 与 A24 宣布建立首个此类研究合作,让电影创作者参与塑造未来工具的开发。双方将开展跨多个项目的深度研发协作,A24 及其电影人可借此将新技术融入创作流程,Google DeepMind 则获得一线艺术家的反馈指导。此外,Google 已对 A24 进行投资。
Berkeley AI Research(BAIR)实验室庆祝 2026 届博士毕业生,研究方向覆盖机器人与具身智能、LLM 与推理、计算机视觉、生成模型、AI 安全、人机交互及 AI for science 等。
Hugging Face 与 Cerebras 展示一个开放、模块化的实时语音到语音管线,用 Nvidia Parakeet 做语音识别,Gemma 4 31B 在 Cerebras 上推理,Qwen3TTS 做语音合成。
Hugging Face 发布开源基准 ScarfBench(Self-Contained Application Refactoring Benchmark),评测 AI 智能体在企业 Java 的 Spring、Jakarta EE、Quarkus 之间跨框架迁移的能力。
Hugging Face Community Evals 与 Every Eval Ever(EEE)现已互通,提供转换器把 EEE 记录转成 Hub 所需的 YAML 并以 PR 提交,分数会显示在模型页并进入基准排行榜,附来源徽章链接回完整 EEE 记录,机构官方账号提交还会获得验证标记。
Hugging Face 团队推出 DiScoFormer(Density and Score Transformer),给定一组数据点即可在单次前向传播中同时估计分布的密度与 score,无需针对每个分布重新训练。
Google Research 发布新架构,将 Multi-Token Prediction(MTP)头加装到已冻结的 Gemini Nano v3 模型上,无需微调即可加速端侧推理,已推广到 Pixel 9 和 10 系列。
Mistral 发布 OCR 4 文档理解模型,在提取文本之外新增边界框、分块类型分类和逐词置信度,支持 170 种语言。人工盲测中标注者对其偏好平均胜率 72%,OlmOCRBench 总分 85.20;可单容器自托管,API 定价 $4/千页,Batch API 半价 $2/千页,Document AI 为 $5/千页。
推荐理由:官方披露了结构化输出、多语言覆盖和基准局限说明,读者可据此判断它是否适合接入自己的 RAG 或智能体管线。
Jack Clark的Import AI第462期综述多项前沿进展:牛津、UK AISI、斯坦福等机构研究基于18,978场对话、6,923人,发现AI说服力稳定超过专家人类,Opus 4.1和Opus 4.6最强,AI为Save the Children募集真实捐款的效果约为专业募捐员的近3倍。
Google DeepMind 发布 AI Control Roadmap,以纵深防御方式把内部智能体视为可能未对齐的系统进行安全管理。框架基于 MITRE ATT&CK 构建威胁建模,用受信 AI 作为监督者做监测、阻断和响应,并按模型能力划分 D1-D4 检测级别和 R1-R3 响应级别。
英国 AI Security Institute 对齐团队与 Timaeus 成员联合成立非营利组织 Sequent,目标是构建对超级智能 AI 安全性更有把握的对齐技术,初期计划融资 100–150M 美元,几年内扩展到 40–80 名全职员工,研究方向涵盖 scalable oversight、学习理论、博弈论等。
Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用于更敏感、灵活地审计机器学习模型的 machine unlearning。
伦敦国王学院、复旦大学与 Alan Turing Institute 推出 SocioHack 基准,包含 72 个沙盒社会环境,测试 LLM 经 RL 训练后能否“钻制度空子”,模型可在无直接提示下以 61.25% 召回率和 90.85% 精确率重新发现历史上被修补的漏洞。
Mistral 收购 Emmi AI,进军 Physics AI 领域,推出面向工业工程的物理 AI 基础模型能力。这类模型从几何和边界条件直接预测物理行为,单 GPU 上一次前向推理只需秒级,替代耗时数小时到数周的传统 CFD/FEM 仿真。
Mistral 收购 Emmi AI,加大投入面向航空航天、汽车、半导体和能源行业的 Physics AI 基础研究。其已发表成果包括含约 30,000 个样本的跨音速 3D 机翼 CFD 数据集、可在单 GPU 上处理 9M 表面和 140M 体网格单元的 AB-UPT,以及支持实时模拟流化床反应器等工业过程的 NeuralDEM。
Import AI 第 458 期刊登作者在牛津大学人类中心 AI 实验室(HAI Lab)与 Cosmos Institute 合作的 2026 年 Cosmos HAI Lab Lecture 演讲长文,探讨面对 AI 持续进步时"探索未来还是回避当下"的选择。
Mistral AI 宣布与物理 AI 公司 Emmi AI 达成最终收购协议,以加强面向工业企业的 AI 转型布局。Emmi AI 创立于奥地利,团队超过 30 名研究员和工程师,5 月加入 Mistral AI 的 Science 和 Applied AI 团队;其大工程模型可用于实时仿真、数字孪生和加速工程工作流,双方将共同为工程师打造智能体。
Mistral 发布 128B 稠密开源权重模型 Mistral Medium 3.5(公开预览),256k 上下文窗口,SWE-Bench Verified 得分 77.6%,成为 Mistral Vibe 与 Le Chat 的默认模型。
推荐理由:原文给出新模型的参数规模、基准分数和定价,并说明云端异步编码智能体的实际接入方式,便于评估能否纳入现有工作流。
Mistral 发布 Studio 的 Connectors(公开预览版),内置连接器与自定义 MCP 均可通过 API/SDK 用于所有模型和 Agent 调用。新增直接工具调用、requires_confirmation 人工审批流,并支持连接器的程序化管理;连接器集中注册后可在 LeChat、AI Studio 等 Mistral 应用间复用,便于对接 CRM、知识库等企业系统。
本期 Import AI 报道三件事:SentinelOne 分析了约 20 多年前的病毒 fast16.sys,它篡改 LS-DYNA 970、PKPM 和 MOHID 等高精度工程软件的计算结果。
Google DeepMind 在 Project Genie 中上线 Street View grounding 功能,用户可通过 Maps 图钉选择美国地点并配合 Ocean World、B&W film 等风格生成以真实街景为起点的交互世界。
Google DeepMind 在新加坡启动 National Partnerships for AI 新项目,与新加坡政府合作推动医疗、教育、科研和可持续发展领域的 AI 应用。
Google 的 Co-Scientist 正被 Calico Life Sciences 用于衰老生物学研究,帮助连接分散的研究结果并生成可检验的假设。在整合应激反应(ISR)研究中,团队用 Co-Scientist 提出关于 ISR 如何受代谢调节的新假设,并迭代优化实验设计。实验产生了对 ISR 在健康与疾病中作用具有重要意义的新发现,团队计划发表结果。
爱丁堡大学研究者 Filippo Menolascina 使用 Co-Scientist 研究代谢功能障碍相关脂肪性肝炎(MASH),从海量文献中筛选值得关注的机制和候选联合疗法。针对为何 resmetirom 只对部分 MASH 患者有效这一问题,系统提出 NLRP3 炎症小体是耦合炎症与代谢的分子桥梁的假设,后经实验验证,有望推动靶向双药疗法。
MIT 的 Ritu Raman 与 Boston Children's Hospital 的 Ryan Flynn 借助 Co-Scientist 开展 ALS 研究。Co-Scientist 帮 Raman 快速梳理原本需数月才能掌握的庞杂文献,把想法转化为可检验的假设,并按可行性与风险收益排序研究方向。两人正基于细胞表面 RNA 机制,寻找可靶向 ALS 的 RNA 类药物。
Google DeepMind 报道,Stanford 医学院 Gary Peltz 团队用 Co-Scientist 从现有药物文献中筛选可重定位治疗肝纤维化的候选药物,研究发表于 Advanced Science。
Google DeepMind 发布长文,复盘其 AI 气象模型 WeatherNext 如何帮助美国国家飓风中心(NHC)预测飓风 Melissa 在牙买加的登陆。
推荐理由:原文由当事方复盘 AI 模型在真实飓风预报中的应用细节,读者可以了解 AI 气象预测如何进入官方业务流程。
Google DeepMind 发布 Gemini 3.5 模型系列,主打智能体执行能力,首个模型 3.5 Flash 当天开放。该模型在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)、MCP Atlas(83.6%)等编码与智能体基准上超过 Gemini 3.1 Pro,输出速度是其他前沿模型的 4 倍。
推荐理由:官方给出 3.5 Flash 的基准数据和开放渠道,读者可以据此评估它在智能体工作流里替代现有模型的可行性。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,介绍一个基于 Gemini 构建的多智能体系统,可迭代生成、辩论和进化科学假设,并将通过实验性工具 Hypothesis Generation 向个人研究者开放,未来几周开始推出。
推荐理由:原文说明了多智能体的生成、辩论与进化机制和真实合作案例,读者可以据此了解 AI 辅助提出科学假设的具体做法。
Berkeley AI Research 发布一篇关于并行推理的综述与观点文章,重点分析自适应并行推理:让模型自行决定何时分解任务、生成多少并行线程以及如何协调。
Google DeepMind 汇总 AlphaEvolve 一年来的应用成果,覆盖科研与商业多个领域。
推荐理由:原文汇总了 AlphaEvolve 一年来在科研和商业领域的量化应用结果,读者可以据此了解算法发现型智能体的落地范围。
Jack Clark在Import AI 455中撰文称,基于公开数据他判断2028年底前出现自动化AI研发(AI自主训练后继模型)的概率超过60%,2027年的概率约为30%。
Google DeepMind 宣布 AI co-clinician 研究计划,探索在医生临床监督下辅助医患双方的医疗 AI,并发布技术报告《Towards Conversational Medical AI with Eyes, Ears and a Voice》。
Google DeepMind 与韩国科学技术信息通信部(MSIT)宣布建立新合作,属于其 National Partnerships for AI 计划的一部分。
Google 宣布将一项新的视角重构方法上线 Google Photos 的 Auto frame 功能,可自动调整拍摄视角优化人像照片。方法分两阶段:先用内部 3D point map 估计模型重建场景并近似焦距,再用生成式 latent diffusion 模型补全新视角下被遮挡的内容,并自动修正广角前置镜头造成的透视畸变。
推荐理由:原文解释了方法如何用 3D 场景估计加生成补全来改换拍摄视角,读者可以理解它与常规裁剪编辑的本质差异。
Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,将训练拆分为异步的计算孤岛以降低带宽需求并隔离硬件故障。团队用 Gemma 4 模型验证其 ML 性能与常规训练持平,并在四个美国区域用 2-5 Gbps 广域网络完成 12B 参数模型预训练,速度比常规同步方法快 20 倍以上;系统还支持混合 TPU v6e 与 TPU v5p 等不同代硬件参与同一训练。
Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte 和 McKinsey 合作,帮助企业大规模采用前沿 AI。合作包括三大支柱:开发行业定制 AI 方案、合作伙伴可提前使用 Gemini 系列等前沿模型、以及 AI 领导层对接客户 CEO 和董事会。合作将聚焦金融、制造、零售、媒体和娱乐等领域。