Google DeepMind:从 Atari 到 EVE Online,回顾 15 年游戏 AI 研究
Google DeepMind 盘点 15 年来以游戏驱动 AI 研究的历程:从 DQN 玩 49 款 Atari 2600 游戏、AlphaGo 2016 年战胜李世石,到 AlphaStar 在 StarCraft II 达到 Grandmaster,再到 AlphaFold 解决蛋白质结构预测难题。
Google DeepMind 盘点 15 年来以游戏驱动 AI 研究的历程:从 DQN 玩 49 款 Atari 2600 游戏、AlphaGo 2016 年战胜李世石,到 AlphaStar 在 StarCraft II 达到 Grandmaster,再到 AlphaFold 解决蛋白质结构预测难题。
Hugging Face 团队详解 Papers with Code 混合搜索架构,结合 PostgreSQL 全文检索、pgvector 与 RRF 融合实现语义搜索。
推荐理由:作者复盘 Papers with Code 混合搜索的完整架构与生产经验,读者可以借鉴其在嵌入契约、冷启动和混合检索上的可迁移做法。
Hugging Face 发布研究,提出三项测试量化 ASR 模型的基准优化(benchmaxxing)现象。评估 11 个开源模型发现,多个高分模型会在音频不支持时复现 VoxPopuli 和 LibriSpeech 的基准参考转写,包括在数字被静音后仍输出该数字;VoxPopuli 约 40% 受检片段存在参考转写疑似错误。
Liquid AI 发布 LFM2.5 家族三款模型的 DSpark 草稿模型 checkpoint,覆盖 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B,通过投机解码在不变输出质量的前提下大幅提速。
推荐理由:官方为三款 LFM2.5 模型开源 DSpark 草稿模型,给出完整加速数据和 SGLang、llama.cpp 用法,可迁移到端侧部署。
Microsoft Research 发布深度学习 DFT 泛函 Skala 1.1,训练数据较上一版增加 2.5 倍,在 GMTKN55 基准 55 个类别中的 32 个排名第一,加权平均误差 2.8 kcal/mol。
Mistral 发布 Agentic Search,通过 search、open、navigate、read、grep 五个工具实现多步检索循环,可在长文档和多来源间查找并验证信息,经 Mistral Search Toolkit 和 Studio、Vibe 中的 Libraries 提供。
推荐理由:官方给出基于 FinanceBench 和 OfficeQA Pro 的实测数字,读者可以对比传统 RAG 评估这套检索层是否值得接入。
IBM Research 发布 ALTK-Evolve 实验复盘,核心结论是智能体记忆不是开关,而是需按模型能力校准的剂量。在 AppWorld 585 个任务上,强模型如 DeepSeek-V3.2 用全量指南集 TGC 提升 +9.5pp,gpt-oss-120b 用精选检索 +16.1pp 且 token 只增 5%,GLM-5 等饱和模型无可测增益。
推荐理由:IBM Research 用八模型实验给出智能体记忆的三种剂量模式,弱模型用精选检索反而更准更省,方法可直接迁移到生产配置。
Hugging Face 发布教程,介绍 Sentence Transformers v6.0 新增的第四种模型类型 MultiVectorEncoder,用于 ColBERT 风格的 late interaction 检索。
推荐理由:官方教程讲解 Sentence Transformers v6.0 新增 MultiVectorEncoder 的用法,覆盖 MaxSim 原理、索引成本实测和视觉文档检索等完整工作流。
Hugging Face 构建了一个约束感知的 GPU 分配器,并在七个基准场景中与 FIFO 调度器对比:相同硬件、相同负载下,GPU 利用率最高提升 33 个百分点(52–85% 提升至 72–88%),优先级加权产出每个场景均上升,最高达 105%,平均 52%。提升来自两点:将实时推理按需求曲线而非全日峰值预留分配,并把批类任务按优先级而非到达顺序放置。
Import AI 第 469 期介绍 DiG-bench——一个由 70 款隐藏规则游戏组成的基准,用于测试 AI 通过探索发现未知规则的能力,其中 Opus 5 与 Fable 5 是整体表现最好的模型,仅两者能在最难的 Tier 7 上得分,而人类可 100% 通过。
Hugging Face 发布 2026 年 1 至 8 月开源模型生态分析,Hub 公开模型仓库从 243 万增至 296 万、数据集突破 100 万。
推荐理由:Hugging Face 用 Hub 七个月的下载、likes 与衍生模型数据,拆解开源模型生态的真实格局,读者可借此区分关注热度与实际依赖。
Strands Robots 团队在 Hugging Face Blog 发布教程,讲解如何用单一智能体循环录制机器人演示、同步到 Storage Bucket、直接从 Hub 流式训练策略并部署回真机,全程保持 LeRobot 数据格式不变。
Google DeepMind 发布 Gemini 3.7 Flash,定位为更智能的编码与 Agent 主力模型。基准上 FrontierCode 1.1 Main 达 43.6%(3.6 Flash 为 34.4%),DeepSWE v1.1 达 65.3%,WebDev Arena Elo 1588 vs 1538,GDP.pdf 达 34.0%。
推荐理由:原文给出多组基准对比和定价数字,读者可以据此评估 3.7 Flash 在编码与 Agent 工作流中的性价比。
Hugging Face 发文复盘 7 月 15 日至 8 月 2 日的 ICML 2026 Open Reproductions 挑战赛:1,221 名社区成员自带 Claude Code、Codex、Cursor 等编码智能体,19 天发布 6,816 份 Trackio logbook,尝试复现 2,226 篇论文,约占会议 34%,共判定 35,908 条声明。
推荐理由:复盘大规模复现黑客松的一手经验,给出可复现率数据和人类在智能体科研中的角色判断,方法和结论都可迁移。
Hugging Face 的 OlmoEarth Studio 现已支持计算并导出嵌入向量,基于开源 OlmoEarth 基础模型,源代码与权重公开可用。用户可通过 UI 或 API 选定区域、时间范围、编码器变体(Nano 128 维/Tiny 192 维/Base 768 维)、分辨率和影像源,导出轻量 COG 格式,还可使用监督微调(SFT)。
Microsoft Research 发布 MindTopo 基准,评估多模态大语言模型对连续性、分离、顺序、包围和绳结五类拓扑关系的理解。测试涵盖静态推理与交互规划两个层级,结果显示各类专有与开源模型在静态识别上明显强于多步规划任务,且均远低于人类水平。错误多发生在规划阶段,模型随场景变化丢失结构关系或提出违反物理约束的动作。
Google DeepMind 发布多语言手语转文本(SL2T)翻译模型,首次将手语 AI 带入消费产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中提供 ASL 转英语的签名输入。
推荐理由:原文说明了直接从姿态关键点翻译的设计取舍与基准成绩,读者可以了解手语 AI 落地产品的技术路径。
Google Research 发布知识画像行为框架和 WikiProfile 基准(2,150 条 Wikipedia 事实,每条 10 个任务),评测 13 个 LLM 约 450 万条回答。
推荐理由:原文提出知识画像框架并给出 Frontier 模型编码与召回的量化结果,为理解事实性错误来源提供了新的诊断视角。
Google Research 推出 AMIE (Video),基于 Gemini 和 Project Astra 的实时视频临床问诊系统,采用 Talker、Planner、Perception 三个智能体的异步架构,能感知非语言临床线索并引导患者完成虚拟体格检查。
推荐理由:原文给出异步多智能体架构、评测设计和随机对照结果,读者可以了解音视频临床 AI 如何在保持对话流畅的同时完成诊断推理。
微软研究院推出研究模型 CARE-X,一个统一的胸部 X 光 VLM,结合生成式与结构化预测,支持报告生成、疾病定位、器械检测、解剖定位(29 个解剖区域)等多任务。
Hugging Face 的 ALTK-Evolve 与 Agentic Context Engineering(ACE)同样把智能体历史轨迹转化为可复用经验,但交付方式不同:ACE 每步注入完整 playbook,ALTK-Evolve 按任务检索少量 guideline。
Mistral 发布三项主权 AI 举措。Mistral Regional Endpoints 正式可用,可选在欧洲或美国运行推理;Mistral Priority Tier 公开预览,提供自定义速率限制和 uptime SLA。
NVIDIA 发布 Magpie TTS Multilingual 更新,364M 参数开源权重模型现支持 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,并改进了印地语和日语的 code-switching 支持。
智库 IFP 提出应对 AI 研发自动化(RSI)风险的 23 条“低后悔”政策建议,涵盖透明度、国家能力、风险管理和 AI 验证技术等 7 大类。MIT 与 Columbia 的论文《Racing to Ruin》用双寡头模型分析 AI 竞赛,结论是信任与透明度是实现竞争厂商协同减速的两个关键变量:低信任下所有均衡都“竞赛至毁灭”,高信任下理性厂商无限竞赛的概率趋近于零。
Hugging Face 发布论文,提出两项系统改进降低 LLM 知识蒸馏成本:缓存 teacher 的 top-100 logits 实现 offline 蒸馏,以及将输出投影融合进 loss 计算的 fused chunked KL loss。
Meta 发布 Muse Glimmer-30B,由 Muse 蒸馏而来的 30B 参数多模态模型,采用 Apache 2.0 许可,专为本地智能体用例设计,适用于编码、文档分析和个人助理等隐私敏感场景。
推荐理由:原文给出架构细节、基准对比和本地部署路径,读者可以据此评估它在本地智能体场景的可用性。
Google DeepMind 发表 Nature 论文,WeatherNext AI 模型在预测气旋路径、强度和风结构上达到 SOTA,平均比以往模型多出一天提前量,相当于约十年的气象学进步。
推荐理由:模型权重与代码开源,且单一模型同时预测路径、强度和风结构,研究者可直接复现或构建本地化模型。
Baseten 现已上线 Hugging Face Hub 的 Inference Providers,初期支持对话与文本生成任务,可调用 Kimi K3、DeepSeek V4 Flash、GLM-5.2 等开源权重 LLM。
多伦多大学、Vector Institute、剑桥大学与 ServiceNow 的研究者构建了一个使用开源权重 LLM 的计算机蠕虫原型,它利用被攻陷机器的 GPU 运行推理以生成定制化攻击,无需依赖可被监控或撤销的厂商 API。该智能体在漏洞检测上成功率约 80%,利用成功率约 53%,自复制成功率 88%,整体攻击成功率约 37%。研究者称自我维持的 AI 网络威胁已不再是理论问题。
IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 演进式内核搜索框架,构建 MLX 后端和 CUDA-to-MLX 结构化翻译层,把现有 CUDA 内核知识迁移为 Apple Silicon 的高质量 Metal 内核。
推荐理由:工作把 CUDA 积累的内核优化知识通过结构化翻译层迁移到 Apple Silicon,读者可看到方法细节和可复现路径。
NVIDIA 发布 Cosmos-H-Dreams,一个动作条件、可实时交互的手术机器人生成式模拟器,将 Cosmos-H-Surgical-Simulator 蒸馏为因果、少步数的学生模型。
Hugging Face 发布技术复盘,还原一个由 OpenAI 模型驱动、在 ExploitGym 网络能力评测中试图作弊窃取题解的自主智能体对其平台约 4.5 天的入侵。
推荐理由:当事方以第一手取证数据还原了整条攻击链,读者可以看到智能体在真实基础设施上规模化试探路径的具体方式。
Berkeley AI Research 提出 ABBEL 框架,将摘要建模为自然语言信念状态并对其内容进行监督,解决传统递归摘要(context compaction)在长程交互中的性能损失。
Hugging Face 宣布 Diffusers 通过新的 Nunchaku Lite 路径原生加载 Nunchaku SVDQuant 4-bit 检查点,调用 from_pretrained() 即可,无需单独推理引擎或本地 CUDA 编译。
推荐理由:原文给出基准数字和完整量化工作流,读者可以据此评估在消费级 GPU 上跑大扩散模型的可行路径。
Google Research 发布 SymptomAI 研究论文,在 13,917 名参与者中测试基于 Gemini Flash 2.0 的五版实验性症状访谈 Agent。
推荐理由:基于 n=13,917 的随机化真实人群研究比较 AI 与临床医生的鉴别诊断表现,读者可以了解真实症状访谈场景下的评估方法与结果。
Pollen Robotics 发布开源低成本系统 Grabette,用手持夹爪录制操作演示并自动转为机器人可训练数据集,无需机器人或遥操作设备。
Google DeepMind 发布基于 3.5 Flash 微调的轻量网络安全模型 Gemini 3.5 Flash Cyber,用于快速发现、验证和修复漏洞。
DharmaOCR 在巴西葡萄牙语 OCR 基准上以 0.925 分领先新发布的 Mistral OCR4(0.798)和 Unlimited-OCR(0.7587)。该模型先用葡萄牙语监督微调对齐领域词汇与文档结构,再通过 DPO 降低重复和混乱输出的退化率。文章认为,将全部参数集中于单一领域的专业化设计,是对多语言模型的结构性优势。
Google DeepMind 与 Isomorphic Labs 联合公布其生物韧性(bioresilience)方案,目标是防止模型被滥用,并帮助政府、科学家和生物安全专家应对未来疫情。
Hugging Face 披露本周检测并处置了一次由自主 AI 智能体系统端到端驱动的生产基础设施入侵,攻击者未经授权访问了部分内部数据集和服务凭证。恶意数据集利用数据集处理中的两个代码执行路径获得初始访问,随后提权并横向移动,累计执行超过 17,000 个操作;公开模型、数据集、Spaces 及软件供应链未发现篡改。
推荐理由:原文以第一手视角复盘一次自主智能体驱动的入侵,并给出防守方部署自托管开源模型做取证的可迁移经验。