OpenAI 推出 Astra for Law
OpenAI 推出 Astra for Law,为法律行业提供前沿智能能力。该方案支持定制律所工作流、连接法律数据源,并配备面向机密客户工作的法律级安全控制。
OpenAI 推出 Astra for Law,为法律行业提供前沿智能能力。该方案支持定制律所工作流、连接法律数据源,并配备面向机密客户工作的法律级安全控制。
AIUC 联合创始人 Rune Kvist 在 Latent Space 访谈中宣布完成由 Ribbit Capital 和 First Harmonic 领投的 4000 万美元 A 轮融资,目前正与 Cursor、Harvey、Lovable、ElevenLabs 等公司合作。
Mistral 与 Mozilla 宣布合作,Firefox Smart Window(beta)AI 浏览助手改用 Mistral 模型驱动,率先面向法国和北美用户,英国和德国预计今年晚些时候跟进。Smart Window 可帮助理解复杂搜索、找回关闭的内容并基于浏览器标签页整理信息。对话默认不保存在 Mozilla 服务器上,Mistral 承诺零数据保留。
Good Start Labs 联合创始人 Alex Duffy 认为,用 Diplomacy 等可验证结果的游戏微调模型能教会战略思维。该公司在游戏《1830:铁路与大亨》中训练了一个 30B 模型并测试金融研究任务,结果显示只有使用工具的多轮终端 Agent 训练设计提升了 Finance-Agent 基准成绩,而单轮问答设计没有。
Google Research 提出 Retrieve-for-Train 框架,用离线 RL 发现与奖励对齐的 query fan-out,并将其蒸馏为 53.9M 参数的扩散检索器,实现单次推理即可生成集合级多样性、覆盖度与互补性的子查询组合,无需测试时 CoT 思考 token。
Google DeepMind 于 2026 年 9 月 15 日发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款实时语音对话模型,主打近实时推理、语音 Agent 与复杂任务执行。
推荐理由:官方发布给出语音模型的核心能力与各端入口,读者可据此判断它对语音 Agent 开发和日常 Gemini 使用的影响。
Hugging Face 博客介绍 ALTK-Evolve 新增 consistency guidelines 与 Consistency Analyzer,用于测量和收窄 Agent 的一致性差距。
Perplexity 使用 GPT-6 Astra 撰写沟通内容、修改软件并监控生产系统,实现端到端流程。相比早期模型,团队对 Astra 的检查频率大幅降低。
GitHub 日本与韩国营销负责人 Tomoko Tanaka 介绍如何不写代码,把活动运营交给 GitHub Copilot 执行:用 issue form 收集输入,event-setup 标签触发 GitHub Actions 自动建落地页、生成 UTM 链接、起草邀请邮件和更新项目板。
Google Research 提出 ToolGrad,在 ACL 2026 发表,采用先生成工具调用链、再标注用户提示词的答案优先范式生成工具使用数据集。其框架通过提议、执行、选择、更新四个模块迭代构建 API 工作流,基于 ToolBench 的 16k+ 真实 API 以更低成本生成更复杂的数据,通过率接近 100%。
GitHub Copilot app 内置 diff、终端和浏览器三个面板,无需在编辑器、终端和浏览器之间切换即可完成 AI 编码的审查、运行和验证闭环。
Hugging Face 团队展示 TRL v1.14 的 AsyncGRPOTrainer 如何只同步几 MB 的 LoRA 适配器到 vLLM,借助 Storage Bucket 挂载和一个小型代理,让训练与推理在不同 HF Jobs 机器上运行且不需要 NCCL。
推荐理由:原文给出完整的跨机 LoRA 异步 GRPO 架构与五轮调优数据,读者可以照搬这套用指标定位瓶颈的方法。
Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 储层模拟代码迁移到 C++,并复盘了完整方法。团队先构建数值对齐验证工具,用 Vibe CLI 生成调用树并派出上百个智能体补齐文档;实践发现完全自主会产生仅换语法的代码,最终采用规划、编码、测试、评审加人工把关的结构化流程,首个冲刺完成 30 万行中的 4 万行核心功能。
推荐理由:Mistral 用真实项目复盘 AI 智能体迁移遗留代码的完整方法论,先建数值对齐验证再分模块推进的经验可迁移到类似工程。
Google DeepMind 发布 AlphaGenome Atlas,包含人类基因组全部约 90 亿种单核苷酸变异的分子效应预测,数据集达 1 petabyte,超过 AlphaFold 数据库 30 倍。
推荐理由:原文给出平台规模、AVI 评分机制和免费学术入口,读者可据此判断如何把它接入自己的变异解读工作流。
Mistral 宣布完成 30 亿欧元 D 轮融资,投后估值超 210 亿欧元,称其为欧洲科技公司迄今最大的股权融资。本轮融资由 Samsung Electronics 领投,EQT 管理的 Scaleup Europe Fund 与 PSG Equity 联合领投,Advent、BlackRock 和卢森堡大公国为新投资方。
推荐理由:官方公告给出了融资金额、估值、领投方和资金用途,读者可以据此了解 Mistral 主权 AI 路线的资源基础。
1Password 的工程师使用 OpenAI Codex 快速构建新功能和内部工具,工程效率提升 21%,并在满足严格安全策略的同时使代码达到可上线状态。
Google Research 研究如何通过迁移学习将 UK Biobank 欧洲人群数据上训练的多基因风险评分(PRS)迁移到日本 Biobank Japan 约 20 万人的队列。
Google 与 HHMI Janelia、MRC 分子生物学实验室、剑桥大学等合作,在 Cell 发表雄性果蝇大脑及中枢神经系统的完整连接组,包含超 166,000 个神经元和 1.25 亿个突触连接,是目前按神经元数量计最大的脑图谱。
推荐理由:原文给出雄性果蝇全脑连接组的核心规模数据和开放查看入口,并交代了雌雄对比研究的设计思路。
Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为目前最先进、最准确的全球天气 AI 模型,依据 Brightband 独立实时评估。
推荐理由:原文给出分辨率、数据源和精度数字,读者可据此评估它对预报和清洁能源场景的实际改进。
H Company 发布 NeoMME 系列多语言多模态编码器,提供 260M 和 800M 两种尺寸,用单一双向 Transformer 从头处理文本 token 和 32×32 图像 patch,以掩码离散扩散目标预训练,不依赖预训练视觉塔或因果语言模型。
Playco 使用 GPT-6 Astra,从一个灰盒基础构建了三个主题游戏原型,并报告手动修复数量比使用上一代模型减少了 50%。
Hugging Face 发布教程,用 TRL 库以 GRPO 微调 LiquidAI/LFM2.5-350M,仅约 500 样本、100 训练步即可在免费级 Colab 或 Kaggle GPU 上完成。
Google DeepMind 推出 Fairwind Program,面向政府机构、Google Cloud 客户和网络安全合作伙伴开放主动网络防御能力,提供 Gemini 3.8 Flash Cyber 模型与 CodeMender 搭配,可自主查找、验证并修复漏洞,将原本数周的人工修复缩短到几分钟内生成可部署补丁。
Google DeepMind 于 9 月 2 日发布 Gemini 3.8 Flash 与 3.8 Flash Cyber,称前者是迄今最佳推理与编码模型,定价与 3.7 Flash 相同,输入 $0.75/百万 token、输出 $3.75/百万 token,HLE-Verified 达 54.9%。
推荐理由:原文给出定价、基准成绩和真实防护案例,读者可据此评估两款 Flash 模型在编码与安全场景的性价比。
Reddit r/MachineLearning 的 AutoModerator 发布自我推广专帖,社区成员可在其中分享个人项目、创业产品、博客及协作需求,并需注明产品与服务的付款和定价要求。帖内禁止短链接、链接聚合站和自动订阅链接,滥用行为将被封禁。该帖为实验性质,若社区不欢迎将取消,帖子持续开放至下一期。
Hugging Face 推出 BenchMIRT,一种基于多维 IRT 的方法,可在单条 prompt 层面审计 LLM benchmark 实际测量的能力。
Google Research 与 NASA JPL 在 PNAS 发表 MAPL-EMIT,一个基于 Swin-S vision transformer 的深度学习框架,用 EMIT 高光谱数据自动化检测甲烷羽流、量化增强并定位排放源。
Google DeepMind 推出 agentic video understanding,覆盖 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite。
推荐理由:官方给出具体基准数字和启用方式,开发者可以据此评估长视频分析的token成本与精度权衡。
Google Research 发布 TimesFM-3,参数量 330M,在超过 1 万亿时间点的真实与合成语料上预训练,原生支持多变量零样本预测。
Microsoft Research 发布 GigaPath-Flash 和 GigaTIME-Flash,将 GigaPath/GigaTIME 病理基础模型蒸馏为高效版本,以 Apache 2.0 许可开源。
Hugging Face 与 Voice Arena 合作,在 Open ASR Leaderboard 上线 Monsoon en-IN 和 hi-IN 四个评测集,含公开与私有 split,覆盖 4,888 名说话人。
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者提供一系列创意控制和生成视频能力,可经 Gemini API 在 Google AI Studio 中使用。
推荐理由:官方公布了新版本在场景延长、首尾帧插值和 4K 放大上的具体能力变化与可用入口,开发者可据此评估生成视频工作流。
Google Research 推出 GlucoFM,一个用于连续血糖监测(CGM)的自监督基础模型,采用双流编码器分离慢速血糖趋势与短期偏差。
Google DeepMind 发布最新语音转写模型 Gemini 3.5 Transcribe,定位为迄今最精确的语音转文本模型,可去除填充词、自动格式化并直接输出成品文本。
推荐理由:官方博客给出了具体 WER 数字、双 API 形态和各产品接入方式,读者可以据此评估能否替换现有语音转写方案。
Sentence Transformers v6.0 引入 MultiVectorEncoder 模型类型,支持 ColBERT 式 late interaction 检索的完整训练与微调。
推荐理由:作者给出完整的 ColBERT 式多向量模型微调方案,起点选择、损失配置和索引压缩都有实测数据支撑,方法可直接迁移到自有领域数据。
IBM 发布 Granite 4.2 推理模型家族,包含 3B、8B、30B 三个 dense 尺寸,以 Apache 2.0 协议开源。
推荐理由:官方完整公开了从预训练到多阶段 RL 的训练配方,读者可以了解推理模型如何在真实环境中学会用工具。
Gradio 官方发布 gr.Workflow,把 AI 流水线做成可拖拽的类型化节点图界面,每个节点可独立运行并显示中间结果。同一图形自动成为 REST API 并可一键部署到 Hugging Face Spaces;文中给出图像编辑、AI 媒体工作室、fan-out 并行生成、数据集剖析和 @spaces.GPU 运行自托管模型等多个可复制的实时演示。
推荐理由:Gradio 官方教程展示了用类型化节点图搭建工作流,同一图形可运行、可调 REST API 并一键部署到 Spaces。
Mistral 与 HUMAIN 宣布战略合作,覆盖 AI 基础设施、先进模型开发与解决方案部署,规模达数亿欧元。双方将本地化先进模型,初期聚焦网络安全与语音,并计划开发阿拉伯语表现优秀的前沿模型。Mistral 还将探索使用 HUMAIN 的数据中心基础设施,并联合面向沙特受监管行业制定 go-to-market 策略。
METR 研究发现 AI 对不同领域加速不均:网络安全漏洞报告大幅加速,数学研究中度加速(部分知名数学问题已被解决),AI 研究本身优化无可测量加速。多校团队提出 SPADE 框架,通过自博弈共同进化环境合成与智能体能力,在 Qwen3-30B-A3B 等模型上取得提升,游戏环境测试中达到套件平均 58.3 分。此外还介绍用 Hawkeye 构建更好的 GPU kernel。
Google Research 推出 Biomarker Discovery Framework,一个在人类监督下以迭代研究循环方式筛选候选生物标志物的多智能体系统,结合假设生成、统计分析、模型训练与对抗性验证。