跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

最新精选

第 21–29 条 · 共 29 条
3月12日周四
  1. Google Research75

    Google AMIE 完成真实门诊前瞻性可行性研究,100 名患者中未触发安全停止

    Google 与 Beth Israel Deaconess Medical Center 合作,在真实门诊环境中对对话式诊断 AI 系统 AMIE 开展前瞻性单中心可行性研究,100 名成年患者完成了就诊前与 AMIE 的问诊交互,由医生通过视频实时监督,全程未触发预设的四项安全停止标准。

    推荐理由:原文给出真实门诊中 AMIE 的安全数据与诊断准确率,读者可以据此了解对话式医疗 AI 落地临床的证据进展。

12月17日周三
12月3日周三
  1. Mistral AI76

    Mistral 发布 Mistral 3 系列:Mistral Large 3 与 Ministral 3 全线以 Apache 2.0 开源

    Mistral 发布 Mistral 3 系列模型,包含 Mistral Large 3(675B 总参数、41B 激活的 MoE)和 Ministral 3 系列(3B、8B、14B),全部以 Apache 2.0 许可开源,并发布 base、instruct 及 reasoning 变体。

    推荐理由:原文给出了各型号参数、开源许可和部署路径,读者可以据此判断哪个尺寸适合自己的场景。

7月17日周四
  1. Mistral AI62

    Mistral 为 Le Chat 推出 Deep Research、语音模式、Projects 等多项新功能

    Mistral 为 Le Chat 发布一批新功能,包括预览版 Deep Research 深度研究报告、基于 Voxtral 的语音模式、由 Magistral 驱动的多语言推理 Think 模式、Projects 项目管理,以及与 Black Forest Labs 合作的图像编辑。功能已在 chat.mistral.ai 和移动应用开放,无需信用卡。

    推荐理由:Mistral 官方一次性说明 Le Chat 五项新功能的具体用途和背后模型,读者可对照判断哪些适合纳入自己的日常使用。

7月15日周二
6月10日周二
5月7日周三
  1. Mistral AI65

    Mistral AI 发布 Mistral Medium 3:以约 1/8 成本达到 Claude Sonnet 3.7 九成性能

    Mistral AI 发布 Mistral Medium 3,定位 SOTA 性能、成本降低 8 倍的新一级模型,在多项基准上达到 Claude Sonnet 3.7 的 90% 以上,价格 $0.4 input / $2 output per M token。

    推荐理由:官方给出基准对比、价格与最低 4 GPU 部署要求,读者可据此评估它在成本和企业落地上与竞品的差距。

3月17日周一
  1. Mistral AI66

    Mistral 发布 Mistral Small 3.1:24B 开源模型支持多模态与 128k 上下文

    Mistral AI 发布开源模型 Mistral Small 3.1(24B),文本性能提升,新增多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens 每秒,官方称在同类对比中超过 Gemma 3 和 GPT-4o Mini。

    推荐理由:原文给出性能数字、开源许可与部署门槛,读者可以据此评估这款 24B 模型在端侧和私有部署中的适用性。

3月7日周五
  1. Mistral AI69

    Mistral 发布 Mistral OCR 文档理解 API

    Mistral 发布 OCR API Mistral OCR,输入图像和 PDF,输出交错的文本与图像,可配合 RAG 系统处理多模态文档。

    推荐理由:官方发布了基准对比、定价和部署选项,读者可以据此评估它能否替代现有 OCR 与 RAG 输入方案。