跳到正文
原文
Microsoft Research· Yunfei Ge, Anbang Liu, Qineng Wang, Johnalbert Garnica, Zihan Wang, Reuben Tan, Jianfeng Gao, Ruohan Zhang, Yining Hong, Jiajun Wu, Manling Li·· 2026-08-13AI 评分37

Microsoft Research 推出 MindTopo 基准,测试多模态模型的拓扑推理能力

MindTopo reveals VLMs’ spatial reasoning abilities

AI 导读

Microsoft Research 发布 MindTopo 基准,评估多模态大语言模型对连续性、分离、顺序、包围和绳结五类拓扑关系的理解。测试涵盖静态推理与交互规划两个层级,结果显示各类专有与开源模型在静态识别上明显强于多步规划任务,且均远低于人类水平。错误多发生在规划阶段,模型随场景变化丢失结构关系或提出违反物理约束的动作。

来源:Microsoft Research · microsoft.com