跳到正文
原文
Reddit r/LocalLLaMA (开源AI)· /u/Gold-Bat-3225·· 6 小时前AI 评分45

MiMo V2.6 Pro 在 InferBench 用户意图理解上几乎追平 GPT-6 Astra

MiMo V2.6 Pro almost matched GPT-6 Astra at figuring out what a user actually wants

AI 导读

InferBench 用 20 个场景、2.8k 条对话测试 12 个前沿 LLM 从指令中推断用户优先级的能力。偏好明确时模型选对率 89%,未明说时降到 60%;具体得分 GPT-6 Astra 76%、MiMo V2.6 Pro 75%、Gemini 3.1 Pro 69%。Astra 在偏好未明说时总会追问澄清、明说时则不问;但 288 个错误决策中有 105 个以 >90% 置信度提交。

来源:Reddit r/LocalLLaMA (开源AI) · reddit.com