跳到正文
原文
Microsoft Research· Chad Atalla, Jennifer Neville·· 13 小时前AI 评分51

Microsoft Research 播客:Jennifer Neville 谈 AI 的意外失败与评测驱动改进

What AI gets wrong and what failure teaches us

AI 导读

Microsoft Research 播客中,Jennifer Neville 与 Chad Atalla 对谈 AI 系统在传统基准之外的意外失败及评测如何推动改进。她介绍团队将单轮基准改为模拟用户多轮补充说明后,发现模型性能显著下降,并建议用户在答案可疑时换一种问法重新提问;长流程智能体任务中错误若不及时纠正会累积,她还在隐私受限环境下大规模分析日志提炼失败模式。

来源:Microsoft Research · microsoft.com