Microsoft Research· 01:43AI 评分5252微软研究员访谈:AI 在哪些方面会出错以及失败教会我们什么微软研究院的 Jennifer Neville 在播客访谈中分享了其团队在真实工作场景中评估 AI 系统的研究发现。研究发现,当任务在多次对话轮次中逐步澄清时,模型性能比单轮基准测试时显著下降,用户对此有强烈共鸣。观点#大佬观点#Agent#推理