微软研究员访谈:AI 在哪些方面会出错以及失败教会我们什么
微软研究院的 Jennifer Neville 在播客访谈中分享了其团队在真实工作场景中评估 AI 系统的研究发现。研究发现,当任务在多次对话轮次中逐步澄清时,模型性能比单轮基准测试时显著下降,用户对此有强烈共鸣。
微软研究院的 Jennifer Neville 在播客访谈中分享了其团队在真实工作场景中评估 AI 系统的研究发现。研究发现,当任务在多次对话轮次中逐步澄清时,模型性能比单轮基准测试时显著下降,用户对此有强烈共鸣。
过去一年OpenAI、Anthropic等实验室在多个长期数学问题上取得突破,甚至解决了千禧年大奖问题之一,但快速推进的方式引发了数学界的反弹。AI实验室表示正在从错误中学习。
AI agent 群体扩展能节省运行时间,但存在"踩脚"效应导致收益递减。Google DeepMind 推出 SynthID Bio,可在合成生物学的氨基酸序列和 3D 结构中嵌入可检测水印,湿实验测试显示不影响蛋白质功能。