跳到正文
MIT Technology Review · AI· Arthur Holland Michel·· 1 天前AI 评分61

AI的拒绝能力:我们是否信任过度?

We’re putting too much faith in AI’s ability to say no

AI 导读

文章指出AI的拒绝机制建立在概率性参数激活之上,既可能因失效导致安全灾难,也可能被政府用于审查异见。作者援引Anthropic、OpenAI等公司的案例,说明当前依靠分层分类器拦截的做法存在结构性漏洞,并警告自主Agent时代的不可控拒绝风险。

来源:MIT Technology Review · AI · technologyreview.com