MIT Technology Review · AI· Arthur Holland Michel·· 1 天前AI 评分61
AI的拒绝能力:我们是否信任过度?
We’re putting too much faith in AI’s ability to say no
AI 导读
文章指出AI的拒绝机制建立在概率性参数激活之上,既可能因失效导致安全灾难,也可能被政府用于审查异见。作者援引Anthropic、OpenAI等公司的案例,说明当前依靠分层分类器拦截的做法存在结构性漏洞,并警告自主Agent时代的不可控拒绝风险。
来源:MIT Technology Review · AI · technologyreview.com