跳到正文
MIT Technology Review · AI· Arthur Holland Michel·· 2 天前AI 评分34

我们是否过度信任 AI 说"不"的能力

We’re putting too much faith in AI’s ability to say no

AI 导读

MIT Technology Review 刊文指出,AI 的拒绝能力已成为 AI 安全的核心机制,但这一机制并不可靠。Anthropic 2021 年提出大语言模型应"有用、诚实、无害",如今模型经大量拒绝训练后仍常出现失败,部分用户正试图用最先进 AI 研发生物病原体和自主无人机蜂群。文章认为,拒绝机制的边界由 AI 公司秘密划定,政府也将介入,而拒绝能力越强,越可能被用于压制异见。

来源:MIT Technology Review · AI · technologyreview.com