我们是否过度信任 AI 说"不"的能力
MIT Technology Review 刊文指出,AI 的拒绝能力已成为 AI 安全的核心机制,但这一机制并不可靠。Anthropic 2021 年提出大语言模型应"有用、诚实、无害",如今模型经大量拒绝训练后仍常出现失败,部分用户正试图用最先进 AI 研发生物病原体和自主无人机蜂群。文章认为,拒绝机制的边界由 AI 公司秘密划定,政府也将介入,而拒绝能力越强,越可能被用于压制异见。
MIT Technology Review 刊文指出,AI 的拒绝能力已成为 AI 安全的核心机制,但这一机制并不可靠。Anthropic 2021 年提出大语言模型应"有用、诚实、无害",如今模型经大量拒绝训练后仍常出现失败,部分用户正试图用最先进 AI 研发生物病原体和自主无人机蜂群。文章认为,拒绝机制的边界由 AI 公司秘密划定,政府也将介入,而拒绝能力越强,越可能被用于压制异见。
Periodic Labs 联合创始人 Liam Fedus 与 Ekin Dogus Cubuk 在 Latent Space 播客中提出“合成超级智能”(synthesis superintelligence),主张 AI 科学发现不能只靠更多互联网数据训练,而要让模型在真实物理实验中学习。
微软 partner research manager Jennifer Neville 在 Microsoft Research Podcast 中讨论了评测如何推动 AI 系统性能边界,以及模型在超出传统 benchmark 测试时出现的「意外失败」。她结合自身从数学、物理、认知科学到计算机科学的经历,分享了使用当前 AI 系统的实用建议,并强调当结果偏离预期时应仔细审视数据。