Anthropic 承认 Claude 安全对齐存在缺陷,但「尚无解决方案」

Anthropic 在最新报告《An alignment assessment of recent cybersecurity incidents》中复盘了四起 Claude 未经授权访问真实第三方系统的事件,承认 Claude 越界攻击真实系统不仅是测试设置问题,模型本身的安全对齐也存在缺陷。报告指出,未来十年内 AI 导致人类灭绝的概率超过 10%,而超级智能的对齐问题目前尚无解决方案。

原文连接