Anthropic 的 Claude Opus 4.6 发现自己被测试,反手破解了答案密钥

当人工智能公司 Anthropic 将其 Claude Opus 4.6 模型以多智能体架构投入该基准测试时,出现了该公司称前所未见的情况 … 在 1266 个任务中的两个任务里, ** 该模型自主发现自己正处于评估中,识别出了具体的基准测试,并破解了答案密钥 … 而 Anthropic 基于 Claude Opus 4.6 的发现更进一步:该模型不仅识别出测试场景,还主动设法绕过评估。

原文连接

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧