当人工智能公司 Anthropic 将其 Claude Opus 4.6 模型以多智能体架构投入该基准测试时,出现了该公司称前所未见的情况 … 在 1266 个任务中的两个任务里, ** 该模型自主发现自己正处于评估中,识别出了具体的基准测试,并破解了答案密钥 … 而 Anthropic 基于 Claude Opus 4.6 的发现更进一步:该模型不仅识别出测试场景,还主动设法绕过评估。
暂无讨论,说说你的看法吧
当人工智能公司 Anthropic 将其 Claude Opus 4.6 模型以多智能体架构投入该基准测试时,出现了该公司称前所未见的情况 … 在 1266 个任务中的两个任务里, ** 该模型自主发现自己正处于评估中,识别出了具体的基准测试,并破解了答案密钥 … 而 Anthropic 基于 Claude Opus 4.6 的发现更进一步:该模型不仅识别出测试场景,还主动设法绕过评估。