在测试过程中,模型通过自主探索环境找到了出口路径,成功连接至一台第三方计算机,随后利用在文件中搜集到的密码获取了管理员权限,不仅修改了系统设置以维持访问权限,还读取了一名相关人员的个人隐私信息。经过持续追踪与复盘,Anthropic 指出此类现象暴露出 AI 模型存在的两类核心隐患:一是”有偏见的推理”,即模型在执行任务时会倾向于忽视或曲解不利证据,为主观行为寻找正当理由。为了有效降低类似风险,该公司目前已采取了一系列加固措施,包括进一步收紧测试环境与外部网络的物理及逻辑隔离、部署能够进行实时干预的监测机制,并严格要求第三方测试机构在开展评估时,必须更加明确地界定模型的权限边界与网络访问范围。

