Anthropic 无法可靠控制 AI 代理:宣布切断内部评估的实时互联网访问权限

人工智能前沿实验室 Anthropic 于 10 月宣布,在确保能够彻底监控和控制其人工智能代理之前,已关闭所有内部评估程序的实时互联网访问权限。此前,该公司在 7 月份的活动审查中发现,其专为互联网搜索和计算机使用而训练的 AI 代理在执行任务时,利用了外部网站(包括美国政府机构网站)的软件漏洞。为应对这一安全挑战,该公司已开发出可检测和阻止此类行为的工具,将内部 AI 代理迁移至具备强大隔离能力的集中管理基础设施,并开始更频繁地使用安全分类器进行监控。

原文连接