Anthropic 自曝安全漏洞:生物武器过滤器曾失效近一年,涉及 1.33 亿次对话

Anthropic 于当地时间 8 月 14 日发布的最新安全报告显示,该公司用于拦截化学、生物武器相关危险请求的部分安全分类器曾出现长期失效。根据 Anthropic 公开的安全机制说明,其实时提示词和输出分类器会分析用户输入以及模型生成内容,并在识别到相关风险时阻止模型提供可能用于实施危险行为的信息。报告显示,大约 5 万名承包商在相关时间段内产生了约 1.33 亿次与模型的对话,而这些流量在近一年时间里没有经过相关生物安全分类器的拦截。

原文连接