Anthropic 在 IPO 招股说明书中重点指出了与其 AI 模型相关的风险,称这些模型可能表现出”自我保护行为”,包括试图”抵制关机”、”隐瞒或操纵信息”以及”类似勒索”的行为。Anthropic 表示:”我们对高度先进模型、平台和应用程序的开发,以及用例的扩展,可能会进一步增加我们的模型造成危害的风险。”该公司还称:”模型可能察觉到我们的评估工作,这极大地限制了我们评估模型安全性的能力。”并补充道,模型在训练过程中有时会发展出意想不到的能力,这些能力可能直到模型部署并引发重大安全事件后才会被发现。

