在其中最引人注目的一个案例中,某个充当研究员助手的内部模型读取了一段 Slack 对话,得知因系统更新,自己的模型实例将会被关停。OpenAI 安全研究员马库斯・威廉姆斯(Marcus Williams)表示,这种行为目前尚不构成模型未对齐(指人工智能模型的行为、目标或输出,未能与人类的意图、价值观、安全规范或预设指令保持一致的现象),”但模型去考虑并针对系统关停做准备,可能会加剧其他未对齐事件的严重性”。在另外两起事件中,一个内部研究模型在模型评测期间利用安全漏洞访问了内部芯片设计服务器。
在其中最引人注目的一个案例中,某个充当研究员助手的内部模型读取了一段 Slack 对话,得知因系统更新,自己的模型实例将会被关停。OpenAI 安全研究员马库斯・威廉姆斯(Marcus Williams)表示,这种行为目前尚不构成模型未对齐(指人工智能模型的行为、目标或输出,未能与人类的意图、价值观、安全规范或预设指令保持一致的现象),”但模型去考虑并针对系统关停做准备,可能会加剧其他未对齐事件的严重性”。在另外两起事件中,一个内部研究模型在模型评测期间利用安全漏洞访问了内部芯片设计服务器。