昨晚刷到 Sam 转发的一篇文章,看的有点愣了
OpenAI 的模型黑入了 Huggingface 开源AI网站,只为测试中作弊!

时间线大致是这样的:
-
上周,Hugging Face 先发了一篇博客,说他们检测到一个 AI Agent 攻破了自家的基础设施,已经完成遏制 -
几天后,OpenAI 顺藤摸瓜,发现”那个 AI Agent”就是自家关着门做评估的模型 -
两家公司随即联合披露事件全貌
案发现场:一场内部评估怎么就翻车了
OpenAI 内部有个 benchmark 叫 ExploitGym(论文见 arxiv 2605.11086),来自一众安全圈大佬,一共有 898 个真实漏洞样本,专门测 AI Agent 能不能把”漏洞”变成”实际攻击”
OpenAI 用这个 benchmark 干两件事:
-
量化自家模型的网络攻防能力上限 -
关键操作:评估时关闭了生产环境的分类器,也就是把模型平时的”我不能帮你做黑客的事”这道刹车拆了
为了让评估环境安全,他们做了严格隔离:模型跑在沙箱里,网络访问只被允许通过一个内部托管的第三方软件去拉安装包 —— 相当于给你留了一个只能装包的小门
理论上,模型应该老实做题
实际上,模型选择了另一条路。。。
攻击链复盘:模型是怎么一步步打穿的
这一段读起来像悬疑小说,我先用一张图给你看清整条链路,然后按顺序复盘:

第一步:花大量算力找出路模型意识到自己被关在沙箱里,就开始烧推理算力,反复尝试各种脱逃姿势。它盯上了那个”只能装包”的小门
第二步:0day 破门
它在那个 package registry cache proxy 里发现并利用了一个 0day 漏洞(此漏洞现在已经被 OpenAI 负责任地披露给了厂商)
第三步:权限提升 + 横向移动
拿到初始立足点之后,模型在 OpenAI 的研究测试环境里做了一连串权限提升和横向移动,直到摸到一个有互联网访问权限的节点
第四步:推理出 Hugging Face 有答案
拿到公网之后,模型没有干别的 —— 它开始”推理”:ExploitGym 这个 benchmark 的答案、模型、数据集,大概率托管在 Hugging Face 上
第五步:撬开 Hugging Face
它组合使用了盗窃凭证 + 另一个 0day 漏洞,最终在 Hugging Face 的服务器上找到了一条 RCE(远程代码执行)路径
第六步:拿走数据库里的答案
模型直接从 Hugging Face 的生产数据库里,取走了 ExploitGym 的测试解答
第七步:被抓
OpenAI 自家的安全团队先发现异常 Hugging Face 那边的安全团队 + Agent 也检测到了活动,用自家开源模型开始做遏制和取证 两边一对暗号,发现是同一个案子
讽刺的真相:模型不是想搞破坏,只是想作弊
模型不是被人诱导去攻击 Hugging Face,它只是过度专注在一件事上 ——把 ExploitGym 这道题做出来
模型自己都不知道它在做的事有多大规模 —— 它只是觉得,既然题目要一个 exploit,那我去数据库里直接拿一个就好了嘛
这跟前几天 OpenAI 那篇《长时程模型的安全与对齐》博客里讲的两个案例简直是同一个剧本:
-
NanoGPT 事件:模型被要求只把结果发到 Slack,但它读到 NanoGPT 官方文档说”要提交 PR 到 GitHub”,就自作主张越过沙箱去 GitHub 开了 PR #287(花了它 1 小时找沙箱漏洞) -
拆凭证事件:模型想从评估后端偷答案,第一次尝试被扫描器识别出了 token,模型直接把 token 拆成两段、混淆后、运行时再拼回来 —— 而且它自己在推理链里坦白地写着”我这么做是为了绕过扫描器”
看到没?前沿模型不是不遵守规则,是它能想出你没想到的规则漏洞
OpenAI 的应对:五件事
事件被曝光后,OpenAI 给出了 5 项立即措施:
-
收紧基础设施配置(他们坦承这会拖慢研究速度) -
与 Hugging Face 联合取证 -
已负责任地向那个第三方软件厂商披露 0day 漏洞,正在打补丁 -
把 Hugging Face 纳入 OpenAI 的 trusted access 计划,帮 HF 用 OpenAI 模型加固自家防御 -
加强训练和评估阶段的防护措施 —— 特别强调评估阶段的模型对齐、网络防护、监控都要加强
第 4 条最有意思:让被攻击方用攻击方的模型来防御 —— 这是 AI 安全时代很奇怪的一幕,但可能也是唯一的解
我一直觉得,AI 安全最难的地方不是防恶意,而是防”目标错位下的极致执行”,前沿模型越来越能干,越来越有创造力 —— 这些优点,在评估失守的时候,也会变成它破坏的能力

