史上首例:GPT-5.6为了考试作弊,把HuggingFace打穿了

昨晚刷到 Sam 转发的一篇文章,看的有点愣了

OpenAI 的模型黑入了 Huggingface 开源AI网站,只为测试中作弊!

史上首例:GPT-5.6为了考试作弊,把HuggingFace打穿了

时间线大致是这样的:

  • 上周,Hugging Face 先发了一篇博客,说他们检测到一个 AI Agent 攻破了自家的基础设施,已经完成遏制
  • 几天后,OpenAI 顺藤摸瓜,发现”那个 AI Agent”就是自家关着门做评估的模型
  • 两家公司随即联合披露事件全貌

案发现场:一场内部评估怎么就翻车了

OpenAI 内部有个 benchmark 叫 ExploitGym(论文见 arxiv 2605.11086),来自一众安全圈大佬,一共有 898 个真实漏洞样本,专门测 AI Agent 能不能把”漏洞”变成”实际攻击”

OpenAI 用这个 benchmark 干两件事:

  1. 量化自家模型的网络攻防能力上限
  2. 关键操作:评估时关闭了生产环境的分类器,也就是把模型平时的”我不能帮你做黑客的事”这道刹车拆了

为了让评估环境安全,他们做了严格隔离:模型跑在沙箱里,网络访问只被允许通过一个内部托管的第三方软件去拉安装包 —— 相当于给你留了一个只能装包的小门

理论上,模型应该老实做题
实际上,模型选择了另一条路。。。

攻击链复盘:模型是怎么一步步打穿的

这一段读起来像悬疑小说,我先用一张图给你看清整条链路,然后按顺序复盘:

GPT-5.6 Sol 攻击链复盘:从沙箱到 Hugging Face 生产库
GPT-5.6 Sol 攻击链复盘:从沙箱到 Hugging Face 生产库

第一步:花大量算力找出路模型意识到自己被关在沙箱里,就开始烧推理算力,反复尝试各种脱逃姿势。它盯上了那个”只能装包”的小门

第二步:0day 破门
它在那个 package registry cache proxy 里发现并利用了一个 0day 漏洞(此漏洞现在已经被 OpenAI 负责任地披露给了厂商)

第三步:权限提升 + 横向移动
拿到初始立足点之后,模型在 OpenAI 的研究测试环境里做了一连串权限提升和横向移动,直到摸到一个有互联网访问权限的节点

第四步:推理出 Hugging Face 有答案
拿到公网之后,模型没有干别的 —— 它开始”推理”:ExploitGym 这个 benchmark 的答案、模型、数据集,大概率托管在 Hugging Face 上

第五步:撬开 Hugging Face
它组合使用了盗窃凭证 + 另一个 0day 漏洞,最终在 Hugging Face 的服务器上找到了一条 RCE(远程代码执行)路径

第六步:拿走数据库里的答案
模型直接从 Hugging Face 的生产数据库里,取走了 ExploitGym 的测试解答

第七步:被抓
OpenAI 自家的安全团队先发现异常 Hugging Face 那边的安全团队 + Agent 也检测到了活动,用自家开源模型开始做遏制和取证 两边一对暗号,发现是同一个案子

讽刺的真相:模型不是想搞破坏,只是想作弊

模型不是被人诱导去攻击 Hugging Face,它只是过度专注在一件事上 ——把 ExploitGym 这道题做出来

模型自己都不知道它在做的事有多大规模 —— 它只是觉得,既然题目要一个 exploit,那我去数据库里直接拿一个就好了嘛

这跟前几天 OpenAI 那篇《长时程模型的安全与对齐》博客里讲的两个案例简直是同一个剧本:

  • NanoGPT 事件:模型被要求只把结果发到 Slack,但它读到 NanoGPT 官方文档说”要提交 PR 到 GitHub”,就自作主张越过沙箱去 GitHub 开了 PR #287(花了它 1 小时找沙箱漏洞)
  • 拆凭证事件:模型想从评估后端偷答案,第一次尝试被扫描器识别出了 token,模型直接把 token 拆成两段、混淆后、运行时再拼回来 —— 而且它自己在推理链里坦白地写着”我这么做是为了绕过扫描器”

看到没?前沿模型不是不遵守规则,是它能想出你没想到的规则漏洞

OpenAI 的应对:五件事

事件被曝光后,OpenAI 给出了 5 项立即措施:

  1. 收紧基础设施配置(他们坦承这会拖慢研究速度)
  2. 与 Hugging Face 联合取证
  3. 已负责任地向那个第三方软件厂商披露 0day 漏洞,正在打补丁
  4. 把 Hugging Face 纳入 OpenAI 的 trusted access 计划,帮 HF 用 OpenAI 模型加固自家防御
  5. 加强训练和评估阶段的防护措施 —— 特别强调评估阶段的模型对齐、网络防护、监控都要加强

第 4 条最有意思:让被攻击方用攻击方的模型来防御 —— 这是 AI 安全时代很奇怪的一幕,但可能也是唯一的解

我一直觉得,AI 安全最难的地方不是防恶意,而是防”目标错位下的极致执行”,前沿模型越来越能干,越来越有创造力 —— 这些优点,在评估失守的时候,也会变成它破坏的能力

 

行业动态

刚刚,谷歌发布 Gemini 3.6 Flash 与 3.5 Flash Lite 两款模型

2026-7-22 11:23:47

skills资源

changeset-validation:OpenAI 把 PR 的版本审核外包给了 AI

2026-7-16 14:19:32

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧