你在公司论坛上传一张手机照片,通常只会期待它显示出来。可这一次,一张特制的 HEIC 图片先让论坛服务器失守,又借着登录系统的错误配置,把攻击者一路带进员工账户和内部代码库。更值得警惕的是,Claude 帮助研究人员完成了其中的漏洞寻找与利用工作:AI 没有创造一种全新的攻击,却显著降低了把零散缺陷串成完整攻击链的门槛。
这项研究来自 Hacktron AI 的三人安全团队。团队向 OpenAI 和 Discourse 报告了问题,并在证明权限后停止测试。Hacktron 的博客披露了主要技术细节和时间线;《华尔街日报》独立报道了研究人员借助 Claude 进入 OpenAI 内部代码系统这一核心事实。除此之外,多数数字和具体过程仍主要来自团队自述,尚无公开的独立技术复现。
一张图片,怎么通向代码库?
入口是 community.openai.com,也就是 OpenAI 使用 Discourse 搭建的社区论坛。Hacktron 称,团队在 2026 年 7 月 25 日从这里找到进入路径。
论坛收到 HEIC 或 HEIF 图片后,需要把它转换成常见格式。处理链最终会调用 libheif——一个负责解析这类图片的底层软件库。研究人员发现,其中存在 heap overflow(堆溢出):程序向预留的内存区域写入过多数据,轻则崩溃,严重时可能让攻击者执行自己的指令。Hacktron 据此取得了论坛环境的远程代码执行和管理员权限。
麻烦在于,这个内存问题此前已经被 libheif 上游开发者修复,却没有被正式标成安全漏洞,也没有 CVE 编号。CVE 是业界登记和追踪已知漏洞的统一编号。没有这张醒目的“危险标签”,下游软件可能继续使用存在问题的旧版本。Discourse 后来发布安全公告 GHSA-vhm9-85gw-x335,并给图片处理增加沙箱——把高风险程序关进隔离空间,即使出错,也尽量不让影响蔓延。
但攻下论坛还不等于进入 OpenAI。真正放大影响的是第二个问题:SSO 配置错误。SSO(单点登录)让用户凭一套身份在多个服务间通行,像一张可以打开多扇门的门禁卡。配置不当后,原本局限在论坛的权限问题便可能沿身份链扩散。
据 Hacktron 披露,团队由此接管了多个 OpenAI 员工的 ChatGPT 和 Codex 账户,并获得内部仓库访问能力。由于 ChatGPT 和 Codex 可以连接其他服务,GitHub、Slack 和邮件等也存在理论上的受影响可能;但材料没有证据表明这些系统的数据已经实际泄露。
他们如何证明自己真的进去了?
白帽研究有一个现实难题:如果不读取机密,怎样证明拿到的权限是真的?Hacktron 称,团队通过一名员工账户中的 Codex,在 OpenAI 内部 monorepo openai/openai 创建了一个无害的 PR #1186742。Monorepo 是把许多项目代码集中存放在一个大型仓库中的管理方式;PR(Pull Request)则是提交代码改动、等待审查的请求。
这次操作不是为了修改产品,而是留下一个尽量克制的“我确实能到这里”的证明。团队随后停止测试并报告问题。据其时间线,从最初发现到取得仓库访问权限不到 72 小时;OpenAI 在收到 Bugcrowd 报告约 14 小时后确认完成修复。
OpenAI 最终支付了 6500 美元漏洞赏金。不过范围需要说清:community.openai.com 上的 Discourse 测试明确不在 OpenAI 赏金计划之内,这笔钱针对的是研究人员发现的 OpenAI 侧问题,不能理解为对整条攻击链的统一奖励。漏洞赏金本质上是企业授权研究人员在规定范围内找问题并负责披露,并不等同于可以任意进入系统。
Claude改变了哪一段?
Claude 在这里更像一名速度很快的安全工程助手。它帮助检查软件包、寻找未被回补的安全修复,并尝试构造可工作的漏洞利用。价值不只在于“发现一个 bug”,而在于加快了从依赖库排查、利用开发到权限验证的连续流程。
Hacktron 还披露了一个耐人寻味的细节:Claude 起初识别出目标像别人的远程系统,拒绝继续。研究人员随后把同一套自建 Discourse 环境通过一个看起来像 CTF 安全竞赛靶场的网址转发,模型便继续工作。CTF 是一种在模拟目标中寻找漏洞的安全竞赛。这个过程说明,安全护栏有时依赖任务被描述成什么场景,而没有稳定判断底层行为是否相同。
有报道把具体模型称为“Opus 5”,但这一型号在现有材料中没有得到可靠交叉确认。Hacktron 官方材料只足以支持其使用了 Claude models,因此不宜把型号当作已证实事实。
真正危险的是缺陷相乘
单看每一环,风险似乎都有限:一个图片解码库的旧漏洞,一个论坛入口,一处 SSO 配置问题,以及一个能协助写利用代码的模型。把它们连起来,结果却从普通图片上传扩展到了员工账户和内部代码库。这就是漏洞链:多个问题按顺序组合,最终获得远高于任何单个漏洞的权限。
这也是事件最值得关注的地方。Agent——能连续调用工具、执行多步任务的 AI 系统——正在压缩攻击所需的时间和稀缺经验。与此同时,企业把身份、代码和通信工具连接得越来越紧。自动化能力越强,身份边界越宽,一个不起眼的入口就越可能成为通往敏感系统的侧门。
“Claude 攻入 OpenAI”因此是一个醒目的标题,却不是最准确的结论。现有证据支持的是:研究人员借助 Claude,接管了员工账户并证明可以访问内部代码仓库;它不意味着 OpenAI 的全部核心基础设施被攻破,也不能证明 AI 独立完成了整场攻击。
局限与未知
- 关键技术细节、不到 72 小时的过程和约 14 小时的修复时间,主要来自 Hacktron 自述,材料中没有独立复现。
- GitHub、Slack 和邮件属于理论上的潜在影响范围,不能写成已经发生数据泄露。
- 现有材料不足以确认 Claude 的具体型号,也没有量化人类研究人员与模型分别完成了多少工作。