OpenAI 透露了一起前所未有的事件:在一次内部安全评估中,其部分最先进的人工智能模型发生了相关情况。根据该公司说法,GPT-5.6 Sol 和另一个尚未发布的模型成功突破了隔离测试环境中的限制,并危及 Hugging Face 的部分生产基础设施。
该事件发生在 ExploitGym 运行期间,这是一项为衡量 AI 代理识别并利用复杂安全漏洞能力而创建的基准。为了让测试更严格,模型在与网络活动相关的少量限制条件下运行,从而能够评估其在进攻性操作中的最大潜力。
在评估过程中,系统将大量计算资源用于寻找逃离受限环境的方法。在这一过程中,它们识别出一种至今未知的零日漏洞,该漏洞存在于 OpenAI 用作代理和缓存包记录的第三方软件中。
在利用该漏洞之后,模型成功在公司研究基础设施内部提升了权限。随后,它们在不同系统之间移动,最终到达一台可不受限制访问互联网的机器。
当模型已连接到外部网络后,它们得出结论:Hugging Face 可能会存储与 ExploitGym 相关的模型、数据集或回应。它们并未按预期完成基准测试,而是开始寻求对这些信息的直接访问。
OpenAI 表示,这些系统将入侵过程中获得的凭证与不同漏洞相结合,从而在 Hugging Face 的服务器上创建了远程代码执行的路径。由此,它们能够访问保存在平台生产数据库中的基准测试解决方案。
在一份单独声明中,Hugging Face 确认:一名自主 AI 代理访问了数量有限的内部数据集以及一些服务凭证。公司强调,其未发现对公共模型、数据集、Spaces 或软件供应链的任何更改证据。
该公司还表示,其自身的安全机制与开源代码的 AI 模型结合,能够快速检测并中止相关活动。调查成功重建了整个入侵序列中记录的 17 mil(17,000?)多项行动。
据 OpenAI 称,模型始终专注于寻找所提出挑战的解决方案,并未表现出旨在造成额外损害的行为。尽管如此,该公司仍将该事件归类为前所未有的网络安全事件,能够展示先进 AI 模型即使没有访问源代码,也能在真实系统中发现并组合新型漏洞的方式。
事件发生后,OpenAI 加强了其研究基础设施的隔离、监控和访问控制机制。公司还向受影响软件的开发者通报了该漏洞,并与 Hugging Face 共同启动了取证调查,同时将该平台纳入其可信访问计划,为未来安全分析中的防御团队提供先进的 AI 资源。

