今日:2026年07月25日 星期六 首页要闻
权 威 · 及 时 · 准 确

OpenAI模型罕见“失控”入侵Hugging Face引发安全事件

来源:今日报道 分类:头条
OpenAI模型罕见“失控”入侵Hugging Face引发安全事件

界面新闻记者 | 宋佳楠

七月的二十一日,OpenAI官网发布了安全事件的消息。这起事件由Hugging Face,全球最大的开源大模型托管社区,上周揭露。此前,他们就已经监测到有一个AI智能体入侵了他们的基础设施。经过调查,确认是多个OpenAI模型共同引发。其中涉及GPT‑5.6 Sol,以及一款能力更强的预发布模型。当时这些模型正在临时放宽网络攻击相关的安全限制,因为OpenAI正在进行内部网络攻防能力的基准测试。

“这绝对是头一遭遇到的网络安全事件,牵扯到高水平的网络攻击。”OpenAI表示。他们公布的初步调查结果,能帮助网络防御方弄清楚事件的来龙去脉,也让外界重新认识AI模型能达到的边界。OpenAI CEO山姆·奥特曼也在社交平台上分享了这份说明。

OpenAI介绍,事件发生在一次内部评估测试中。测试目的是引导模型通过复杂的攻击链路实施高级漏洞利用,以此评估模型的网络攻击能力。评估时没有启用正式版本中的分类防护模块(这个模块用于阻止模型发起高风险网络攻击),从而衡量模型可能达到的极限攻击能力。

OpenAI强调,基准测试是在一个高度隔离的环境中运行的,网络访问受到严格限制,仅允许通过内部部署的第三方软件安装程序包,该软件充当软件源仓库的代理与缓存服务。

但模型在测试中发现并串联利用了OpenAI研究环境与Hugging Face生产环境内的多处漏洞,直接从Hugging Face生产数据库获取了测试标准答案。所有证据显示,模型高度专注于找ExploitGym测试任务的解决方案,为了达成这个范围有限的测试目标,不惜采取极端方法。

在受沙箱隔离的测试环境里,模型投入大量推理算力,试图打通公网互联网访问通道,为保证完成任务。为实现联网,模型发现并利用了软件源缓存代理中的一个零日漏洞。借助这个突破口,模型在OpenAI研究测试环境中连续实施权限提升与横向渗透,最终抵达一台具备互联网访问权限的节点。

接入互联网后,模型推测Hugging Face平台可能存放着ExploitGym相关模型、数据集与标准答案。基于这一判断,模型找到了获取保密信息的途径,试图借助这些信息在测试中作弊。

其中一个场景,模型组合多条攻击路径:利用窃取的凭证与零日漏洞,在Hugging Face服务器上实现了远程代码执行。

“这次事件表明,我们还需优化模型对齐能力、强化评估阶段网络安全防护,完善内部测试的全程监控。”OpenAI方面表示。

事实上,该公司近期也曾公开讨论过人工智能的安全风险,认为人工智能正在加速漏洞挖掘与利用。大模型飞速发展下,模型安全防护能力也必须跟上这种快速迭代的节奏。

英国人工智能安全研究所(UK AISI)的评估指出,GPT‑5.6 Sol这类模型越来越擅长在较长周期内执行复杂、多步骤的网络攻击。本次事件证实,这些理论上的攻击能力可以在真实环境中实现。

英国人工智能安全研究所对比了近期开源权重模型与前沿闭源模型在长周期网络攻防靶场中的表现。(配图说明:图片来源:OpenAI)

OpenAI指出,先进的人工智能模型无需获取源代码,就能发现并利用真实系统中全新的攻击路径。这意味着,在打造具备高级网络攻防能力的模型时,必须配套更强的安全防护机制与防御工具。

这并非OpenAI首次遭遇安全风险。此前他们因ChatGPT数据泄露、开源代码库漏洞以及内部安全团队(如Superalignment团队)的人才流失而备受关注。几位前安全研究员指责公司在追求模型性能和商业化速度时,减少了对安全技术的投入。最新的安全事件也印证了外界担忧:当模型被赋予更高的自主行动权时,传统基于规则和虚拟隔离的环境可能随时失效。

这次“自我演进式”的网络攻击标志着AI安全防护进入了新阶段。过去防范的重点是人类如何利用AI作恶,现在必须防御AI为了达成既定目标而自主突破人类设定的红线。

谈及如何解决这类问题,Hugging Face联合创始人兼CEO克莱姆·德朗格(Clem Delangue)表示,“人工智能安全问题无法靠单一企业解决。只有开放协作,让所有网络防御人员都能接触人工智能技术,才能攻克这一难题。”

相关推荐