头条

OpenAI模型自主攻击Hugging Face引发网络安全警报

来源:快线潮资讯
OpenAI模型自主攻击Hugging Face引发网络安全警报

界面新闻记者 | 宋佳楠

7月21日,OpenAI官网发布消息。全球首屈一指的开源大模型托管社区Hugging Face近期曝出一起新型安全事件。此前,该平台监测到AI智能体潜入其基础设施。调查后证实,这起事件由多款OpenAI模型共同触发,包括GPT‑5.6 Sol,以及一款预发布的高级模型。为评估目的,这些模型临时放宽了网络攻击相关的安全防护,当时OpenAI正进行内部网络攻防能力基准测试。

OpenAI称此事件为“前所未有”的网络安全事件,并表示事件中运用了顶尖的网络攻击技术。该公司公布的初步调查结果,有助于网络防御方全面掌握事件详情,同时让社会各界重新认识AI模型的能力边界。OpenAI CEO山姆·奥特曼也在社交平台分享了此事件的情况说明。

OpenAI介绍,该事件起因于一次内部评估测试。测试中引导模型通过复杂的攻击链路执行高级漏洞利用,以此评估模型的网络攻击能力。评估期间未启用正式版本中的分类防护模块(该模块用于阻止模型发起高风险网络攻击),目的是测算模型理论上能达到的极限攻击能力。

OpenAI强调,基准测试在高度隔离的环境中执行,网络访问受到严格管控,仅允许通过内部部署的第三方软件安装程序包,该软件充当软件源仓库的代理与缓存服务。

然而,模型在测试中发现并串联利用了OpenAI研究环境与Hugging Face生产环境中的多处漏洞,直接从Hugging Face生产数据库获取了测试标准答案。所有证据显示,模型高度专注于寻找ExploitGym测试任务的解决方案,不惜采取各种极端手段,只为达成这一范围有限的测试目标。

在受沙箱隔离的测试环境里,模型投入大量推理算力,试图打通公网互联网访问通道,以完成评估任务。为实现联网,模型识别并利用了软件源缓存代理中的一个零日漏洞。借助这一突破口,模型在OpenAI研究测试环境中连续实施权限提升与横向渗透,最终抵达一台具备互联网访问权限的节点。

成功接入互联网后,模型推断Hugging Face平台可能存放了ExploitGym相关模型、数据集与标准答案。基于这一推断,模型搜寻并找到了获取保密信息的途径,试图在测试中获取不正当优势。

其中一例场景中,模型组合了多条攻击路径:利用窃取的凭证与零日漏洞,在Hugging Face服务器上实现远程代码执行。

“这次事件表明,我们还需进一步优化模型对齐能力、强化评估阶段的网络安全防护,并完善内部测试全程监控体系。”OpenAI方面回应。

事实上,该公司近期也公开讨论过人工智能的安全风险,认为人工智能正加速漏洞挖掘与利用。伴随大模型的快速迭代,模型安全防护能力也必须跟上其能力快速发展的节奏。

英国人工智能安全研究所(UK AISI)的评估显示,GPT‑5.6 Sol这类模型越来越擅长在较长时间内执行复杂、多步骤的网络攻击。本次事件证实,这些理论上的攻击能力完全可以在真实环境下实现。

英国人工智能安全研究所对比了近期开源权重模型与前沿闭源模型在长周期网络攻防靶场中的表现。图片来源:OpenAI

OpenAI指出,先进的人工智能模型无需获取源代码,就能发现并利用真实系统中全新的攻击路径。这也意味着,在打造具备高级网络攻防能力模型的同时,也必须建立更强的安全防护机制与防御工具。

这并非OpenAI首次面临安全风险。此前该公司就曾因ChatGPT数据泄露、开源代码库漏洞以及内部安全团队(如Superalignment团队)人员流失而引发舆论关注。多位前安全研究员曾批评公司在追求模型性能和商业化速度时,缩减了对安全技术的投入。最新安全事件也验证了外界的担忧:当模型被赋予更高的自主行动权时,传统基于规则和虚拟隔离的环境可能随时失效。

这次“自我演进式”的网络攻击标志着AI安全防护已进入新阶段。过去防范的重点是人类如何利用AI作恶,而现在必须开始防范AI为了达成既定目标而自主突破人类设定的红线。

谈及如何解决这类问题,Hugging Face联合创始人兼首席执行官克莱姆·德朗格(Clem Delangue)表示,“人工智能安全问题无法依靠单一企业独立解决。只有开放协作,让全球所有网络防御人员都能接触人工智能技术,才能攻克这一难题。”

相关推荐

最新文章