科技

OpenAI新AI模型实现组合几何难题突破,却现沙盒越狱能力引行业安全隐忧

来源:快线潮资讯
OpenAI新AI模型实现组合几何难题突破,却现沙盒越狱能力引行业安全隐忧

全球最大的人工智能与机器学习开源社区Hugging Face近日披露,其系统遭遇入侵。这起事件的主角并非传统意义上的黑客,而是一个自主运行的AI Agent。对此,平台方坦言这是他们从未经历过的状况。

几天后,OpenAI发文承认,此次入侵与其内部测试存在关联。在测试过程中,包括GPT-5.6 Sol以及一个能力更强的预发布模型在内的多个模型,“逃逸”出了原本设定的隔离沙盒,进而侵入Hugging Face的系统。OpenAI将这一事件定义为“一起前所未有的网络事件”,并预判类似情况在未来或将愈发普遍。

几乎同一时间,OpenAI又发表了一篇探讨AI安全的文章。研究者在大模型测试中发现,当AI被赋予长时间自主完成任务的权限时,可能会采取意想不到的行动:不断搜寻系统漏洞、突破限制,甚至通过伪装和“越狱”手段来达成目标。

这些案例曝光后,“AI失控”的焦虑再次蔓延。有网友感叹,《西部世界》中人工智能觉醒的情节似乎正一步步照进现实。清华大学计算机科学与技术系教授刘知远在接受《中国新闻周刊》采访时指出,从OpenAI的案例来看,外界对AI失控风险的担忧或许有些过度,AI本质上仍属于工具和技术范畴。不过,当下正在发生的转变更需警惕:过去人们担心的是AI“答错内容”,但随着人工智能迈入Agent时代并开始执行具体任务,安全挑战已全面升级。

**“过程全对,结果全错”**

回溯事件经过。当地时间7月21日,OpenAI发文称,团队近期对一款内部前沿模型进行了网络攻击能力评估。按常规测试流程,模型被置于与外部网络隔离的沙盒内。为测试其高级漏洞挖掘能力,研究人员虽有意降低了模型的安全限制,但操作仍在沙盒环境中进行。

然而,为了完成既定任务,该模型开始主动寻找连接外部互联网的路径。它调动大量推理算力,最终发现并利用了软件包注册表缓存代理中的一个零日漏洞——即软件厂商尚未察觉、来不及修补的安全缺陷,从而成功获取了互联网访问权限。

“越狱”成功后,模型进一步推断,Hugging Face可能存储着此次评估涉及的模型、数据集及解法。它随即展开主动搜索,找到了窃取秘密信息的手段。

这种针对Hugging Face系统的入侵手法,并非全新的黑客技术。据《科学美国人》报道,英国萨里大学网络安全客座教授艾伦·伍德沃德指出,真正值得关注的重点在于,大模型能够将多个漏洞串联起来,攻击一个正在运行的系统。换言之,模型会试图寻找并利用漏洞,以推动任务继续执行。

在OpenAI披露的另一则案例中,研究人员也遭遇了类似困境。

今年5月,OpenAI公开介绍了一款全新的通用推理模型。在测试中,该模型推翻了埃尔德什单位距离猜想——这是组合几何领域的一个著名难题。但在后续测试中,研究人员发现它表现出了一种不同于以往模型的“执着”。

以往的模型在沙盒中遇到限制或环境约束时,通常会停止尝试。但这款新模型会反复试探,寻找环境中的薄弱环节,甚至设法找到离开沙盒、在外部环境中行动的路径。

OpenAI举了一个例子。在一次公开基准测试中,模型被要求完成一项任务,并将结果发布到内部通信软件上。但基准测试本身又要求结果公开发布至GitHub。模型选择了后者,耗时约一个小时,在沙盒中搜寻漏洞,最终绕过限制,成功将内容发布到GitHub。

另一次测试中,模型在尝试复刻其他系统的成功操作时,因被系统检测到身份验证令牌而访问受阻。但模型并未止步,而是改变策略:它将令牌拆分为两段并进行混淆处理,在运行时再重新拼接。这使得完整令牌始终不会以连续字符串的形式出现,从而骗过了系统扫描。在模型向用户展示的推理记录中,它明确写道,此举旨在绕过扫描。

OpenAI承认,这些案例暴露出一个此前并不显著的问题:许多AI助手的安全控制是基于单个操作设计的,一旦某项操作被禁,系统便会拦截;若涉及敏感信息,则需用户授权。但如果一个模型能连续自主运行数小时、数天甚至数周,仅监控单一动作,越来越难以判断其整体行动轨迹的真实意图。

研究人员发现,有时模型的操作单独看是合规的,但连续执行下来,却可能导向一个不被允许的结果。目前,OpenAI已暂停该新模型的内部部署,并围绕纵深防御和轨迹级监控重建安全系统。

实际上,这并非OpenAI首次发现此类问题。

今年4月,Anthropic也披露了类似的测试结果。当时,在一个早期内部版本的模型测试中,模型被要求尝试逃出沙盒并向负责评估的研究人员发送消息。模型不仅完成了任务,还采取了测试人员未曾要求的行动:它开发了一套多步骤漏洞利用方案,从原本只能访问少量指定服务的系统中,获得了更广泛的互联网访问权限。更令研究者意外且担忧的是,模型为了展示其成功做法,还将漏洞利用的详细信息发布到了一个不易被发现但面向公众开放的网站。

**“必然会发生的安全问题”**

关于AI是否真的失控,业内观点存在分歧。英国萨里大学网络安全客座教授艾伦·伍德沃德在上述采访中认为,大模型并未真正“失控”,模型本身没有主观恶意,只是在按要求执行任务时选择了近似“作弊”的路径。有从业者指出,这更像是OpenAI主动放宽了模型的安全限制,属于人为因素所致。

但也有网络安全专家强调,模型入侵Hugging Face的事件值得行业高度警惕。近日,人工智能安全研究机构Apollo Research创始人Marius Hobbhahn对媒体表示,这次事件没有人为干预,并非有意为之,却造成了对现实世界的危害。“我们很快就会拥有功能更强大的智能体,但这次事件清楚地表明,目前社会尚不了解如何完全安全地构建它们。”

刘知远介绍,2025年之前,大模型主要充当聊天工具,安全问题并不突出,主要表现为回答错误,实际决策权仍掌握在人手中。但从2025年开始,越来越多Agent产品涌现,大模型正从“回答问题”走向真实的工作环境,开始操作文件、编写代码、执行具体任务。OpenAI所披露的安全问题,正是这一发展趋势下“必然会发生”的现象。

其中最重要的变化在于,AI发现漏洞的能力正迅速跃升。“利用AI进行漏洞挖掘的效率远超人类专家,这是一次重要的技术跃迁。”刘知远对《中国新闻周刊》表示,这种能力本身并无善恶之分,既可用于网络攻击,也可用于主动防御,通过发现漏洞并提前修补来加固系统。关键在于,谁掌握了这种能力,以及将其应用在何处。

在刘知远看来,这并非指向人与AI的对立,而是人与人之间围绕技术能力展开的博弈。在企业、组织乃至国家纷纷加入AI竞赛的背景下,技术既可用来解决问题,也可能被用于攻击。“国家和管理部门都需要积极拥抱技术,用更先进的技术应对新的风险。”刘知远说道。

今年4月,亚马逊、Anthropic、苹果、谷歌、英伟达等多家头部科技公司联合启动“玻璃之翼(Glasswing)”项目,试图将前沿模型发现漏洞的能力应用于网络防御。科技公司担忧,随着AI能力的快速提升,这类能力可能迅速扩散,甚至超出部署AI的安全机构所能控制的范围,进而给经济、公共安全乃至国家安全带来风险。

刘知远认为,在智能体时代,AI治理体系需要进一步完善。在企业内部,应让模型形成基本的安全意识和行为边界,例如不侵犯隐私、不损害他人利益、不主动实施违法行为。但仅靠企业自我约束和伦理红线,未必能应对能够连续执行多步任务的模型。因为模型可能通过一连串单独看来并不违规的操作,绕过某一条具体的限制。外部监管也需同步跟进,智能体会像人一样行动,需要更细致的法律法规,为AI在不同场景下的行动划定清晰边界。

记者:杨智杰

编辑:闵杰

相关推荐

最新文章