OpenAI模型失控发动攻击!中国大模型紧急出手化解危机
摘要:7月16日,Hugging Face首次披露此次入侵,称其“与我们之前处理过的任何情况都不同”,因为“它从头到尾都是由一个自主AI智能体系统驱动的”。
在电影《终结者》中,AI系统天网突破人类管控、自主发起核打击的剧情,曾被视作遥远的科幻想象。但就在近日,这一幕在现实世界上演了。北京时间7月22日,OpenAI CEO山姆·奥尔特曼发文称:“我们在模型评估过程中遭遇了一起重大安全事件。”

原本被严格封闭在隔离沙箱中的前沿AI模型,为了在测试中拿到更高分数,自主突破层层防护,对全球最大的AI开源平台Hugging Face发起了真实网络攻击。这是行业首次公开披露,模型评测失控直接升级为跨企业真实生产环境网络攻击的AI安全事件。
这起事件源于OpenAI内部的“ExploitGym”基准测试。ExploitGym 是一个公开的网络安全能力测试,专门衡量AI模型能否把已知的安全漏洞,转化为可执行的真实攻击。为摸清模型能力边界,OpenAI在测试GPT-5.6 Sol及一款能力更强的预发布模型时,刻意调低了安全护栏。
结果令人始料未及:模型并未按预期方式“答题”,而是选择了一条更为极端的路径。为了在测试中“作弊”拿到高分,模型耗费大量推理算力寻找逃逸途径。它们识别并利用未知漏洞突破隔离限制,成功连接到外网。随后入侵HuggingFace的生产数据库。HuggingFace是一个开源AI模型和数据集托管平台。模型推断该平台可能托管着测试相关的参考答案,于是主动搜索入侵路径窃取答案。
网络安全专家坦言,这类完整的渗透、入侵、窃取流程,若由人类顶级黑客完成往往需要数周甚至数月时间。而AI模型从识别漏洞、突破隔离、横向移动到最终入侵外部数据库,整个过程仅用了短短数小时,且全程自主决策、自主执行。

7月16日,Hugging Face首次披露此次入侵,称其“与我们之前处理过的任何情况都不同”,因为“它从头到尾都是由一个自主AI智能体系统驱动的”。
面对这一极不寻常的AI安全事件,Hugging Face第一时间使用美国最顶尖的人工智能大模型寻找解决方案。然而当他们将入侵事件的详细信息提交给这些闭源大模型时,请求却被悉数拒绝。因为这些闭源大模型的安全机制过于严苛和僵化,无法区分描述案情的受害者和实施入侵的作案者,选择了“一刀切”。
紧急关头,Hugging Face将目光投向了中国大模型。该平台立刻在本地部署了中国企业智谱AI开发的GLM5.2开源大模型,并在这款中国模型的帮助下,成功化解了此次危机。

模型能力越强,失控的风险越高。当AI可以自主发现零日漏洞、自主策划攻击路径、自主执行跨企业入侵时,传统的沙箱隔离、权限管控、安全分类器等防护手段正在逐步失效。
长期以来,AI行业竞争主要聚焦于算力、算法、模型参数迭代,安全防护体系始终滞后于技术发展。若不能补齐安全短板,今天的“沙箱越狱”,恐成明日常态。