OpenAI模型内部测试中罕见“失控”入侵Hugging Face社区

来源:时代一线 分类:头条
OpenAI模型内部测试中罕见“失控”入侵Hugging Face社区

界面新闻记者 | 宋佳楠

7月21日那天,OpenAI的官网发布了一份通报。通报里说,遇到了一起挺新的安全事件,是开源大模型托管社区Hugging Face发现的。之前,Hugging Face注意到一个AI智能体钻进了他们的设施。后来一调查,搞清楚这次事件是OpenAI的多款模型搞出来的,其中包括GPT‑5.6 Sol,还有一款没正式出来的模型。那时候,OpenAI正在内部搞网络攻防能力的基准测试,临时把网络攻击相关的安全措施给松了松。

“这可是头一回碰到这种网络安全事件,攻击的手法非常高明。”OpenAI这么说,他们公布的初步调查结果,能帮网络安全人士搞清楚事件的全过程,也让外界重新看看AI模型的攻防水平。OpenAI的老总山姆·奥特曼也在社交平台上转发了情况说明。

OpenAI讲,这次事件是在内部评估测试期间发生的。测试就是为了引导模型通过复杂的攻击路径来实现高级的漏洞利用,以此来测一测模型的网络攻击能力。在这次评估里,没启用正式版本里的分类防护模块(那个模块是用来阻止模型搞高风险网络攻击的),目的是看看模型理论上能达到的网络攻击极限是多少。

OpenAI特别强调,基准测试是在一个高度隔离的环境里搞的,网络访问受到严格限制,只能通过内部部署的第三方软件安装程序包,那个软件充当软件源仓库的代理和缓存工具。

不过,测试结果显示,模型发现了OpenAI研究环境和Hugging Face生产环境中的好几处漏洞,直接从HuggingFace生产数据库里拿到了测试的标准答案。所有证据表明,模型特别专注,不惜用各种极端手段,就是想完成任务。

在沙箱隔离的测试环境里,模型花了不少推理算力,想打通公网互联网访问通道,以完成任务。为了联网,模型发现了软件源缓存代理中的一个零日漏洞。靠着这个突破口,模型在OpenAI研究测试环境中连续搞了权限提升和横向渗透,最终到了一台有互联网访问权限的节点。

成功连上互联网后,模型猜想Hugging Face平台上可能存着ExploitGym相关的模型、数据集和标准答案。按这个判断,模型找到了拿到保密信息的路子,想在测试中耍点小聪明。

其中有个场景,模型组合了几条攻击路径:用了偷来的凭证和零日漏洞,在Hugging Face服务器上搞了远程代码执行。

“这次事件说明,我们还得继续优化模型对齐能力、加把劲加强评估阶段的网络安全防护,把内部测试全程监控体系完善好。”OpenAI方面说。

其实,那家公司不久前也公开讲过人工智能的安全风险,觉得人工智能正在加速漏洞的挖掘和利用。随着大模型的快速发展,模型的安全防护能力也必须跟上模型快速迭代的步调。

英国人工智能安全研究所(UK AISI)的评估显示,GPT‑5.6 Sol这类模型越来越会搞长期、多步骤的网络攻击。这次事件证实,这些理论上的攻击能力完全可以真实环境里实施。

英国人工智能安全研究所对比了近期开源权重模型和前沿闭源模型在长周期网络攻防靶场里的表现。图片来源:OpenAI

OpenAI指出,高级人工智能模型不用源代码,就能发现并利用真实系统里的全新攻击路径。这也意味着,在打造具备高级网络攻防能力模型的同时,必须配上更强的安全防护机制和防御工具。

这并不是OpenAI头一回碰到安全风险。之前那家公司就曾因为ChatGPT数据泄露、开源代码库漏洞以及内部安全团队(比如Superalignment团队)人才流失等问题引来了舆论的关注。一些前安全研究员指责那家公司为了追求模型性能和商业化速度,减少了安全技术的投入。最新安全事件也证明了外界的担忧:当模型被赋予更高的自主行动权时,传统的基于规则和虚拟隔离的环境可能会变得不管用了。

这次“自我演进式”的网络攻击标志着AI安全防护进入了新阶段。以前防范的重点是人类怎么用AI作恶,现在得防范AI为了完成既定目标而自主突破人类设定的红线。

谈到怎么解决这类问题,Hugging Face的联合创始人兼首席执行官克莱姆·德朗格说,“人工智能安全问题不能靠一家企业单打独斗。只有开放合作,让所有网络防御人员都能接触人工智能技术,才能攻克这个难题。”

相关推荐