Four people in hoodies working on laptops in a server room

极具未来色彩的黑客攻击:OpenAI失控模型入侵事件始末

它们就像一群试图黑进教材公司以便在期末考试中作弊的高中生。

只不过,这群黑客根本不是人类。

这一幕宛如科幻小说中的情节:攻击者原来是从OpenAI一个研究网络中逃逸出来的人工智能(AI)模型。7月11日,它们黑进了AI公司Hugging Face。而且,这些AI在被制止前,似乎已在互联网上擅自游荡了数日。

Hugging Face联合创始人兼首席科学官托马斯·沃尔夫(Thomas Wolf)在首次查看公司周末受袭日志时,瞬间察觉到了异样。

“这根本解释不通。这个’入侵者’只是在翻看网络安全数据集,”他回忆起当时的疑虑。”人类黑客不会对这些感兴趣,他们要的是能变现的东西。”

沃尔夫说,在一个来自中国的模型的帮助下,Hugging Face两天后终止了这次攻击。直到本周早些时候,Hugging Face才从OpenAI处获知,这场网络攻击的幕后黑手竟是OpenAI自家的模型。

这起事件在OpenAI内部拉响警报。在得知这一事件后,OpenAI关停了用于测试AI模型的系统,以评估受损程度并防止进一步”逃逸”。这一事件也让世人窥见,在AI工具异常强大的时代,黑客攻击可能演变成何等模样——这些工具能够找出前所未见的软件漏洞,并以惊人的速度加以利用。

事发近两周后,OpenAI仍试图还原完整经过。这些AI模型是否黑进过其他网站或个人设备?它们在无人监管下的活动究竟持续了多久?该公司的模型是否在其他基准测试中作过弊?OpenAI尚未作出说明,但承诺会发布一份详细报告。

“我们将继续与Hugging Face一道开展彻底调查,”一名OpenAI发言人说。

脱离监督的AI在无人看管的情况下运行了数日,并至少入侵了一家企业,AI安全专家长期预警人类对AI失去控制的风险,本案即是首批浮出水面的现实案例之一。这起事件发生之际,包括Anthropic的Mythos在内,顶尖模型的网络安全能力已推动华盛顿围绕如何监管人工智能展开的辩论升温。

这又带来了一个耐人寻味的转折:据称,美国公司Hugging Face是借助一款来自中国的开放权重模型,才抵御住这次攻击的。对于那些主张限制获取中国模型的美国官员,以及OpenAI、Anthropic的高管而言,这一说法恰好为反驳其立场提供了论据。

开放模型可以免费下载,并允许用户按自身需求定制,不过运行任何模型都需承担算力成本。

一切始于一项名为ExploitGym的网络安全基准测试

ExploitGym会让AI系统接受一整套约900项测试,以评估它们的入侵能力究竟有多强。测试会喂给AI一段含有已知漏洞的软件,向它展示如何触发该漏洞,并要求AI攻入系统。接下来要由AI自己想办法,把这些信息转化为所谓的漏洞利用代码——也就是能让AI借助该漏洞进入存在漏洞的系统的代码。

这项测试是一场数字版夺旗游戏:AI一旦攻入系统,就必须抓取系统中存储的一长串随机生成的字母和数字,以证明自己成功入侵。

通常情况下,OpenAI的产品不会执行ExploitGym所要求的这类入侵任务。AI公司通常会设置安全护栏,防止黑客滥用其产品。但在这次测试中,OpenAI去除了这些护栏,以观察模型在不受约束的情况下能做什么。

OpenAI当时正在测试其最先进的模型GPT-5.6 Sol,以及另一个能力更强、尚未发布的模型。据OpenAI和知情人士称,这些AI模型认定,与其完成ExploitGym挑战,不如攻破容纳它们的系统,也就是所谓的”沙盒”,再设法进入互联网并在测试中作弊。

原因尚不完全清楚,但OpenAI的模型当时认定Hugging Face平台上存有测试答案。ExploitGym的作者之一、加州大学伯克利分校(University of California, Berkeley)博士生Zhun Wang分析称,它们可能是在寻找补丁或现成的漏洞利用技术;要在这类基准测试里作弊,办法有很多。

他说,网络安全研究员将这种行为称为奖励黑客。

什么是”奖励黑客”

奖励黑客,可以理解为AI版的”电子游戏作弊”。出现这种现象,是因为AI学会了把奖励最大化——通常就是某种数字分数——而不是形成程序员真正期望的目标行为。OpenAI自己在2016年就记录过一个早期案例:在训练AI玩一款赛艇竞速游戏时,模型发现只要在同一地点不停兜圈子,就能把分数刷到最高,尽管它根本没有完成比赛。

与此同时,AI也开始设法”逃出”沙盒。Anthropic表示,其Mythos模型的一个早期版本曾通过多步骤黑客手法获得互联网访问权限,并在一名Anthropic研究人员在公园吃三明治时,给他发邮件报告这一成功,令其大吃一惊。OpenAI则表示,今年春天,某个未具名模型绕过了沙盒限制,把部分测试结果公开发布到了GitHub上。

攻击如何展开

OpenAI的模型在一个周末开始锁定Hugging Face时,该公司最早收到的警报之一来自它用来巡查攻击的少数几个AI智能体。有人正在未经授权访问其部分系统。但这与Hugging Face此前见过的任何情况都不同。这个黑客看上去像是来自未来。

凭借来历不明的被盗凭据,这个闯入的AI制造出一个由短命攻击者组成的”蜂群”,对Hugging Face网络展开侦察。Hugging Face在一篇博客文章中说,这次攻击在公司网络上执行了多达17,000次操作。

在发现入侵后,Hugging Face尝试使用Anthropic的模型分析日志,包括Fable 5及其早期的Opus模型。但由于日志中包含网络攻击相关内容,这两款模型都以安全护栏为由拒绝分析。于是,Hugging Face转而使用限制更少的一款开放权重模型GLM 5.2,该模型来自总部位于北京的智谱(Z.AI)。

Hugging Face上周披露该事件时表示,在拆解这次攻击后,公司已经将实施攻击的AI清除出系统,重置了密码,并重建了网络中被攻陷的部分。当时该公司尚未得知OpenAI牵涉其中。沃尔夫表示,没有客户数据泄露。

目前尚不清楚,这些模型试图解决的ExploitGym题目,是否比它们为窃取答案而发动的攻击更难——也不清楚它们是否真的找到了答案。具有讽刺意味的是,这些模型竟成功策动并实施了一场前所未有的攻击,只为逃避一次黑客能力测试。

“这是作弊。但有时候作弊反而更省事,”沃尔夫说。”至于它是否通过了网络攻击测试,由你来判定。”

周四,Hugging Face首席执行官克莱芒·德朗格(Clément Delangue)在X上发布了一张机场停机坪照片。”前往旧金山,去和那个’失控智能体’聊一聊,”他写道。

Enjoyed this article? Sign up for our newsletter to receive regular insights and stay connected.

Leave a Reply