继OpenAI公开失控模型入侵事件后,Anthropic的入侵事件必将进一步加剧人们的担忧,让外界更加关注强大AI模型的潜在危害及应对之策。
Anthropic周四表示,其测试中的软件曾接入互联网,并在该AI公司不知情的情况下入侵了一些毫无防备的公司。此类独立事件共发生三起,最早可追溯至今年4月。
这家人工智能(AI)开发商没有说明哪些公司遭到入侵,但Anthropic表示,这三家公司均已在周一接到了事件通知。
就在这一消息公布的一周前,OpenAI透露其AI技术突破了测试沙盒,入侵了AI公司Hugging Face。测试沙盒是一种本应与互联网断开连接的数字监狱。
OpenAI事件令安全研究人员和AI专业人士感到不安。这也提醒人们,AI系统能够自主运行,并被设计用来采取各种行动以完成任务和实现用户目标,其力量和不可预测性不容小觑。
网络安全公司Corridor的首席产品官亚历克斯·斯塔莫斯(Alex Stamos)表示,这些事件表明,AI公司需要制定更严格的全行业标准,确保在网络测试期间将系统彻底隔离。
斯塔莫斯说,这些事件也揭示了未来令人担忧的一幕:勒索软件犯罪分子可能会利用能力日益强大的AI系统发动大规模攻击。”我们需要做好准备,攻击者很快就会利用开放权重模型掌握此类能力。”
Anthropic的入侵事件必将进一步加剧人们的担忧,让外界更加关注强大AI模型的潜在危害及应对之策。白宫最近已采取行动加强对AI的监管,而私营企业则日益强烈地呼吁保留对所谓”开放权重模型”的使用权,此类模型可以在用户控制的计算机系统上运行。
“AI发展极其迅速,却没有真正的法规来保障我们的安全,”得克萨斯州民主党众议员格雷格·卡萨尔(Greg Casar)上周表示。
听闻OpenAI的问题后,Anthropic决定审查自家的网络测试,排查旗下模型是否也出现了类似情况。
在排查了超过14.1万次测试日志后,Anthropic发现Claude确实曾数次接入互联网。但在最终查明的三起入侵事件中,Claude并没有突破沙盒;它只是从根本不存在沙盒的系统中溜了出来。
Anthropic表示,该公司的测试合作伙伴、以色列安全公司Irregular运行的系统存在”配置错误”,导致这些模型获得了实时的互联网访问权限。
Irregular的一名发言人表示,该公司正在调查这起事件。
这些模型之前接收到的指令是互联网不可用。但在测试过程中,它们不仅连上了网,还利用猜测弱密码或潜入无需身份验证的系统等基本黑客手段,入侵了上述企业。
Anthropic表示,这些模型错误地以为,这种入侵行为是其基准测试的一部分。
Claude通过创建一段被某未具名安全公司扫描系统下载的恶意软件,成功潜入了该公司的系统。随后,该软件窃取了用于进入这家安全公司基础设施的凭据。
在这次黑客攻击中,Claude意识到自己的所作所为不该在现实世界中发生,但它说服自己正处于一个模拟环境中。
在最严重的一起案例中,Claude试图入侵一家虚构的公司,而这家公司恰好与一个现实世界的网站同名。当Claude发现难以攻破这家用于基准测试的假公司时,它转而入侵了那家现实世界公司的数据库。
Anthropic表示,在所有事件中,只有在这起数据库入侵案里,Claude在意识到自己侵入了一家现实世界的公司后仍继续实施了攻击。
在另外两起案例中,Claude要么从未意识到自己入侵了现实世界的公司,要么在弄清状况后立即停止了黑客攻击。
Anthropic称,这些入侵事件始于4月,涉及Opus 4.7、Mythos 5以及一个未命名的研究模型。
Enjoyed this article? Sign up for our newsletter to receive regular insights and stay connected.

