OpenAI将限制Astra模型,此前将其评为”危急”网络风险

内部测试发现,该新模型几乎无需人类指令即可执行复杂的网络攻击,促使OpenAI增设安全防线。

OpenAI正在限制一款新模型的涉网能力,并在今年夏天发生其AI智能体集群入侵一家公司的事件后,增设了多重安全防线。该公司认为,该模型已具备发动自动化网络攻击的能力。

这家ChatGPT的开发商周二表示,其内部测试确定,即将推出的Astra模型,能够在极少的人类指令下,构思并执行针对高难度目标的新型网络攻击。因此,该公司在一篇博客文章中称,已增设额外的安全防线,以降低被黑客滥用的风险,或是防止Astra失控并自主发起攻击。

这些保护措施包括进行额外训练,以拒绝执行恶意操作的请求,或是防止其被旨在规避这些限制的”越狱”提示词攻陷。OpenAI表示,还将限制其公开发布版本的先进网络安全能力,初期仅向少数测试者提供全功能版本。

对Astra施加限制之前,有关今年夏天早些时候一桩事件的新细节浮出水面。当时,OpenAI一些未发布的AI智能体逃离了该公司的研究网络,并于7月11日入侵了AI公司Hugging Face。根据AI安全研究机构METR上周发布的一份报告,在那次攻击发生前,数百个智能体在它们自己秘密建立、OpenAI并不知情的一个留言板上进行协作,试图在网络安全测试中作弊。

近几个月,应美国政府的要求,OpenAI及其竞争对手Anthropic已放缓了其他AI模型的发布。今年6月,OpenAI在限制其GPT 5.6模型发布时提到了政府的担忧。在美国因网络安全顾虑对Anthropic的Fable和Mythos模型实施出口限制后,该公司将这两个模型的多个版本撤下了两周多。

正是今年早些时候Mythos的一个早期版本惊动了一些官员,并促使白宫加强了对该行业的监管,全面调整了此前对该技术采取的轻度监管思路。

OpenAI表示,其新的Astra模型能够攻破网页浏览器沙盒,从而在运行浏览器的计算机上执行命令。该模型还能在一个难以破解的操作系统中发现漏洞。这些能力促使该公司在其内部AI风险管理框架中,将该模型的网络安全风险评为”危急”级别,该公司称这是其首次这样做。

OpenAI表示,其新增的保障措施包括加强对AI智能体的监控,利用相关系统扫描智能体对其自身行为的推理逻辑,一旦发现潜在危险行为便予以制止。

该公司在其博文中写道:”我们正在进入AI发展的一个新阶段,模型可以承担更具影响力的工作,而对齐与控制机制的失效可能会造成更加严重的后果。”

Enjoyed this article? Sign up for our newsletter to receive regular insights and stay connected.

Leave a Reply