Robotic arms stacking blocks beside a researcher and virtual environment dashboard

AI的下一次重大飞跃:走进现实

工程师与投资者正竞相涌入”世界模型”赛道,期望在机器人领域复刻ChatGPT在写作与编程界引发的革命。

当下的AI大语言模型(LLM)或许已十分擅长案头文字工作,但支持者说,要完成现实世界里的物理任务,还需要大型动作模型,也就是世界模型。

这类旨在操控机器人的模型,其训练素材并非文学作品、代码或图像,而是电子游戏与虚拟仿真环境。近来,这些模型已发展到这样一个阶段:在某些情况下,只需一组简单指令,它们就能在三维空间中导航,甚至自主操作物体。

投资了这一领域几家公司的莫里茨·拜尔-伦茨(Moritz Baier-Lentz)称,这项技术仍处在早期阶段。他补充说:”如果把它和大语言模型相比,它就像GPT-2。”那是OpenAI早在2019年发布的模型。

尽管世界模型仍相对初级,科技界知名人士已纷纷入局。他们押注于一种全新的基础架构,认为其有望带领AI涉足当前基于大语言模型的AI无法触及的领域。而先驱者们也希望有朝一日能够将这两种AI思维模式融合起来。

从文字到世界

大约5亿年来,动物大脑一直在进化,动物的大脑不断进化,使其能够为周围世界构建模型,并利用这种心智地图来规划下一步行动。相比之下,语言的历史只有约10万年,它是人类为了处理和传递大大小小的概念而创造的一种信息速记方式。

“文本只是现实世界的一种有损表达,”General Intuition首席产品官、Epic Games《堡垒之夜》(Fortnite)生态系统前总监肯特·罗林斯(Kent Rollins)说,”世界远在文字出现之前就已存在,试图用文字来描绘世界,必然会遗漏核心要素。”

机器人学家早就明白这一点。当今较复杂机器人的控制系统依赖基于物理规则的现实世界仿真环境。这些也是世界模型,只不过它们需要精心编写代码,而且高度专门化。适用于一种机器人的方法,并不适用于另一种机器人。

如今的世界模型初创公司希望打造一种通用控制系统,让其在操控机器人时能像如今大语言模型撰写十四行诗或编写软件代码时那样游刃有余。

总部位于纽约的世界模型初创公司General Intuition正敲定一轮融资,该轮融资将使其估值超过60亿美元,成为此类AI实验室中估值最高的一家。它的训练基础是游戏:该公司的模型会捕捉一款游戏的每一帧画面,也记录用户的操作动作,不论是按下按键还是轻推摇杆。与仅靠视频训练的机器人不同,这种方式让该公司的AI能够把用户动作与这些动作在虚拟世界中造成的后果关联起来,从而形成一个大型动作模型。

稍加微调,一个模型就能在现实世界中操控机器人,就像操控游戏角色一样。但有一个前提:被操控的机器人必须是四足机器人、轮式车辆或飞行无人机这类设备,通常会向用户发送实时视频画面,并可通过游戏手柄或鼠标和键盘控制。许多主流机器人都满足这一常规要求,但多数双足人形机器人则被排除在外。

General Intuition的模型训练数据来自真实人类数百万小时的游戏游玩记录,这些数据采集自其姊妹服务Medal.tv;Medal.tv是一个用于录制和分享游戏片段的平台。

在纽约和日内瓦办公室内外,General Intuition会展示一只机器狗。驱动这类机器人的传统AI可能需要海量训练,而这个系统只需几分钟微调。General Intuition的投资人拜尔-伦茨说,系统只需知道自身所处位置、拥有怎样的机械躯体以及目标为何,便可立即行动。

世界模型早期演示,例如Google DeepMind发布的Genie模型,侧重于生成新世界来训练机器人。新一代世界模型则感知世界,并决定下一步该做什么。此前在谷歌负责这些世界模型项目的杰克·帕克-霍尔德(Jack Parker-Holder)共同创办了总部位于伦敦的Emulate。《华尔街日报》看到的文件显示,这家初创实验室正与投资者洽谈融资超过5亿美元,其技术人才队伍还包括另外六名前谷歌员工。

语言+动作=?

其他世界模型公司不愿透露其正在构建的AI细节,但他们的收购动作以及工程师发表的内容透露出一些线索。

由斯坦福大学教授、谷歌资深人士、有”人工智能教母”之称李飞飞领导的初创公司World Labs最近收购了机器人公司Scenix。由Meta公司前首席人工智能科学家杨立昆(Yann LeCun)领导的AMI Labs似乎正在研究更广泛的领域,探索传统大型语言模型之外的多种架构。(两家公司均对本文不予置评。)

General Intuition及其他初创公司强调自身在机器人领域的能力,但潜在投资者和商业伙伴提出了另一个问题:世界模型如何增强当下基于语言的模型的能力?

要让大语言模型(LLM)处理图像和音频,就必须直接用这些媒体内容训练它们,像处理文字一样把输入转换成token(词元)。事实证明,用这种方式处理三维场景效率极低,得到的模型速度太慢,在大多数情况下无法指挥机器人。

但世界模型也有自身问题。ChatGPT之所以相对容易一代代演进,正是因为它起步时只是在和文本打交道。布朗大学(Brown University)机器人学教授、工业机器人系统开发商Realtime Robotics联合创始人乔治·科尼达里斯(George Konidaris)说,随着大语言模型规模扩大、纳入越来越多数据,它们会变得更大、更聪明,但仍会犯错。

而在机器人场景中,人们能容忍幻觉和其他差错的情形要少得多。

“现实世界非常复杂,存在许多特殊情况和硬性边界,你绝不能对某些细节掉以轻心,”科尼达里斯说,”如果你在移动机器人时撞到了什么,一切都会改变。”

一些人认为,大语言模型效率的不断提升,或许足以让它们成为驱动机器人和其他3D应用的AI;另有一种混合构想是,大语言模型可以调用世界模型,就像调用其他软件来协助完成任务一样。

与此同时,General Intuition和Emulate显然都没有把总部设在湾区;那里已被基于大语言模型的AI可能通向”超级智能”的前景所吸引。

当我问”超级智能”是否是他的公司目标时,General Intuition首席执行官皮姆·德维特(Pim de Witte)含糊其辞地说,”我之所以在纽约,就是为了远离那种盲目狂热的风气,专心用科学的方法评估模型在机器人身上的能力,我们不需要过分夸大它。”

Enjoyed this article? Sign up for our newsletter to receive regular insights and stay connected.

Leave a Reply