
插图来源:MAX-O-MATIC
躲猫猫不只是孩童的游戏,也是他们最早建立“物体恒存”认知的方式之一。当你捂住脸再突然出现——“躲猫猫!”——这份突如其来的惊喜会换来孩子咯咯的笑声,更会助力孩子实现认知成长。
这种能力的形成并非依靠记忆。相反,婴儿通过观察,开始在大脑中构建关于世界运行规律的简单内部模型。大约在一岁时,他们就能够明白,滚到沙发后的球并没有消失,即使脱离视线,它仍然存在。
当今的人工智能系统尽管在对话和模式匹配方面表现出色,却无法可靠地掌握这一基本认知。它们可以描述眼前的事物,却难以理解隐藏的概念,也无法预判一连串行为后续会发生什么。
该领域的众多顶尖研究者认为,破解这一难题的关键在于所谓的世界模型:这类人工智能系统的设计目标不再局限于识别文本或图像中的模式,而是模拟物理世界的运行规律。通过数百万小时的视频训练,这些模型能够构建出关于世界运作机制(包括物理规律在内)的精确内部图景——这是众多技术的核心能力,无论是帮助自动驾驶汽车预判儿童突然冲到马路上的后果,协助家用机器人学习如何折叠衣服,还是在医生下刀前模拟手术过程。
明星力量
为满足这些“物理人工智能”应用场景的系统构建需求,世界模型已经从冷门科研方向,一跃成为人工智能领域的研发重心。谷歌(Google)近期发布了名为“Project Genie”的研究预览,该系统可以根据简单提示词生成逼真的交互式虚拟环境,还能够预测这些世界的演变过程,并对用户的操作做出响应。
与此同时,“人工智能教母”李飞飞(Fei-Fei Li)和“人工智能教父”杨立昆(Yann LeCun)各自为专攻世界模型研发的新创企业筹集约10亿美元的资金。斯坦福大学(Stanford University)的教授李飞飞于2024年创立World Labs,致力于赋予人工智能更丰富的三维空间感知能力,使其可以精准理解物体的存在方式与交互逻辑。Meta的前首席人工智能科学家杨立昆则在今年3月创立AMI Labs,其使命是突破大语言模型的局限。
杨立昆在近期的一次演讲中表示:“我们现有的系统能够操控语言,让大众误以为它们很聪明,但实际上,当面对物理世界时,它们完全束手无策。”
这一发展势头反映了研究人员对智能的认知不断革新。当今的许多世界模型研究都可以追溯到戴维·哈(David Ha)和于尔根·施米德胡贝(Jürgen Schmidhuber)在2018年发表的论文。数十年来,人工智能系统主要通过响应数据或蛮力试错来学习。该论文提出了全新方法:人工智能要做出智能决策,首先需要通过模拟环境来学习世界的运行规律。
戴维·哈后来与他人联合创立了日本人工智能研发公司Sakana,他在接受《财富》杂志的采访时称,这些系统可以让人工智能在其模拟的现实场景中开展训练——他将其描述为“幻觉梦境”——智能体可以在现实世界中采取行动之前,在上述场景中进行练习和提前规划。
在英伟达(Nvidia)的Cosmos Lab担任副总裁的刘洺堉(Ming-Yu Liu)给出了更形象的类比,他将其比作电影《黑客帝国》(The Matrix)的设定——主角在虚拟世界中学习功夫。刘洺堉将世界模型比作“生成式训练基地”,他说:“这里有反馈和指导,让人工智能可以不断提升自身技能。”
第四维度
除了李飞飞和杨立昆这些最受关注的项目外,还有众多新创企业也在研发世界模型,各家公司都有自己的技术路线。
以Niantic Spatial为例,这是一家从《精灵宝可梦GO》(Pokémon Go)背后的增强现实和地图技术分拆出来的新创企业。该公司正在打造其所谓的大型地理空间模型,能够以三维形式解读现实世界环境。这家总部位于美国加利福尼亚州旧金山的公司利用超过300亿张实景照片和三维扫描数据,这些数据主要来自《精灵宝可梦GO》玩家多年的活动记录以及其Scaniverse应用程序。
总部位于以色列特拉维夫的Decart正在致力于将世界模型推向实时应用,其打造的系统不仅能够模拟环境,还可以随着用户与环境的交互而持续生成和更新环境。通过自研优化系统,它能够以足够快的速度生成视频,逐帧匹配用户的操作。
“这才是关键突破。”Decart的研究科学家及创始成员之一克菲尔·阿贝尔曼(Kfir Aberman)表示。他指出,挑战不在于单纯生成视频,而在于以足够快的速度生成视频以实现即时响应。这一技术已经应用于虚拟试穿(使衣物贴合身形并自然摆动)等场景,同时也应用于主播实时切换直播背景的工具。
在某些世界模型中,时间元素是不可或缺的,构成了第四维度。例如,由自动驾驶领域先驱奥利弗·卡梅伦(Oliver Cameron)和杰夫·霍克(Jeff Hawke)创立、总部位于美国加利福尼亚州帕洛阿尔托的Odyssey公司,专注于构建能够预测世界随着时间的推移而演变的世界模型——直接从视频中学习物理规律、人类行为以及因果关系。
“我们曾经觉得这个想法简直不可思议——你能够预测未来。”卡梅伦说道,“如果我们可以让这一能力应用于机器人、游戏、教育、医疗保健和国防等通用领域,会带来怎样的变革?”
“ChatGPT时刻”
尽管发展前景令人振奋,但构建世界模型依然面临巨大的技术和经济障碍。训练可以模拟真实世界的系统所需要的算力,远超如今的语言模型,因为它们不仅需要处理文本,还需要处理高分辨率的视频。
比如,卡梅伦曾经表示,通过应用程序接口访问其Odyssey 2模型的每位用户,都需要占用一块英伟达的高性能H200人工智能芯片。而单块H200芯片的售价最高能够达到4万美元。
数据是另一项制约因素。大语言模型能够依托从互联网海量文本中爬取的数据来完成训练,而世界模型高度依赖视频素材,视频数据采集、标注与规模化训练的难度远超文本。
但这些挑战并未浇灭世界模型研发者的热情。随着研究人员不断推进可以理解并与物理世界交互的系统,业界普遍认为突破性进展可能近在咫尺。
“当前的物理人工智能领域正在迎来前所未有的热潮和投资。”英伟达的刘洺堉表示,并补充道,“ChatGPT时刻”即将到来。他个人的终极目标是什么?让机器人仅通过几个示例——甚至从未见过的示例——就可以学会新技能,并且能够持续运用这些技能。
“我相信,人们正在逐步摸索出正确的技术路线。”他说道。
译者:Zhy