首页 500强 活动 榜单 商业 科技 商潮 专题 品牌中心
杂志订阅

AI的下一个“ChatGPT时刻”会在哪里爆发?

Sharon Goldman
2026-08-13

为满足“物理人工智能”应用场景的系统构建需求,世界模型已经从冷门科研方向,一跃成为人工智能领域的研发重心。

文本设置
小号
默认
大号
Plus(0条)

当前的人工智能系统难以预测后续发展。研究人员希望改变这一现状。图片来源:Illustration by Max-O-Matic for Fortune

躲猫猫不只是孩童的游戏,也是他们最早建立“物体恒存”认知的方式之一。当你捂住脸再突然露出,一句“躲猫猫!”换来孩子咯咯的笑声,也会帮助孩子实现认知成长。

这种能力的形成并非依靠记忆。相反,婴儿通过观察,开始在大脑中构建关于世界运行规律的简单内部模型。大约在一岁时,他们就能够明白,滚到沙发后的球并没有消失,即使脱离视线,它仍然存在。

当今的人工智能系统尽管在对话和模式匹配方面表现出色,却无法可靠地掌握这一基本认知。它们可以描述眼前的事物,却难以理解隐藏的概念,也无法预判一连串行为后续会发生什么。

该领域的众多顶尖研究者认为,“世界模型”是破解这一难题的关键所在。这类人工智能系统的设计目标不再局限于识别文本或图像中的模式,而是模拟物理世界的运行规律。通过数百万小时的视频训练,这些模型能够构建出关于世界运作机制(包括物理规律在内)的精确内部图景——这是众多技术的核心能力,无论是帮助自动驾驶汽车预判儿童突然冲到马路上的后果,协助家用机器人学习如何折叠衣服,还是在医生下刀前模拟手术过程。

明星力量

为满足“物理人工智能”应用场景的系统构建需求,世界模型已经从冷门科研方向,一跃成为人工智能领域的研发重心。谷歌近期发布了名为“Project Genie”的研究预览,该系统可以根据简单提示词生成逼真的交互式虚拟环境,还能预测这些世界的演变过程,并响应用户的操作。

与此同时,“人工智能教母”李飞飞和“人工智能教父”杨立昆各自为专攻世界模型研发的新创企业筹集约10亿美元的资金。斯坦福大学教授李飞飞于2024年创立World Labs,致力于赋予人工智能更丰富的三维空间感知能力,使其可以精准地理解物体的存在方式与交互逻辑。Meta的前首席人工智能科学家杨立昆则在今年3月创立AMI Labs,旨在突破大语言模型的局限。

杨立昆在近期的一次演讲中表示:“现有的系统能够操控语言,让大众误以为它们很聪明,但实际上,这些系统在面对物理世界时束手无策。”

这一发展势头反映了研究人员对智能的认知不断革新。当今的许多世界模型研究都可以追溯到戴维·哈和于尔根·施米德胡贝在2018年发表的论文。数十年来,人工智能系统主要通过响应数据或蛮力试错来学习。该论文提出了全新方法:人工智能要做出智能决策,首先需要通过模拟环境来学习世界的运行规律。

戴维·哈后来与他人联合创立了日本人工智能研发公司Sakana,他对《财富》杂志表示,这些系统可以让人工智能在其模拟的现实场景中(他描述为“幻觉梦境”)开展训练,智能体可以在现实世界中采取行动之前,在上述场景中进行练习和提前规划。

在英伟达旗下Cosmos Lab担任副总裁的刘洺堉给出了更形象的说法,他类比了电影《黑客帝国》的设定——主角在虚拟世界中学习功夫。刘洺堉将世界模型比作“生成式训练基地”,他说:“这里有反馈和指导,让人工智能可以不断提升自身技能。”

第四维度

除了李飞飞和杨立昆这些最受关注的项目外,多家新创企业正沿不同技术路线研发世界模型。

以Niantic Spatial为例,这是一家从《精灵宝可梦GO》背后的增强现实和地图技术分拆出来的新创企业。这家总部位于旧金山的公司利用超过300亿张实景照片和三维扫描数据,打造其所谓的大型地理空间模型,能够以三维形式解读现实世界环境,数据主要来自《精灵宝可梦GO》玩家多年的活动记录以及其Scaniverse应用程序。

总部位于以色列特拉维夫的Decart则致力于将世界模型推向实时应用,其打造的系统不仅能够模拟环境,还可以随着用户与环境的交互而持续生成和更新环境。通过自研优化系统,它能够以足够快的速度生成视频,逐帧匹配用户的操作。

“这才是关键突破。”Decart的研究科学家及创始成员之一克菲尔·阿贝尔曼指出,挑战不在于单纯生成视频,而在于以足够快的速度生成视频以实现即时响应。这一技术已经应用于虚拟试穿(使衣物贴合身形并自然摆动),以及主播实时切换直播背景等场景。

在某些世界模型中,时间元素是不可或缺的,构成了第四维度。例如,由自动驾驶领域先驱奥利弗·卡梅伦和杰夫·霍克创立的Odyssey公司,专注于构建能够预测世界随着时间的推移而演变的世界模型——直接从视频中学习物理规律、人类行为以及因果关系。该公司总部位于美国加利福尼亚州帕洛阿尔托。

“我们曾经觉得这个想法简直不可思议——你能够预测未来。”卡梅伦说道,“如果我们可以让这一能力应用于机器人、游戏、教育、医疗保健和国防等通用领域,会带来怎样的变革?”

“ChatGPT时刻”

尽管前景可期,但构建世界模型依然面临巨大的技术和经济障碍。训练可以模拟真实世界的系统所需要的算力远超如今的语言模型,因为它们不仅需要处理文本,还需要处理高分辨率的视频。

比如,卡梅伦曾经表示,通过应用程序接口访问其Odyssey 2模型的每位用户,都需要占用一块英伟达的高性能H200人工智能芯片。而单块H200芯片的售价最高可达4万美元。

数据是另一项制约因素。大语言模型能够依托从互联网海量文本中爬取的数据来完成训练,而世界模型高度依赖视频素材,视频数据采集、标注与规模化训练的难度远超文本。

但这些挑战并未浇灭世界模型研发者的热情。随着研究人员不断推进可以理解并与物理世界交互的系统,业界普遍认为突破性进展可能近在咫尺。

“当前的物理人工智能领域正在迎来前所未有的热潮和投资。”英伟达的刘洺堉表示,并补充道,该领域的“ChatGPT时刻”即将到来。他个人的终极目标是:让机器人仅通过几个示例——甚至从未见过的示例——就可以学会新技能,并能够持续运用。

“我相信,人们正在逐步摸索出正确的技术路线。”刘洺堉说。

****

·技术范式革新:从语言模型走向物理世界模拟:AI正从文本处理演进至能理解物理规律、预测环境变化的“世界模型”,世界模型能力边界的拓展,有望重塑自动驾驶、具身机器人及医疗等实体产业的底层竞争格局。

·顶级资本与学术领军人物齐聚新赛道:以李飞飞和杨立昆为代表的AI领军人物分别下场创立公司,英伟达等算力巨头亦全力布局,预示着全球AI产业的下一波爆发点将聚焦于空间感知与物理交互能力。

·算力与数据壁垒揭示真实商业门槛:世界模型对视频数据与实时算力的要求远超大语言模型,这表明物理AI爆发的前夕仍面临高昂的硬件与计算成本考验。(财富中文网)

财富中文网对原文有删减和调整

编辑:魏雨彤

财富中文网所刊载内容之知识产权为财富媒体知识产权有限公司及/或相关权利人专属所有或持有。未经许可,禁止进行转载、摘编、复制及建立镜像等任何使用。
0条Plus
精彩评论
评论

撰写或查看更多评论

请打开财富Plus APP

前往打开