过去两年,生成式人工智能的焦点集中在文字、图像和视频上。但今年以来,“世界模型”(World Model)频繁出现在谷歌DeepMind、英伟达以及多家创业公司的技术路线图中。它试图让模型不只是“画得像”,而是真正理解空间、物体与因果,并能被动作实时操控。
从生成画面到生成可交互世界
视频生成模型的目标是输出一段看起来合理的画面,观众只能看,不能改。世界模型则要求模型在内部建立对环境状态的表示,给定一个动作,比如向前走一步、推开一扇门,就能预测下一刻世界会变成什么样。这种“动作条件”能力,是它与普通视频生成最本质的区别。
谷歌DeepMind的Genie系列是这一方向的代表。据公开资料,其新一代模型可以实时生成可交互的三维场景,用户用键盘就能在其中移动、探索,画面随操作即时变化,并在较长时间内保持场景结构不崩坏。英伟达则推出面向机器人与自动驾驶的世界基础模型平台,把这类能力包装成可调用的开发工具。
三条路线正在赛跑
- 实时交互路线:以逐帧生成、低延迟为核心,强调可玩性,主要面向训练与娱乐场景。
- 三维重建路线:以李飞飞团队创立的World Labs为代表,主张从一张图片或一段文字生成可编辑、可漫游的三维场景,更接近内容创作工具。
- 行业专用路线:自动驾驶公司Wayve等把世界模型用于合成极端路况,让车辆在虚拟环境中经历现实中罕见但危险的场景。
产业界为何如此看重
答案藏在数据里。机器人和自动驾驶最缺的不是算力,而是带动作标签的真实数据。让机器人摔一万次、让汽车撞一万次,成本无法承受。世界模型的价值在于充当数据引擎:只要模型足够接近真实物理规律,就能在虚拟环境中批量生成训练样本,成本远低于实车实测。
这也是它被称为具身智能基础设施的原因。人形机器人要走出实验室,需要海量、多样、可标注的交互数据,世界模型是目前看来最现实的规模化来源之一。
门槛依然很高
理想很丰满,难点也很具体。
- 物理规律:模型常生成看起来对、其实错的画面,比如物体凭空消失、液体不流动,这会污染下游训练数据。
- 长时一致性:场景保持几秒钟容易,保持几分钟甚至几小时,误差会不断累积。
- 算力与延迟:实时交互意味着每秒要生成数十帧并即时响应,推理成本高企。
- 评测标准:如何衡量一个模型懂不懂物理,业界尚缺少公认基准,已有研究团队尝试提出统一评估框架,但远未定型。
此外,能实时生成逼真世界的模型,也意味着更强的深度伪造与内容安全风险,监管与治理问题会随之而来。谁能在真实感、可控性和成本之间找到平衡,谁就更有可能率先把它变成生产力工具。
世界模型不会立刻改变每个人的手机,但它可能决定下一阶段人工智能能走多远。当模型从读懂文字迈向理解世界,机器人与自动驾驶的落地节奏,或许就握在这条技术路线手里。