过去两年,生成式人工智能的焦点集中在文字、图像和视频上。但今年以来,“世界模型”(World Model)频繁出现在谷歌DeepMind、英伟达以及多家创业公司的技术路线图中。它试图让模型不只是“画得像”,而是真正理解空间、物体与因果,并能被动作实时操控。

从生成画面到生成可交互世界

视频生成模型的目标是输出一段看起来合理的画面,观众只能看,不能改。世界模型则要求模型在内部建立对环境状态的表示,给定一个动作,比如向前走一步、推开一扇门,就能预测下一刻世界会变成什么样。这种“动作条件”能力,是它与普通视频生成最本质的区别。

谷歌DeepMind的Genie系列是这一方向的代表。据公开资料,其新一代模型可以实时生成可交互的三维场景,用户用键盘就能在其中移动、探索,画面随操作即时变化,并在较长时间内保持场景结构不崩坏。英伟达则推出面向机器人与自动驾驶的世界基础模型平台,把这类能力包装成可调用的开发工具。

三条路线正在赛跑

产业界为何如此看重

答案藏在数据里。机器人和自动驾驶最缺的不是算力,而是带动作标签的真实数据。让机器人摔一万次、让汽车撞一万次,成本无法承受。世界模型的价值在于充当数据引擎:只要模型足够接近真实物理规律,就能在虚拟环境中批量生成训练样本,成本远低于实车实测。

这也是它被称为具身智能基础设施的原因。人形机器人要走出实验室,需要海量、多样、可标注的交互数据,世界模型是目前看来最现实的规模化来源之一。

门槛依然很高

理想很丰满,难点也很具体。

此外,能实时生成逼真世界的模型,也意味着更强的深度伪造与内容安全风险,监管与治理问题会随之而来。谁能在真实感、可控性和成本之间找到平衡,谁就更有可能率先把它变成生产力工具。

世界模型不会立刻改变每个人的手机,但它可能决定下一阶段人工智能能走多远。当模型从读懂文字迈向理解世界,机器人与自动驾驶的落地节奏,或许就握在这条技术路线手里。