文 | AI唱反调
近期,阿里巴巴、Momenta和英伟达都对“世界模型”大做文章。阿里的方案能让AI代你操控电脑,Momenta的系统可预判行人动态,英伟达的版本则能生成逼真的暴雨影像。如果不细究技术内涵,很容易误以为这是同一赛道的三大突破,就像三位尖子生同时在考场上摘得桂冠。
事实却很直白:这三样东西除了共享一个名字,彼此间几乎毫无干系。把它们一揽子称为“世界模型”,无异于将“世界地图”“世界时钟”和“世界观”归为同类。表面都嵌着“世界”二字,内里却各抒己见。
阿里打造的是一个让AI在数字空间里先行试错的“模拟沙盘”,Momenta锤炼的是自动驾驶的“预判本能”,英伟达构建的则是为AI制造训练素材的“虚拟影棚”。三个“世界”,三条平行轨迹,互不相交。
同名殊途
首先是阿里Qwen-AgentWorld,本质上是一个专供AI使用的“数字沙箱”。
它将浏览器、电脑桌面、手机界面及代码编辑器等环境整合为一个虚拟演练场,让AI在其中先行试探、再付诸行动。例如,想操控某个软件时,AI会先在沙盘里验证是否会误触按键,确认顺畅后才接管真实电脑。这项能力基于逾1000万条真人操作记录训练而成。AI透过观摩无数次人类编写代码、检索信息、填写表格的范例,洞悉了“点击此处后通常会发生什么”的规律。
它的“世界”锚定在计算机内的数字领域:网页、App、代码仓库,与真实的街道、物理机器人毫无直接联系。
其二,Momenta那套已实装量产的系统,则是自动驾驶车的“直觉预判”。
自动驾驶的核心难点已经转变。关键不再仅仅是“辨识前方事物”,而是推断下一秒将呈现什么景象。前车突然减速,是准备停靠路边还是无意间松了油门?路旁的行人,是想过马路还是等公交?Momenta让AI事先在脑中模拟未来几秒的交通演变,从而挑选最稳妥的应对动作。这背后不只依赖直觉,还牵涉感知、预测、规划等多个模块的协同运作。
尤为关键的是,这套机制已步入量产。Momenta坐拥90万辆行驶车辆,累积了100亿公里的真实驾驶数据。这些画面远非“看着过瘾”,内里蕴含着“当时采取了什么动作、车辆如何响应、结果是否得当”的因果链条。它的“世界”植根于真实的物理环境:道路、汽车、行人、雨雪等气候条件。
第三类,NVIDIA Cosmos 3,它是一个为AI锻造训练材料的“虚拟制片工作室”。
其核心本领是生成极其逼真的视频内容,但这些影片并非用来消遣,而是作为机器人和自动驾驶系统的练习册。比方说,若要训练AI学会应对“暴雨天路面反光导致车道线模糊”的困境,现实中不可能日日苦等暴雨,Cosmos 3便能合成一段暴雨驾驶视频,让AI在虚拟场景中反复锤炼。
它开源了模型权重,能处理文字、图像、视频、音频和动作指令五种信息流,20万亿token的规模说明它已吸纳并生成了天文数字的素材。但要点在于,这些画面全属“合成数据”,是AI自己创造的,并非实拍所得。优点在于成本低廉、场景齐全;缺点则是“仿真”与“真实”之间永远横隔着一道缝隙。
它的“世界”是一个人工构建的仿真之境,本身不直接操纵方向盘,也不亲自点击鼠标,只为其他AI提供训练习题。

世界模型:一个被掏空的标签
实际上,“世界模型”的定义混乱连学界自己也颇感困扰。今年6月初,李飞飞团队在《MIT技术评论》上发表了一篇文章,标题正是《当视频生成、机器人与英伟达都自称世界模型》。文中提到,Sora被称为世界模拟器,Genie被叫作世界模型,如今就连自动驾驶、机器人领域都在沿用同一词汇。
6月中旬的智源大会上,智源研究院院长王仲远干脆将世界模型划分为四大流派:语言核心型、像素中心型、三维结构驱动型、视觉表征枢纽型。可见,即便顶尖研究者也难达成统一术语。
那么,这三者的共性究竟何在?它们都在执行“预测”或“模拟”。预测鼠标一点引发的连锁反应,预测前车减速后下一瞬的交通状态,预测暴雨天路面的外观。但预测的对象天差地别:一个在预判数字环境内的操作结果,一个在推演物理世界中的交通变迁,一个在估算仿真画面里的场景参数。
这就好比“预测”这个词,可以预测股市、预测天气、预测孩子的考试分数,虽都叫预测,但实践内容截然不同。世界模型如今正处在这番境地:同一术语,被用来刻画三种截然不同的能力。
闭环决胜负
这三类“世界模型”不会最终融合为统一形态,未来将沿三条路线各自延伸。

第一条路线是数字世界模型,专注解决“AI如何操控软件、如何编写代码”的课题。由Qwen、OpenAI、Claude这类公司领衔。其特点是迭代迅速、数据获取成本低,因为电脑中的操作记录极易采集。与我们的日常生活最贴近:未来的AI助手,可能会先在后台沙盘中预演流程,再帮忙预订机票、填报表单。
第二条路线是物理世界模型,攻克“自动驾驶如何确保安全、机器人如何搬运物体”的难题。由Momenta、特斯拉、华为等企业主导。其特点是数据成本极高,必须依赖真实车辆路跑,但一旦形成闭环,竞争护城河便深不可测。与我们的关联在于:今后乘坐的车辆、遇到的无人配送小车,幕后都倚靠这类模型。
第三条路线是基础设施线,英伟达扮演的更像一个“贩售铲具”的角色。Cosmos 3提供合成数据,供前两条路线的开发者利用,但它自己不直接上路驾车,也不直接操控电脑。它赚取的是“兴建影视基地”的利润,而非“制作电影”的收入。
评判谁更胜一筹,光看参数尺度或是否开源还不够。真正关键的标尺是闭环——AI在真实环境中应用后,能否将结果反馈回来,让自己不断变聪慧。
Momenta的闭环最为稳固。90万辆车每日在道路上奔驰,AI一旦预测出错,数据便会回流警示它“下次别再这样预判”。这种源自真实世界的反馈,是合成数据无法填补的。
Qwen的闭环扎根于数字世界。逾1000万条真人操作的成败经历被记录下来,成了AI的教科书。在“让AI操作软件”这条赛道上,这是稀缺的宝贵资产。
Cosmos 3在仿真基地内部的闭环效率确实极高。它生成视频、进行测试、接收反馈、再生成的循环在虚拟环境中运转得飞快。然而,要将这些画面投喂给真实世界的汽车或机器人,仍需跨越一道“从仿真到现实”的鸿沟。这一步目前尚未完全打通。
三者的分野分外鲜明:Momenta在真实的驾驶历练中进化,Qwen在真人的电脑操作中演进,英伟达在人造的影视基地里蜕变。没有高低之分,只是各自专注的战场迥异。
今后再遇到“世界模型”这个标语,先追问一句:它指的是电脑沙盘里的、真实道路上的,还是人造影棚里的?答案不同,抉择便大相径庭。如今高呼“世界模型”的旗号,一半是在真切耕耘,另一半则是借这块招牌为自己贴金。能识辨后者与前者的区别,才不会被公关文案轻易带偏。