文|数字力场 佘宗明
AI大佬杨立昆该偷着乐了——他断言的“LLM(大语言模型)只是过渡品,JEPA(联合嵌入预测架构)+世界模型才是通往AGI正途”,似乎正得到应验。
2026年被钉上“世界模型元年”的铭牌,即为印证。这不是我的“自定义”,而是很多实锤在现实墙面上砸出的标记。
2026年1月,谷歌DeepMind开放Genie 3公测,世界模型首次以可交互形态对普通用户开放;几乎同一时间,蚂蚁集团旗下灵波科技连续发布世界模型产品;4月,腾讯开源混元3D世界模型2.0;6月,蔚来向超70万用户推送世界模型驱动的端到端驾驶系统;7月,蚂蚁灵波在几天内连发六款模型,昆仑万维在WAIC上宣布2026年为“世界模型元年”……

虽然时下“元年”二字已被滥用,可拐点是它最好的证明。众多迹象显示:算力成本、模型连贯性、产业资本,三条此前各自爬坡的曲线,在2026年正同时跨过商用临界点。
说到这,有些人可能被动开启了“懵逼树上懵逼果,懵逼树下你和我”模式:什么大语言模型、世界模型、我秀我型?

让我用比豆包还直白还简单还不拐弯抹角的方式回答你:大语言模型“管”信息世界,最擅长跟咱们侃大山;世界模型“管”物理世界,能预判物体碰撞、行人动向、空间变化。
你让ChatGPT写出行车方案,它三两下搞掂,你让它预判出路边小孩突然横穿马路,它只能来上一句“臣妾做不到啊”。毕竟它能理解符号与文字,却不懂重力、碰撞、空间、时序。
而世界模型的核心能力,就是在数字空间复刻那套完整的物理规则。说人话就是:AI终于可以开始看懂我们身处的真实世界,明白原来牛顿的万有引力掌管着我们的日常。
被杨立昆、李飞飞们偏爱的世界模型,不算新概念,但2026年的特殊之处在于,世界模型不再是仅供演示的概念,而是三类普通人高频接触的产品标配:玩游戏时动态生成的无限开放世界、家用机器人提前预演的家务动作、自动驾驶车辆预判的千万种路况风险。
谷歌让普通人“创造世界”,蚂蚁让机器人“预演世界”,蔚来让汽车“预判世界”,这三件事接连发生,本就意味着:风,已经来了。
那,世界模型将如何改变我们的生活?
谷歌、蚂蚁、蔚来“让事情发生”的游戏、机器人、自动驾驶三个领域的变化,就可供我们窥斑见豹。
01 游戏,终于可以从“预制”变“现炒”了
如果你是个游戏老玩家,大概率都经历过“就这?”时刻:很多的所谓开放世界游戏,肝了200小时后,再无新鲜劲可言。二周目?不过是把同样的路再走一遍、跟同样的NPC说同样的话,。
没办法,当下游戏多是预制——包装得再精美,地图都是开发者提前设计的,NPC台词都是照剧本来的,咱们能走的路、能进的门、能看到的风景,都在设计文档里画好了边界。
我不是针对某款游戏,我是说绝大多数都是。
听到这,你是不以为凡游戏“预则无味,不预则废”?
谷歌拍了拍我们,说“来感受疾风吧”,顺带着就抛出了Genie 3。
年初的Genie 3开放公测,就第一次让普通用户用“一句话生成一个能交互的3D世界”,摸到了“生成式世界”的门槛。

生成一个世界不难,难的是生成的世界有基本的物理常识——角色不能穿墙,重力依旧存在。你离开某个场景再回来,它能像DM(地下城主)那样,还记得之前有什么。
这绝对是游戏玩家的福音:它意味着,世界模型驱动的游戏,我们玩三遍,三遍是三个不同的宇宙,它可以没有固定剧情,没有预设结局,整个世界根据我们的行为动态生长。在这个世界里放了一把火,下次回来,那片废墟还在冒烟。
担心无“国服”版本的玩家也不用担心。昆仑万维推出的开源世界模型Matrix-Game,算是平替:它也能模拟复杂建筑的玻璃反光,还能跑GTA风格的大地图自由探索。
腾讯开源混元3D世界模型2.0,则让游戏开发者也有了趁手工具:因为它能把文字、图片、视频直接变成3D世界资产,跟现有游戏工作流对接。这么一来,游戏开发者以后可能就不用再从零开始建模,没准对着AI说“我要一座哥特式城堡”,再拿着AI生成的草稿精修,就行了。
你要说现在的世界模型游戏有多能打,倒也未必。毕竟还是“幼詹形态”,场景连贯性只能维持几分钟,实时交互延迟还太高,画面精细度离3A大作往往差着十个《荒野大镖客》。
但它指向的方向很清晰,那就是从“开发者给你一个限定世界”变成“AI给你生成一个无限世界”。方向已定,接下来就等技术成熟了。
等技术成熟后,被颠覆的恐怕不只是游戏行业,任何需要“构建虚拟空间”的场景,比如建筑设计师在AI生成的空间里穿行,导演在AI生成的场景里提前预览镜头,都能让世界模型帮忙。
单就游戏来说,我觉得,在游戏将来“主打现炒”后,玩法也会更多样,以后再“读档”可能就不是再回到某个存档点了,而是让AI重新生成一个类似但不同的世界,让咱再试一次。想象一下,玩《黑暗之魂》,每次死亡后BOSS战的场景布局都不一样,咱是不就能喜提无限重玩的乐趣了?
02 机器人,从仿真到逼真再到……“如真”
生活不止眼前的游戏,还有远方的诗和田野+手头的琐事。游戏世界模型能让咱们“无限流体验”一时爽,机器人世界模型则能让咱们拥有建国后成精的Robot。
现在的机器人,虽然扭起秧歌来比“四肢残废”的我好太多,但要论懂其中的力矩、角动量、摩擦力、惯性、简谐运动等基础物理知识,它可能得喊我一声“大哥”。
事实就摆在那:机器人在仿真环境里可以是王虹是邓煜,到了真实世界里就是数学“学废了”的世另我。
数据可以佐证这点:机器人在仿真环境中操控成功率能达到89.4%,但落到真实家庭场景,暴跌至12.4%。业界将其从仿真到现实的鸿沟称作Sim2Real Gap,我则称其为“另一个马里亚纳海沟”。
原因无他:仿真环境堪比无干扰温室,光线均匀得像摄影棚,物体摆放得整整齐齐,桌面平整得像乒乓球台。真实世界呢,往往糙很多:阳光可能在桌面上切出光斑,桌面上可能还有水渍,旺财可能突然从桌子下窜出来。
这就导致,仿真环境里训练好的机器人,就像只在恒温泳池里练过游泳的选手,第一次下海就被浪拍懵了——乘风破浪不了一点。
机器人训练师不是没想过解法,但方式也很原始:让它在真实环境里反复试错。学开门就摔一千次门,学抓杯子就碰碎几百个杯子。
但咱就是说,为了训练一个端茶机器人,让它在客厅里搞一万次破坏,这成本……是不是太高了?
世界模型提供了另一种解法:让机器人在虚拟世界里“脑补”无数次真实场景,学会应对各种意外,再回到现实。那些试错不需要在真实世界里发生,世界模型帮它在脑子里跑完。预演完后,带着经验回到现实。
清华大学FIB-Lab的研究就认为,用合成数据训练的机器人策略,真实世界表现有显著提升。划重点:“显著提升”,以后要考。机器人表现从“真的难用”到“勉强能用”再到“十分好用”,产业才能实现实现指数级爆发。
国内在这条路上跑得最猛的,是蚂蚁集团旗下的灵波科技。虽然才成立才1年半,但它已经拿出了覆盖机器人从看到动的十余款模型。

上个月更是猛:灵波几天内连发六款模型,覆盖视觉、空间感知、VLA(视觉语言动作)、世界模型和世界动作模型。其中最值得关注的,是LingBot-World和LingBot-VA这对组合。
LingBot-World负责生成可交互的虚拟环境,第一代单次能生成接近10分钟的连贯视频。2.0版本更进一步,支持无限时长的实时交互,还引入了Agent机制,让生成的世界从可观看的背景变成了能互动的环境。LingBot-VA则是具身原生世界动作模型,从一开始就是为机器人学动作设计的,不是拿现成视频生成模型改改就用的二手方案。
LingBot-World是“世界”,LingBot-VA是“动作”,扣在一起,就是机器人在虚拟世界里“脑补”无数次试错的关键组件。这套大脑还不挑身体——LingBot-VLA 2.0已经适配了17个机器人品牌的20多种构型,同个大脑能装到不同品牌机器人身上。以前换个机器人就得重新训练,现在“一脑多机”也能变为现实了。
灵波CEO朱兴今年6月说了句话,点出了这件事的深层意义:“随着‘大脑’更加聪明,AI将反向定义硬件。”翻译下就是:不是机器人长什么样,决定了它能干什么,而是大脑需要什么能力,反过来定义机器人该长什么样、该装什么传感器。
这有点像智能手机时代:不是手机决定了APP长什么样,而是iOS和安卓定义了手机该有什么功能。
普通人能感知到的变化已经出现了。2026年5月,中国首个面向具身智能的应用中试基地落地杭州滨江,华为和阿里达摩院都参与了,基地聚焦新消费、新物流、新制造。
嗯,我期待的就是,让机器人从“仅供表演用”变为能替我搬砖。
虽说机器人面对多变量家庭环境依旧笨拙,世界模型也无法一步实现完美操作,但就现在这进化速度……反正我是不想被现状限制住想象力。
03 自动驾驶,会被老司机附体
FSD、城市NOA、高速NGP……这些也会是世界模型的跑马场。
现在看,自动驾驶是成了三个领域中世界模型离普通人最近的一个——因为它已经上路了。
今年6月,蔚来就向超过70万用户推送了世界模型驱动的端到端驾驶系统。2026年4月,Momenta的R7模型已经量产上车。
这消息,至少让我对智驾的安全性多了些信任——因为世界模型可以智驾系统被老司机附体,从反应快进化到想得远。
传统自动驾驶的逻辑,大抵可以理解为“看到什么躲什么”:摄像头拍到前方有个行人→识别为障碍物→赶紧刹车。
其要害是反应快,需要“先看到,再行动”。就像作为新手司机的我,开车时眼睛盯着前方,手里攥着方向盘,遇到情况才踩刹车。
世界模型则会教它不光要“看到”,还要“预判”:那个站路边低头看手机的人,会不会突然冲过来?前面那辆车,会不会不打灯就变道?路面上那片积水,会不会让旁边的车打滑?

习惯是“养”成的。传统自动驾驶是从人类司机的驾驶行为里学习,问题是,人类司机大部分时间都在正常开车,急刹、变道是少数情况,这些数据太稀疏了,所以自动驾驶在应对突发情形时可能应对不足。
世界模型则可以生成无数种“如果发生××情况会怎样”的场景,让自动驾驶系统在虚拟世界里经历无数次“差点出事”,再回到真实路面上。
据Momenta称,R7在搭载世界模型后,预判前方车辆掉落物品、小动物突然横穿等突发状况的能力有显著提升。
又是“显著提升”,鉴于这说法来自厂商,姑且存疑,但单说这方向——从“快反应”到“能预判”,应该是靠谱的。
犹记得,英伟达CEO黄仁勋在2026年CES上断言:“物理AI的ChatGPT时刻即将到来”,现在看,自动驾驶就是其第一个大规模主流落地场景。
这对提升智驾安全性绝对大有裨益。凯文·凯利说过:“在自动驾驶方面,我们不能满足于99%的安全性,必须追求99.99%的精准。安全性达到98%不是一件困难的事情,但是越往后越困难……最后的部分难度最大、耗时最久。”
世界模型要解决的,正是那最后1%的长尾问题——那也许是咱们一万次正常驾驶才能碰到一次的偶发情况。
毋庸讳言,自动驾驶的世界模型尚处在早期,用“它还是个孩子”来为其不足开脱不合理,但理就是那么个理儿。
但假以时日,世界模型大概率会是通往全场景无人出行的底层技术底座。
联想到2026年已有70万辆车在跑,“假以时日”里的时日不会是太久,因为那些车辆每跑一公里,世界模型都在变聪明一点……一天一天贴近咱的心,它走心咱放心。
04 我们的物理世界,离被重塑还会远吗?
说到这,我想起这几年常被技术圈提到的一个词——“AI下半场”。
自从ChatGPT问世以来,它带来了石破天惊的链式反应。这两年,“上半场拼参数,下半场拼落地”之类的说法蔚为风行。
但大家默认的前提是,这里的AI指的是大语言模型。AI落地路径也被理解为:让大语言模型根据垂直场景定向优化,深耕行业,解决问题。
可真要落地,未必只有LLM一条路。按杨立昆的说法,世界模型是更好的那条路——它天然靠近我们赖以生活的物理世界。
大模型的确可以让信息变得无限廉价,写文章、做翻译、写代码,边际成本趋近于零。可很多事,它干不了。
世界模型要做的是让“物理经验的复制”变得廉价——让机器人不需要在真实世界里摔一万次就能学会端茶,让自动驾驶不需要真的撞一次才能学会避让,让游戏世界不需要几百人花几年建模就能无限生成……

而这些,兴许只是我们的物理世界被普遍重塑的缩影与前兆。
想想假若我们生活的物理空间变成了可以被生成、被预演、被重写的东西,该有多刺激?
别说它生成的世界还不够精细,预演的场景还不够全面,预判的意外还不够准确,这些问题确实存在,但别忘了,互联网刚诞生时也只能发几KB的邮件,智能手机刚诞生时连多任务都跑不动。
世界模型元年已到,还是上车扶稳坐好吧。
