尴尬的“世界模型”,四条路线纷争未决

铑科技·2026年08月31日 21:42
多条技术路线并行竞争,到底什么是世界模型?

8月27日,自变量机器人发布WALL-SS自回归世界模型,计划让虚拟世界真正成为机器人的“训练场”。同月,群核科技推出了Lux3D 3D生成模型,20秒内就能从一张图生成可交互的3D资产,并披露了“显式3D”世界模型路线图。

而就在此前不久,北京智源人工智能研究院推出悟界·RoboBrain Orca。同期,图灵奖得主杨立昆团队发布了AdaJEPA,让世界模型首次具备了“边做边学”的自适应能力,在部署中持续根据真实反馈校正预测。

稍早的4月,李飞飞World Labs连发Marble 1.1和Marble 1.1-Plus两款模型,一个提升画质,一个专攻超大规模场景生成。

世界模型领域的成果密集落地,看着很热闹,但背后其实有一个很尴尬的现实,就是即便在当前的学术界,“世界模型”至今还没有统一的技术定义。计算机视觉研究者把它理解为视频生成,机器人领域把它当成状态预测器,强化学习的圈子则从MBRL出发,把它视为策略学习的环境代理。

混乱并非偶然。“智能如何理解世界”本身就存在严重分歧:世界的本质应该被表示为像素、几何结构,还是抽象表征?围绕世界模型的技术路线也由此展开分野。

当然,还有一派主张从语言文本中学习世界知识,但这更多是LLM时代的延续,而非世界模型本体论层面的独立范式,因此本文不作重点展开。

像素生成派:“画”出的世界

世界模型的像素生成派可以追溯到已经被关掉的Sora,当初发布时,OpenAI用了“world simulator”这个说法。

Sora的技术逻辑是,通过扩散模型和Transformer架构,在海量视频中学习视觉像素的分布,然后根据给定的文字或图像提示,“画”出一段看起来真实连贯的视频。

但“画得像”和“理解物理规律”之间仍相隔甚远。

图灵奖得主杨立昆对这个路线的批评最直言不讳。他多次公开表示,通过生成像素来建模世界“是一次彻头彻尾的失败”,在高维连续感知输入中处理预测不确定性,这条路走不通。理由是,如果模型需要逐像素预测一个场景的未来状态,光照、纹理、阴影这些信息量巨大的细节会“稀释”模型对核心物理关系的注意力,而真正重要的因果结构反而学不到。

但是,这条路线并非就要被一票否决,在AI视频领域大杀四方的Seedance则代表了这一路线在中国的最新进展,以及向“世界模型”方向延伸的可能。

与Sora强调“世界模拟器”宏大叙事的路径不同,Seedance的技术路线是“解构人类内容的消费逻辑”,要的是让模型产出符合视听语言和物理直觉的可用内容。

Seedance 2.0的核心突破,被普遍认为是从“像素拟合”走向了“物理建模”。

此前AI视频模型的最大痛点在于“物体运动违背惯性、液体流动像色块平移、角色复杂背景中常有穿模”,根源是早期模型只在做“像素的统计学猜想”。Seedance 2.0则通过自主研发的运动合成技术,让模型理解了重力、阻力与碰撞,而背后则是模型对材质属性和物理交互的深度仿真。

7月31日,Seedance 2.5正式发布,在四个维度上实现了实质性跃升,其在世界模型方面的显著变化,就是模型的角色从内容创作工具向产业生产力基础设施迁移。

发布当天,徐工集团、小鹏汽车、灵初智能、微分智飞、穹彻智能等多家企业确认合作,率先引入该模型能力。从这些合作企业的构成也能发现,不论是具身智能领域还是智能驾驶领域,乃至在工业制造方向,“像素派”这条路线上的Seedance都有了不小的进步。

这表明,像素生成派正在突破“只会画”的瓶颈。但是,基准测试同时揭示了一个根本性问题,即便是在物理真实性上表现最好的模型,在真正的因果推理和逻辑一致性测试中仍然力不从心。

2026年5月,清华大学团队发布的World Reason Bench基准测试,专门评估视频生成模型的物理和逻辑合理性而非图像质量。测试涵盖世界知识、人类中心场景、逻辑推理、信息推理四大维度。结果显示,商业模型整体得分约为开源模型的两倍,Seedance 2.0在各项测试中综合排名领先,但逻辑推理上,即便是最好的商业模型在这一项上的得分也远低于其整体平均水平。

也就是说,从“像素生成器”到“可靠世界模型”的跨越尚未实现。

空间智能派:李飞飞的“3D重建”

与生成派“画画面”不同,李飞飞和她的World Labs选择的是从三维结构入手。

2026年7月,World Labs推出Real2Sim2Real物理AI解决方案,李飞飞的终局战略也清晰起来,其核心就是:用高效的物理AI仿真系统,解决具身智能的数据荒。

李飞飞曾指出一个现实:“不同于LLM可以从互联网上获取丰富的数据资源,具身智能从训练到评测阶段,数据都十分匮乏。”机器人和自动驾驶无法像大语言模型那样从互联网文本中学习,因为它们的训练数据是物理交互,而真实的机器人跑一次实验的成本高得惊人,而且难以覆盖长尾场景。

因此,行业陷入两难,仿真环境,比如如英伟达Isaac Sim的成本低、数据量大,但仿真与现实总有偏差。就算机器人在仿真里练得再流畅,一进现实可能连门都打不开,这就是著名的Sim2Real Gap(仿真到现实鸿沟)。

真实机器人遥操作采集数据,准是准,但太贵、太慢、不够多。

李飞飞的Real2Sim2Real给出的方案是,先用Marble等模型对真实环境做高保真3D重建,然后在仿真中大规模训练机器人策略,最后将训练好的策略回迁到真实世界,并要求在真实环境中验证有效。

这条路线的理想状态下,仿真与现实之间形成闭环,互相校正、持续迭代。

李飞飞把世界模型按功能分成了三类,即渲染器做视觉生成,模拟器输出精确物理数据,规划器直接指导行动。其中,她认为模拟器是物理AI发展的最关键一环。

但是,李飞飞的这条路线同样面对严峻的挑战,因为模型重建3D空间不等于理解世界,几何结构也不代表物理状态。也就是说,构建一个可测量的三维模型,和让模型真正理解“在这个空间里施加一个力会发生什么”,其实是两件事。

此外,真实三维数据短缺、仿真误差累积、AI生成的三维内容可能存在形变或物理不一致,都是需要持续攻克的难题。

潜空间表征派:杨立昆的JEPA

相比前面两派,杨立昆的“潜空间表征派”则完全跳出了“空间”的框架,而是在一个抽象的、压缩过的表征空间里预测未来。

2022年,杨立昆团队提出了联合嵌入预测架构(JEPA),其核心思想是不预测像素,不重建三维结构,只预测视觉表征的压缩,把当前观测到的图像或视频压缩成一组高层特征,然后在这个抽象空间里推断下一时刻的状态会变成什么样。

这个思路的逻辑非常“杨立昆”,符合他一贯作风,即极致的“效率优先”思维、对“预测是智能本质”的坚持和“敢于唱反调”的学术个性。

在他看来,模型不需要记住某个场景里光照是暖色还是冷色、纹理是光滑还是粗糙。因为这些细节对“理解物理规律”毫无帮助,真正重要的是物体之间的因果关联、运动中的状态变化、动作与反馈之间的对应关系。

如何把这些信息从冗余的感知信号里提取出来,在抽象空间里做预测,效率更高、泛化更好,才是问题的关键。

2026年7月,杨立昆团队推出在部署过程中持续学习的自适应潜在世界模型 AdaJEPA。

这个模型的产生来自一个生物学的启发,人类不是靠一个固定不变的大脑模型应对所有环境的,而是每时每刻都在根据感官反馈调整对世界的认知。AdaJEPA把这个机制移植到世界模型上:机器人每执行一个动作,就用真实观测到的状态转移校正模型,再用更新后的模型重新规划下一步。

实验结果表明,AdaJEPA在推物体、迷宫导航等任务中,面对视觉变化、动力学变化等分布偏移时,规划成功率显著优于“训练后参数不再更新”的传统模型。这意味着,世界模型已经不只是一个训练完就定型的离线系统,第一次具备了“在真实世界中边做边学”的能力。

但是,国内的智源研究院对JEPA路线也提出了自己的判断,认为这类模型确实比像素生成派更高效,但“视觉嵌入的演化并不等同于物理规律的演化”。单纯从视觉表征中学习,可能仍然会遗漏语言中承载的大量物理常识和因果知识。

智源研究院院长王仲远认为,真正理解世界,还需要与语言等模态融合。

潜空间融合派:智源的RoboBrain Orca

智源是国内最早系统布局世界模型的科研机构之一,早在2024年其就已明确提出“大语言模型—多模态大模型—世界模型”的演进路径。

2026年6月的智源大会上,王仲远正式发布了智源对世界模型的定义:面向真实物理世界、以预测下一物理状态为核心的下一代基座模型。

这个定义本身就否定了把“生成画面”和“预测像素”作为核心任务,把“物理状态预测”推到了中心位置。

智源对上述的几条技术路线都进行了总结,它自己的技术路线就是,利用语言承载的人类物理常识,又利用视觉表征的高效预测能力,在统一的潜空间里原生融合。

2026年7月,这条路线走出了第一个标志性成果,即悟界·RoboBrain Orca。

Orca的核心创新在于,它不是一个“更会聊天”的大语言模型,不是“更会生成视频”的视频模型,也不是“更会抓东西”的机器人策略模型。其目标更为底层,即先学会“世界状态怎么变化”,然后再根据下游任务的需要,通过不同的解码器读出文本、图像或动作指令。

具体来说,Orca构建了一个统一的世界潜在表征空间。

无论你输入的是视频、图片、文字指令还是事件描述,模型都会把它们统一整合到这个“虚拟脑海世界”里,自主学习的不是某种模态的统计规律,而是物体运动规律、场景演变逻辑、动作因果关联、事件时序关系。

为了支撑这套学习,研发团队设计了“有意识+无意识”双路径互补训练体系:

无意识学习:用12.5万小时真实世界视频,不依赖人工标注,让模型像婴幼儿一样自主感知物体掉落、移动、空间交互等客观规律。这部分负责“常识积累”。

有意识学习:用1.6亿条事件标注数据(文字描述、任务指令、视觉问答等),让模型学习具备明确语义的状态转换逻辑。这部分负责“知识深化”。

Orca团队有一个很形象的比喻来解释自己的理念,“我们不会让一个3岁小孩进工厂,打10万小时螺丝。”意思是说,与其让AI一上来就钻进某个具体工位,比如预测下一个词、下一帧画面、下一步动作,不如先让它上一堂关于“世界如何变化”的义务教育课。理解世界在先,输出动作在后。

结语

四条路线,各有拥趸,评判标准正在浮现,但行业远未形成共识。

有研究者认为,世界模型应该优先追求“物理精度”而非“物理合理性”。另一些人则认为“长程推演”比“实时推理”更重要,或者反过来。

这些争论本身就说明,世界模型的路线之争仍将继续。AI对“世界模型”的探索,已从单一的哲学思辨演变为多条技术路线的并行竞争。

路线之争未必会以“谁消灭谁”的方式终结,更可能是在争论和实践中,逐渐形成一个融合各方长处的共识

而在这场仍在进行的路线之争中,一个事实已经清晰,世界模型不再是某个实验室或者某个公司的专属赛道,而是全球AI产业竞相争夺的下一代基座。谁能率先在“物理状态预测”这个核心能力上取得突破,谁就将有可能占据从数字世界通向物理世界的战略隘口。

也许,2030年再回头时,今天的路线分歧只是技术演进过程中一段不可避免的混乱期,而这段混乱,恰恰是创新的温床。

本文来自微信公众号“铑科技”,作者:鸿辰,36氪经授权发布。

+1
7

好文章,需要你的鼓励

参与评论
评论千万条,友善第一条
后参与讨论
提交评论0/1000

36氪AI测评

选靠谱AI,看真实评测
查看
36氪AI测评官方交流社区
加入

36氪项目推荐

咨询项目审核和入驻
联系
36氪项目推荐订阅号
关注

下一篇

变革之下,信用评级机构亦站在十字路口:是守住合规底线保全牌照,还是继续扩张业务版图。债券“看门人”过往的评级框架与展业逻辑,正经历一场深层调整

2小时前

36氪APP让一部分人先看到未来
36氪
鲸准
氪空间

推送和解读前沿、有料的科技创投资讯

一级市场金融信息和系统服务提供商

聚焦全球优秀创业者,项目融资率接近97%,领跑行业