极佳视界首次提出通用世界模型L1-L5分级体系
近日,在北京极佳视界科技有限公司与通用世界模型北京市重点实验室联合主办的2026世界机器人大会“通用世界模型前沿论坛”上,极佳视界创始人、CEO黄冠发表题为《通用世界模型引领AGI的最新前沿》的主旨演讲,并首次提出通用世界模型(GWM)L1-L5分级体系。该体系按照模型对视觉、动作、空间、物理和长程运行的建模能力,将通用世界模型划分为视频、动作、几何、物理、运营五个层级,旨在为不同技术路线提供统一的能力坐标系,并为研发目标、数据建设和评测方式提供参考。
极佳视界创始人、CEO黄冠在论坛发表主旨演讲
随着视频生成模型、交互环境模型和机器人策略模型被广泛纳入“世界模型”范畴,概念边界不断扩展,但不同模型的能力仍存在明显差异。画面逼真并不等同于空间结构准确,能够预测下一帧也不等同于能够判断接触、碰撞或长程操作的真实后果。黄冠认为,AGI不能只有语言智能,还需要能够在物理空间中理解、生成、预测和行动的“世界智能”,行业因此需要一套能够区分能力边界的分级框架。
基于极佳视界在通用世界模型领域的技术积累,以及在具身智能、自动驾驶、内容创作等领域的落地实践,黄冠表示:“通用世界模型(GWM)可以分为L1-L5分级框架——从生成视觉真实的视频世界,逐级走向动作、几何、物理,最终抵达可长程运营的通用无限世界。”
从视频到运营:通用世界模型的五级能力
L1-L5描述的是模型对世界施加的约束逐步增强:从外观真实走向动作可用,从三维结构稳定走向物理规律可信,再到状态、记忆与反馈能够在更长时间尺度上持续运转。层级越高,模型越不能只依赖一段“看起来合理”的视频证明能力。黄冠认为,通用世界模型的“通用”至少需要经受三重检验:能否跨场景迁移,能否被行动及其结果验证,能否在时间推移中保持一致。
L1视频:先让世界“看起来真实”
L1根据各种输入生成视觉真实的通用视频世界,重点考察画面质量、时间连续性、语义一致性与可控性。这一层解决世界的视觉表达问题,但视觉可信并不等于结构和规律可信。一个模型能够生成逼真的机械臂,并不代表它已经掌握夹爪与物体接触后的变化。
L2动作:从“看见未来”到“做出选择”
L2要求模型生成高效、合理的通用执行动作,把对环境的理解转化为可执行的动作序列。对于机器人,动作需要在约束条件下完成任务;对于交互环境,用户输入需要引起合理反馈。世界模型由此从内容生成工具进一步走向决策与行动的基础设施。
L3几何:让像素世界具备稳定空间结构
L3要求模型生成几何准确的通用空间世界,空间关系、尺度、遮挡、多视角一致性和三维结构成为硬约束。随着视角、传感器或观察时间变化,物体的位置、形状和相互关系仍应保持一致,使世界成为可以被定位、测量和导航的空间。
L4物理:从空间正确走向因果正确
L4要求模型生成物理精确的通用物理世界。除几何结构外,模型还需要遵循接触、摩擦、碰撞、力与运动等规律,不仅预测“接下来像什么”,还要判断“采取这个动作会发生什么”,并在更长的滚动预测中控制误差累积。
L5运营:让世界长期存在并持续反馈
L5要求模型生成可长程运营的通用无限世界。这里的“运营”并非商业运营,而是让世界在长时间尺度上维持状态、规则、记忆和交互,并在持续反馈中演化。模型还需要处理长程任务、多主体协同、异常恢复和开放式变化,使一次性生成结果转变为可持续运行的智能环境。
极佳视界提出的通用世界模型L1-L5分级体系
三条进阶轴共同刻画能力提升
这五个层级并不是五代模型的简单排列,而是由三条彼此关联的技术进阶轴共同构成。只有三条轴同时推进,世界模型才可能从演示走向可复用的基础能力。
表征轴:从像素到几何,再到物理。像素让模型学习世界的外观,几何赋予模型稳定的空间结构,物理则把结构与因果规律连接起来。能力越向上演进,模型越需要显式或隐式地保存对象、状态、关系与动力学,而不能只依赖局部纹理延续下一帧。
智能轴:从生成到行动,再到闭环反馈。生成是提出一种可能的未来,行动是在多种未来中选择一条可执行路径,闭环则要求模型根据结果持续修正策略。只有进入“预测—行动—反馈—再预测”的循环,世界模型才可能成为智能体的内部环境。
时间轴:从短片段到长程任务,再到持续世界。短时生成主要考验局部连贯性,长程任务会暴露记忆丢失、状态漂移和误差累积,持续世界还需要面对开放变化和多主体交互。L5的难点不只是“生成得更久”,而是让因果、状态和目标在更长时间尺度上仍然成立。
需要强调的是,更高层级不是替代更低层级,而是在其上叠加更强约束。没有稳定的视频表征,动作无从观察;没有准确的几何与物理,长程运行也只会放大误差。
三类场景检验同一套能力坐标
L1-L5并非从单一场景倒推出的抽象概念。极佳视界自2023年成立以来,持续布局通用世界模型的全栈技术体系,并将相关能力应用于具身智能、自动驾驶、内容创作等方向。不同场景对视觉、空间、物理、动作和长程稳定性的要求各不相同,但都在检验同一个问题:模型是否真正理解世界,而不仅是在拟合画面。
极佳视界的世界生成模型与世界行动模型体系
具身智能:以行动结果检验预测
在具身智能场景中,黄冠重点介绍了GigaBrain-0.7。据介绍,其System 1以VLA生成连续未来动作,System 2以VLM理解物理常识和因果关系并完成高层规划,System 3引入通用世界价值模型,对未来世界及动作价值进行预测,再结合在线强化学习形成持续自进化闭环。现场展示的一项长程任务包含20余个原子动作,并实现超过20分钟的一镜到底执行。
这类任务对应的不只是L2的动作生成。高层规划依赖对环境状态的理解,世界价值模型需要判断动作的未来后果,长程执行则会持续检验记忆、状态保持和异常恢复能力。机器人由此成为高等级世界模型的重要真机验证场景。
GigaBrain-0.7系统架构
自动驾驶:将视觉生成置于几何与物理约束之下
据极佳视界介绍,在自动驾驶场景中,DriveDreamer Engine由World Model、Agentic Model与Harness构成,支持结构化多输入视频生成、HD Map与3D Box控制、多视角生成,以及RGB与LiDAR之间的跨传感器一致性。极佳视界还将世界重建扩展至10公里以上路网,并在部分场景中把重建时间从约3小时缩短至约3分钟。
驾驶场景对“看起来合理”的容忍度较低:车道结构、车辆位置、遮挡关系与传感器观测需要保持一致,智能体的动作还需要引起合理的交通演化。这使其成为从L1视频向L3几何、L4物理演进的典型压力测试。
DriveDreamer Engine整体架构
极佳视界持续推进自动驾驶世界模型技术迭代
内容生成:在开放创作中检验可控性与一致性
在内容生成场景中,极佳视界以YiSu 2.0、YiSu Agentic与YiSu Engine构成产品矩阵,并通过WonderTurbo、HumanDreamer、Motion-R1、WorldDreamer等模型推进长镜头、三维一致性、人体运动和空间交互等能力。
内容创作通常从L1能力切入,但镜头拉长、视角切换以及角色与环境发生互动后,几何、遮挡和物理稳定性很快会成为决定内容可用性的关键因素。
极佳视界内容创作产品及模型矩阵
分级体系推动评测指标随能力边界升级
分级框架的意义不仅在于描述技术演进方向,也在于推动评测对象随能力边界升级。如果用视频美学指标衡量物理世界模型,或仅以短时成功率衡量长程智能体,容易把演示效果与真实能力混为一谈。
按照L1-L5框架,L1主要评估视觉质量、时间连续性和输入可控性;L2关注动作合理性、任务成功率、效率与安全边界;L3需要验证空间与结构的几何精度以及跨视角、跨时间一致性;L4进一步考察物理规律、因果关系和滚动预测的稳定性;L5则需要在长时间、开放环境和持续交互中检验状态持久性、长程稳定性、恢复能力与持续学习能力。
当指标随层级变化,行业才有可能区分“演示得好”与“能力走得远”。L1-L5由此不仅是一张技术地图,也可作为连接研发目标、数据建设与评测标准的共同语言。
从L1到L5,评测对象随能力边界逐级升级
从语言到世界,GWM成为AGI的重要前沿
“视频决定世界看起来是否真实,几何与物理决定它是否真正可以被进入、被预测、被行动;长程运营则决定这个世界能否持续存在。”黄冠表示,更高层级并非替代更低层级,而是在其上叠加更强约束。没有稳定的视频表征,动作无从观察;没有准确的几何与物理,长程运行也只会放大误差。
大语言模型证明了规模化学习可以压缩人类语言与知识,但物理世界并不只以文本形式存在。空间、动作、摩擦、碰撞以及不断延展的时间,都需要被纳入同一个可学习、可预测、可行动的系统。L1-L5分级体系给出的并非一张按年份划分的路线表,而是一条从“世界可见”到“行动发生”,再到“空间成立、规律可信、长程闭环”的能力累积路径。
极佳视界表示,将继续围绕通用世界模型推进全栈技术研发,并通过具身智能、自动驾驶和内容生成等场景验证相关能力。随着研发目标和评测方式逐步分层,通用世界模型有望成为连接数字世界与物理世界、推动AGI向真实环境延伸的重要技术方向。
2026世界机器人大会“通用世界模型前沿论坛”现场
关于极佳视界
极佳视界成立于2023年,围绕通用世界模型构建全栈技术体系,并在具身智能、自动驾驶、内容生成等方向推进技术研发与应用实践。















