中国具身智能又跑出一匹黑马:清科灵境 OASIS WAM 登顶 RoboLab,击败 NVIDIA、Google、PI 等头部团队

时氪分享·2026年09月21日 08:00
具身智能的竞争,正在从“机器人本体”进一步向“大脑”迁移”。

近日,RoboLab 全球高保真仿真基准平台公布最新排行榜。在覆盖120 个视觉-语言-操作任务的综合评测中,由清科灵境(Synkrotron)联合中国科学技术大学研发的OASIS WAM获得综合排名第一。

从参测团队来看,这份榜单并不缺少头部企业,包括 NVIDIA、Google、Physical Intelligence(PI)等具身智能领域的重要团队。

更值得注意的是,RoboLab 基于 NVIDIA Isaac 与 NVIDIA Omniverse 仿真技术构建,通过高保真视觉环境和基于物理的建模能力,对机器人策略进行大规模训练与测试。此次 OASIS WAM 的成绩,是通过开放调用接口,由平台实际完成测试确认后形成的排行榜结果,而非团队自行提交的离线成绩。

这意味着,这是一场在统一仿真环境和统一任务体系下进行的横向能力测试。同时,RoboLab 采用动态随机生成场景、可变语言指令、可控环境扰动,没有固定训练题库,无法靠死记规则刷榜。

这也是榜单中唯一的中国团队。

对于一家由图灵奖获得者姚期智院士孵化的中国创业公司而言,这样的结果意味着什么?或许更重要的并不是“赢了谁”,而是WAM 这样的机器人动作模型路线,开始在大规模、多样化的机器人任务泛化测试中展现竞争力

而在这场排名背后,清科灵境真正想解决的,是一个更大的问题:

怎样让机器人不仅能够“动起来”,还能够理解任务、预测环境变化,并连续完成复杂任务。

1、机器人真正缺的,可能不是“手脚”,而是一个能够持续做决策的大脑

过去几年,人形机器人最受关注的部分仍然是本体。

机械结构、灵巧手、关节模组、运动控制……这些决定了一台机器人“能不能动”。

但当机器人开始面对更加复杂的开放环境,一个新的问题越来越明显:

机器人知道自己应该做什么吗?

比如,给机器人一个任务:

> “按照从下到上的顺序,把红、蓝、绿、黄四个积木叠起来。”

对于一个主要负责低层动作生成的模型而言,它可以学会“抓住积木”“移动到目标位置”“松开夹爪”,却未必能够理解四个动作之间的任务顺序。

这也是清科灵境希望通过 WAM 与高层 VLM 协同解决的问题。

在清科灵境的技术方案中,WAM 接收机器人当前的 RGB 图像、关节状态、夹爪状态以及语义指令,生成一段连续的机器人动作;与此同时,它还会预测这段动作执行过程中,场景在视觉上可能发生怎样的变化。

而在 WAM 之上,清科灵境引入高层 VLM。

VLM 负责理解完整任务、判断机器人当前处于什么阶段,并决定下一步应该完成哪个 manipulation subgoal。

例如:

拿起香蕉并把它放进碗里。

对于高层模型来说,这就是一个完整的操作目标。

至于靠近香蕉、闭合夹爪、抬起香蕉、移动到碗上方、打开夹爪等连续动作,则交给 WAM 完成。

这形成了一个清晰的分工:

VLM 决定“做什么”,WAM 决定“怎么做”。

2、真正有意思的地方,是让机器人“一边做,一边想下一步”

如果只是 VLM + WAM,这并不是这套方案最值得关注的地方。

清科灵境真正试图解决的,是机器人系统里一个非常现实的问题:

高层模型太慢。

传统方式往往是:

执行当前动作 → 等动作完成 → 调用 VLM 思考下一步 → 再调用低层策略执行。

对于复杂任务来说,机器人可能大量时间都耗在等待模型推理上。

清科灵境的做法,是把这两个过程直接重叠起来。

机器人执行当前动作的时候,WAM 同时预测未来视觉状态;高层 VLM 不需要等机器人真正到达那个状态之后才开始思考,而是可以根据 WAM 预测出的未来场景,提前判断下一步应该完成什么操作。

于是整个系统同时运行三个过程:

机器人执行、低层 WAM 推理、高层 VLM 推理。

机器人还在做第一步的时候,系统已经开始思考第二步。

这套设计的关键,是让高层推理不再完全成为机器人执行流程中的“等待环节”,而是尽可能隐藏在机器人当前动作的执行时间里。

对于需要连续完成多个操作的机器人任务而言,这种异步方式有机会进一步降低高层模型推理带来的等待时间。

3、甚至连 VLM“还没说完的话”,都可以被拿来抢跑

清科灵境进一步增加了一个轻量级的Speculator 模型

高层 VLM 的输出是逐步生成的。在完整答案生成之前,系统已经能够看到一部分 VLM 输出。

Speculator 会读取这些已经生成的部分内容,并提前预测一个临时的下一步高层指令。

例如,VLM 还没有完全输出最终结果,Speculator 已经可以预测下一步可能是:

拿起红色方块并把它放进托盘。

这条临时指令可以提前发送给 WAM。

于是,WAM 不需要等待 VLM 完全结束,就可以开始生成下一段机器人动作。

等 VLM 最终完成推理后,如果最终指令和 Speculator 的预测一致,之前启动的 WAM 推理可以继续使用;如果两者不一致,则系统根据最终 VLM 指令进行修正。

最终的语义决策权仍然掌握在 VLM 手中,但系统已经提前利用了等待时间。

这套机制本质上是一种推测式执行。

它解决的并不是“模型聪不聪明”的问题,而是一个非常工程化的问题:

怎样让机器人在等待 AI 大脑思考的时候,尽可能不要停下来

4、从“动作生成”到更完整的机器人智能系统

从技术架构来看,清科灵境实际上试图建立的是一个分层的机器人智能系统。

最底层是机器人本体和实时控制。

中间是 WAM,负责根据当前机器人状态和语义指令生成连续动作,同时预测动作执行过程中可能出现的未来视觉状态。

再往上,是高层 VLM,负责理解整体任务、判断当前任务进度,并决定机器人下一步应该完成什么操作目标。

最终,Agent Controller 将机器人、WAM、VLM 和 Speculator 连接起来,根据当前能够获得的最新语义信息,决定下一轮 WAM 应该执行哪一条高层指令。

这种架构背后的核心思路,是把机器人的任务理解、动作生成和实时执行进行分层,同时让不同模块之间的计算尽可能并行。

其中,一个关键设计是 WAM 的未来视觉预测。

机器人执行当前动作的同时,WAM 已经开始预测接下来场景可能发生的变化;高层 VLM 则可以利用这些预测结果,提前判断任务接下来应该往哪个方向推进。

这样一来,高层决策就不必完全等待机器人完成当前动作之后才启动,而是可以与机器人执行过程重叠。

对于需要连续完成多个操作的复杂机器人任务来说,这种异步的决策方式,有机会进一步降低高层模型推理带来的等待时间。

5、RoboLab 第一名之外,清科灵境想做的,是具身智能的公共技术底座

RoboLab 的成绩为这条技术路线提供了一次公开的能力验证。

但如果把视线从一次 benchmark 拉长,清科灵境真正希望构建的,并不只是一个在特定任务上取得高分的机器人模型,而是一套能够持续支撑机器人学习、训练和落地的技术体系。

在清科灵境看来,具身智能真正走向大规模应用,仍然面临几个基础问题:机器人对物理世界的理解和交互能力尚未完全解决,训练数据不足限制了模型泛化,同时数据在机器人系统中的流转效率、推理响应速度和执行稳定性,也直接影响机器人能否进入真实商业场景。

因此,清科灵境目前围绕OASIS WAM、混合数据平台和 Dora OS三个核心技术方向展开。

第一层,是 OASIS WAM世界动作模型,解决机器人的“大脑”问题。

OASIS WAM面向通用机器人,承担任务理解、动作规划、状态预测、长程任务和泛化执行等能力。

在具体系统中,WAM 并不是孤立工作的动作生成模型。它可以根据当前机器人状态和语义指令生成连续动作,同时预测动作执行过程中可能出现的未来视觉状态;高层 VLM 则负责理解整体任务、判断当前任务进度,并决定下一步应该完成什么操作目标。

通过这种分层架构,机器人可以在执行当前动作的同时,提前对下一阶段任务进行推理,从而把高层模型的计算与机器人执行过程尽可能重叠起来。

第二层,是混合数据平台,解决具身智能“从哪里学习”的问题。

与纯数字世界中的 AI 模型不同,机器人需要大量真实世界交互数据,而真实机器人数据的采集成本高、效率低,也很难覆盖复杂多样的环境。

清科灵境希望通过真实数据、众包数据和仿真数据的结合,建立持续的数据获取和迭代体系,并通过机器人评测进一步形成数据闭环。

这意味着,机器人不只是依赖一次训练得到一个模型,而是通过真实世界、仿真环境和评测体系持续获得反馈,再反过来推动模型能力迭代。

从这个角度看,RoboLab 的价值也不只是一个排行榜。

它提供了一套标准化的机器人任务测试环境,让不同策略能够在相对统一的任务体系中接受泛化能力检验。

第三层,是 Dora OS,解决具身智能系统“如何高效运行”的问题。

当机器人同时运行视觉、语言、动作等多模态模型时,系统面对的已经不只是传统机器人控制问题,还包括大量高频数据的通信、设备管理、算法管理、任务调度以及端边协同。

Dora OS 正是从这一层切入,定位为具身智能原生操作系统,承担数据通信、设备管理、算法管理、任务调度和端边协同等基础能力。

三者组合起来,构成了清科灵境对于具身智能基础设施的整体思路:

OASIS WAM负责让机器人“会思考、会行动”;混合数据平台负责让机器人“持续学习”;Dora OS 则负责让这些能力真正高效地运行在不同机器人本体上。

而这也是清科灵境希望成为“具身智能行业公共技术底座”的原因。

向上,它可以支撑医疗科研、工业制造、巡检运维、教育科研、智能物流等不同应用场景;向下,则可以兼容机械臂、智能复合机器人、人形机器人、四足机器人以及 AGV/AMR 等不同类型的机器人本体。

这种平台化路线的价值在于:基础能力可以一次建设,在不同场景中持续迭代,不同机器人本体可以共享复用,从而减少不同企业重复建设“大脑”、数据体系和操作系统的成本。

对于机器人企业而言,这意味着它们可以更加专注于自己的本体能力和具体应用场景,而不必每一家都从头开始搭建一套完整的机器人智能基础设施。

+1
12

好文章,需要你的鼓励

参与评论
评论千万条,友善第一条
后参与讨论
提交评论0/1000

36氪AI测评

选靠谱AI,看真实评测
查看
36氪AI测评官方交流社区
加入

36氪项目推荐

咨询项目审核和入驻
联系
36氪项目推荐订阅号
关注

下一篇

MLCC(多层陶瓷电容器),被业内称为“电子工业大米”。小到手机家电,大到AI服务器、新能源汽车,几乎所有电子设备都离不开。

46分钟前

36氪APP让一部分人先看到未来
36氪
鲸准
氪空间

推送和解读前沿、有料的科技创投资讯

一级市场金融信息和系统服务提供商

聚焦全球优秀创业者,项目融资率接近97%,领跑行业