一场户外直播,以太大模型给具身智能立了一道新考题
9月16日,上海闵行的一家“烧烤店”里,两台机器人“店员”正在忙碌地招待着现场的3桌顾客。不远处,几台摄像机密集地注视着这一切,它们正在进行一场户外直播。
这不是一个容易的任务。一台机器人负责接单、招待顾客和打厨房下手,另一台则承担着厨师长的职责。顾客会时刻刁难两位“店员”,例如不断挪动现场物品,又或者临时加要求,而机器人需要时刻对现场的变化作出反应,判断该给出怎样的解决方案。
直播中,在顾客点单之后,前台接待的机器人需要确认要求,再将信息交给负责烧烤的同伴。一位顾客临时提出“少放辣”,负责接待的A3转身抬手招呼“厨师长”,把新要求再次提醒给它。等待出餐时,它还需要给顾客上水和递纸,同时继续追问烧烤进度。
两台机器人配合得有模有样:一个负责接待顾客,另一个留在操作台处理食物,期间机器人之间还会时刻发生交互,这无疑是一项需要长期维持状态的协作任务。
这台机器人的大脑来自乐享科技,它搭载的以太大模型是乐享于近日正式发布的一款跨本体通用具身大模型,也是前段时间引发具身智能圈热议的代号“MVP”的神秘模型。
最终,这场直播持续了一个多小时,刷新了具身智能大模型长时真实环境公开验证纪录。
在普遍用Demo来展示技术的具身智能行业,敢直播一两个小时,已经是一个不小的新闻。
过去两年,人形机器人几乎把能够吸引眼球的动作做了个遍。但这些动作大多存在于精心制作的Demo中。直播的挑战在于,机器人一旦卡住,所有的尴尬瞬间都会被镜头实时记录下来。而任务持续时间越长,模型累积错误的概率也就越高。
乐享科技把具身模型最容易暴露问题的部分,交给了大众。
1、一段神秘视频
8月底,一段时长10分钟的机器人视频突然在具身智能圈流传。
视频里出现了两台不同品牌的机器人本体。它们收到一个收拾房间的任务,并且共享同一套模型。两台机器人开始自行分工:个头较小的处理低处的物品,较大的承担更适合自身高度的工作。
视频中,小机器人在擦玻璃时遇到了麻烦。目标位置超出了手臂能够触达的范围,于是它转身寻找可以垫脚的箱子,却又被箱子的位置卡住。大机器人发现同伴受阻后,很快放下手里的任务前来帮忙。
整个过程并不顺利。负责擦玻璃的小机器人连续尝试了几次,玻璃上的痕迹依然没有消失。它停下来重新观察,似乎判断出污渍位于玻璃另一侧,随后调整位置继续处理。
这是个全程一镜到底的视频,并且据称没有任何场外遥控。尽管机器人动作不算利落,思考办法的过程也有些迟缓,但这些略显笨拙的片段反而引起了行业注意。发现直接方案行不通时,机器人很快就能利用环境寻找新办法,两台机器人合作得也井然有序。
这在机器人行业显得有些另类。毕竟,机器人的实时展示翻车案例不在少数。2024年特斯拉发布会上,Optimus机器人能自如地与观众交谈并充当调酒师,事后却被曝存在人工远程协助。Figure展示机器人叠衣服时,有媒体在现场看到毛巾经常卡住,需要工程师频繁上前调整。许多在运动会上跑出漂亮成绩的机器人,做工厂任务的时候依然容易出错。
就在外界开始打探这个神秘团队的身份时,他们却只留下模型代号MVP,全称是Make Veritable People,中文被团队翻译成——“做个人吧”。团队给出的解释是,模型也像人,让它自己说。
9月10日,这个神秘的MVP终于被乐享科技CEO郭人杰认领。它还有了一个新名字——Aether。
更有意思的是,在正式官宣Aether的同时,乐享科技还硬刚了一回OpenAI。
在OpenAI官宣要做物理ai、并万字长文发表物理ai技术路径后,乐享科技第一时间发文直指抄袭,并指出已经用该技术路径做出了具身智能的通用模型,OpenAI所提及的物理AI技术路径——自进化、神经元模型等,乐享科技在两个月前就已变成了现实并且提前发布。
按照乐享科技给出的时间线,以太大模型早在两个月前便已公开相关技术路线,并将自我进化和神经启发架构做进一套可以运行的具身智能通用模型。OpenAI文章讨论的Recursive Self-Improvement,与Aether此前提出的Evolution Manager都强调模型参与自身进化。乐享官网更早区分了目标对齐和价值对齐,郭人杰也曾在硅谷交流中用“星外来客”解释Aether。
乐享科技还对比了Aether与GPT-6 Astra的官网,认为双方在粒子视觉和页面结构上存在相似之处,而Aether官网的上线时间更早。截至目前,OpenAI暂未公开回应。
一家中国机器人创业公司公开质疑OpenAI,很容易让外界先把它看成一场借势传播。但这场直播把争论重新拉回到了技术本身,这是一份比概念对照更硬的自证。
2、以太大模型为什么敢离开Demo
今年的具身智能行业,已经不缺少精美的Demo。
但在很多时候,机器人能够成功夹起一次物体,和当下所处的实验室环境有关。换个场景,换个方向,换种光线,结果或许都会截然不同。而未来机器人要走向家庭,面对的挑战更是千变万化。
但当计划被打乱之后,机器人是否还能操作自如,或许才是具身智能行业当前最应该关注的问题。
目前行业最主流的路线之一是VLA,即视觉语言动作模型。它把摄像头画面、人类指令和机器人自身的关节状态编码进同一个模型,直接预测下一步动作,类似让机器人学习大量示范,再根据眼前情况找到最接近的处理方式。
但VLA对高质量机器人操作数据有很强的依赖。研究人员需要通过遥操作让人类控制机器人完成一遍任务,再把视觉画面和关节动作记录下来。数据采集成本高,速度慢,采集结果还会受到机器人本体的限制。同一批数据换到臂长和关节结构不同的机器人身上,价值就会明显下降。
因此,行业更主流的方式是混合使用真机数据和仿真数据,也会利用人类视频扩大训练规模,寻找成本和泛化能力之间的平衡。
另一条当下备受推崇的路线是WAM,即世界动作模型。它学习一个动作将怎样改变周围环境,再根据预测结果选择行动。它增加了对物理世界的预测,但只解决了问题的一部分。除此之外,机器人还要知道自身的能力边界。
乐享选择的是一种更现实的路径。据披露,Aether只有4B参数,训练使用约200小时人类视频,真机训练数据为0小时。这是一种更强调架构效率的方案:先用更少的数据建立对物理任务的理解,再依靠模型架构提高适应能力。
Aether的核心是一个统一的Energy(能量)系统。它会对机器人当前所处的状态进行整体评估,把任务完成程度和现实中的物理限制纳入同一个Energy系统。在传统VLA中,模型往往根据当前观察,选择概率最高的下一步动作。Aether评估的对象则是机器人整体处于什么状态。一个状态越接近任务目标,执行路径越符合物理规律,它对应的能量就越低。
以擦玻璃为例,机器人的目标一直是清除污渍。但当手臂够不到时,直接擦拭就不再是一条有效路径,这时系统会把注意力转向周围环境,寻找可以增加高度的工具。而当机器人发现擦拭多次都没有清洁效果时,视觉反馈又会改变模型对污渍位置的判断,它意识到污渍可能在玻璃的背面,于是又把手伸出窗外擦拭。
这种能力建立在主动感知之上。传统机器人经常被动处理摄像头传回的画面,而Aether却会根据当前的任务主动改变观察位置。信息不足时,机器人可以转头或者移动身体来补充新的视角。
当然,长任务还需要一套持续更新的记忆。
乐享将这种机制称为流式记忆。机器人在执行任务时,会持续记录环境变化和当前进度。顾客临时修改订单,或者工作被突然打断,模型仍然能够找到此前的任务节点,再按照新的现场情况调整顺序。
除此之外,模型还需要清楚执行任务的是哪一副身体。Aether加入了机器人对自身状态的内部表征Self Model。它会记录当前本体的尺寸和运动能力,让Aether理解这副身体的能力极限和优势,也便于跨本体适配。
知道身体边界之后,模型还要把高层判断及时转化成动作。
乐享将整套架构比作一条贯通大脑和脊髓的神经通路。高层系统负责理解人的要求和规划长任务,接近硬件的脊髓层处理力控和位置变化,传感器把每次执行结果送回系统,而在机器人受到碰撞或者物体突然滑落时,底层可以快速调整姿态和力度。
也只有认知、行动和物理反馈始终保持联通,机器人才能在缺少场外接管的情况下,撑起一场近两个小时的直播。
3、一场不断被打乱的直播
户外烧烤不算机器人行业最复杂的那类操作。单纯看动作,夹起食物和翻面都有着清晰目标。但直播的现场往往充满太多变数,环境是喧闹的。摄影灯和手机镜头围在机器人身边,周围还时刻有人群闯入。顾客的任何一个新要求,都会迅速打乱机器人原本安排好的顺序。
而每当此时,机器人都需要重新观察现场,同时保留此前的任务进度,再决定接下来先处理哪件事。
而且直播的真实之处就在于,操作也并非每次都顺利。机器人拿起调料瓶时,中途出现了没有夹稳的情况。但它很快就重新调整位置,将掉落的食物再次捡起,随后继续撒料。这也是Aether想强调的核心能力:动作即使失败,机器人仍然能够根据现场反馈自行处理。
公开直播是对机器人能力最严苛的一种压力测试。对于具身大模型来说,这显然比一段高光视频更有参考价值。
具身智能正在经历类似于自动驾驶的早期阶段。自动驾驶技术兴起之初,厂商最重要的任务是证明车辆能够自己跑起来,然后才是接管率和复杂的路况表现。而如今,机器人行业也渐渐走出了单项技能展示,连续工作时长和任务成功率,才是当下更具价值的衡量指标。
这场直播的意义也正在这里。它把行业的注意力拉出了精彩的展示动作,转向机器人在长时间运行中的稳定性和自主性。跨本体意味着模型可以进入更多机器人的身体,取消遥操作让自主程度得到公开检验,持续出现的意外则检验了Aether面对真实世界的适应能力。
具身智能的拐点,恰恰就在于此。机器人能在真实环境中长期稳定完成任务,才真正接近商业化。
乐享用一场近两个小时的直播,把这张考卷摊到了行业面前。下一阶段的竞争,将更考验机器人真枪实干的功夫。















