Figure用一款APP建立全球「数据采集经济体」,中国具身企业谁会抢先跟进?

潮涌AI·2026年08月27日 20:48
你在家里做家务的数据,现在可以卖钱了。

你在家里叠衣服、洗碗、拖地的视频,现在可以卖钱了。

这不是夸张。

四个月前,美国机器人公司Figure悄悄上线了一款APP做测试;而在8月26日,这款APP正式更名Index,在Google:Play和App Store全球上线——一个让普通人通过录制家务视频来赚钱的平台。

创作者上传自己干活的第一视角视频,Figure按数据质量付费。

四个月测试期内,平台已经覆盖108个国家和地区,积累了1600万段视频,Figure向创作者支付了1500万美元,并承诺未来12个月在数据和算力上投入超过10亿美元。

这个模式的根本,是机器人行业一个被严重低估的瓶颈:数据。

大模型的能力爆发,离不开互联网上动辄数万亿Token的文本数据——仅GPT-4的训练数据量就超过13万亿Token。

但具身机器人面临的是一个完全相反的局面:它没有互联网。

在潮涌AI的报道《光轮智能总裁杨海波:从仿真数据到物理真实,具身智能的“基础设施”之战》一文里,杨海波算过一笔账:具身智能的数据需求,至少是大语言模型的1000倍。

全球81亿人,每天清醒时间超过12小时,理论上每天产生约1000亿小时的物理交互数据——但其中的绝大部分,从来没有被记录过。

Figure想做的,就是用”众包+经济激励”的方式,把这1000亿小时里的一小部分”捕获”回来,变成机器人的训练燃料。

机器人行业的叙事正在换挡:硬件的掌声渐弱,真实的人类行为数据正在成为新的”石油”。对估值390亿美元的Figure来说,Index不是一个副业项目,而是核心战略。

Figure想建的,是一个全球化的”数据采集经济体”。

01 Index的本质:用”众包”解决机器人的”数据饥渴”

Figure的Helix模型是一套端到端的VLA(视觉-语言-动作)系统:70亿参数的视觉语言模型负责理解任务,8000万参数的视觉运动网络负责实时控制。

这种模型对数据的需求是海量的、多样的、高质量的——供应商给不了,Figure决定自己建。

Index的打法很直接:你在APP上注册,录制自己做家务或工作的第一视角视频,上传后通过审核就能拿钱;也可以雇佣零工上门干活,同时录制操作画面……Figure按数据质量和数量付费。

Index App

目前每1000小时数据平均包含373种独特任务、1146种被操作对象、116个独特环境。平台每秒能处理30分钟的视频上传,背后是一套7×24小时运转的数据基础设施。

这不是“众包标注”的简单升级。

Figure要的不是人工打标签,而是人类在真实环境里干活的原生视频。

叠衣服时手指怎么捏、拖地时手腕怎么转、洗碗时怎么判断碗洗干净了——这些细微的动作逻辑,仿真数据生成不了,实验室采集不到,只能从真实场景里“买”。

02 中国企业的“数据长征”:都在做,但都很吃力

国内机器人企业不是没意识到数据的重要性。

实际上,几乎所有头部玩家都在重金投入数据采集,但和Figure的“众包平台”模式相比,中国企业的数据获取方式普遍更“重”、更“贵”、更难规模化。

  • 智元机器人

按Omdia的通用人形机器人口径(含轮式双臂),2025年出货5168台,占全球39%份额,位列第一(不过这个“第一”存在统计口径之争)。

其AgiBot World项目自建2000平方米真实采集场,覆盖217个任务、3000余种物品,数据规模850TB;2026年4月,智元又开源了AGIBOT WORLD 2026数据集。与此同时,英伟达GR00T N1模型80%以上的真机训练数据来自智元开源数据集。

但采集场是重资产,扩一座就要重新投钱、搭场地、买设备。

  • 宇树科技

2025年人形机器人出货超5500台,按纯双足人形口径自称全球第一。

2026年3月开源UnifoLM-WBT全身遥操作真机数据集,包含340小时、189万条动作轨迹,覆盖衣物收纳、家电操作等场景。宇树走的是“硬件+数据流水线+模型训练+开源社区”一体化路线。

开源数据的增长速度受限于社区活跃度,做不到Figure那种“全球几万人同时上传”的规模。

  • 优必选

2025年全年订单近14亿元。

其牵头的国地共建创新中心发布RoboMIND数据集,涵盖279个任务、单臂/双臂/人形等多种机器人形态,优必选自身也在多地建集中化数据采集中心。

路线偏“内部闭环”——数据围绕自身本体和任务统一设计,集中度高,但开放性弱,采集成本全部由自己扛。

  • 自变量机器人

2026年4月发布全球首个世界统一模型WALL-B(WUM架构),坚持100%真实场景数据采集,同时提出“牛奶数据”概念——真实家庭里自然光变化、物品随意摆放、人宠随机互动的“嘈杂”数据,与实验室“糖水数据”对立。自研主从遥操、外骨骼等数采设备,建了大量数据工厂。

2026年7月推出QUANXTA Zero无本体数采方案,宣称可将模型完成简单任务的数据成本整体降低约60%。

即便如此,创始人王潜自己也坦言:“机器人其实硬件到位了,但是大脑没有跟上。”

  • 星海图

开放GOD真机数据集,覆盖住宅、商超等复杂场景,让机器人在更接近现实的环境中积累数据。

  • 银河通用

走“合成数据打底,真实数据校准”路线,用仿真提速、用真机校准。

  • 傅利叶智能

产品与服务已覆盖全球40多个国家和地区、约2000家机构与医院,在医疗康复场景中通过真实部署与仿真平台持续积累数据。

  • 千寻智能、穹彻智能

与第三方数据服务商37度数据合作,外包部分采集标注工作。

一个共性很明显:国内具身企业的数据采集,要么自建工厂(重资产),要么依赖开源社区(速度慢),要么外包给第三方(质量难控),每一条路都有天花板,没有人能像Figure那样,用“众包+经济激励”的方式,让全球几万人同时为自己“生产”数据。

03 Figure模式,中国企业能复制吗?

答案是:能,但有难度。

而且如果不尽快行动,数据差距可能越拉越大。

Figure的核心优势不是技术,是“网络效应”。

108个国家、1600万段视频、1500万美元创作者报酬——这是一个飞轮:越多人上传,数据越多样,模型越强,机器人越能干,平台越值钱,越多人愿意上传。这种飞轮一旦转起来,后来者很难追赶。

Index周活用户

国内企业要走这条路,面临的现实障碍有三层:

第一,隐私和合规。

在中国,上门拍摄家庭内部视频涉及隐私权、肖像权、数据安全等多重监管。Figure在欧美可以靠“用户授权+匿名化处理”推进,中国的合规门槛更高。

第二,成本结构。

中国的人力成本确实更低,但“低成本”也意味着“低激励”。Figure在美国付的报酬能让创作者觉得“值得做”,中国的定价要打动普通人,平台补贴规模不能小。而自变量即便把数采成本降低了60%,依然是重资产投入。

第三,数据多样性。

中国家庭环境的物理差异极大——从一线城市的精装公寓到三四线城市的自建房,从南方的潮湿气候到北方的干燥暖气。Figure覆盖108个国家,天然获得跨文化、跨气候、跨建筑类型的多样性;中国企业如果只做国内市场,数据多样性天然受限。如果做海外,又要面对文化差异和运营成本。

但机会同样明显:中国有14亿人、全球最完整的制造业供应链、和Figure相比低得多的运营成本。如果能解决合规和激励机制,一个“中国版Index”的潜力可能更大。

04 数据战的终局:不是谁数据多,而是谁能把数据变成“能力”

瑞银证券中国工业行业分析师王斐丽今年4月受访时判断:人形机器人行业的“电动车时刻尚未到来”,当前大量出货仍流向科研机构和数据采集中心,真正进入工厂持续复购的商业化拐点仍未出现。

今天的数据竞赛,本质上是在为“拐点”积累筹码。

Figure投入10亿美元建Index,不是为了现在变现,而是为了在机器人真正走进千家万户的那一刻,拥有别人无法复制的数据壁垒。

对中国企业来说,跟进Figure的“采集经济体”模式,不是简单的“我们也建一个APP”。真正需要回答的问题是:你的模型需要什么样的数据?你能用什么样的成本获取这些数据?你的数据能不能持续产生、持续更新、持续反哺模型迭代?

Index上传视频

智元用“开源生态+数据工厂”回答,宇树用“全栈一体化+社区共创”回答,优必选用“集中采集+内部闭环”回答,自变量用“真实场景+无本体采集”回答,Figure用“众包平台+全球化+经济激励”回答。

五条路线,没有绝对的对错,但都有一个共同前提:数据必须真实、多样、持续。

05 潮涌AI观点

Figure的Index发布,把机器人行业竞争的底牌翻开了:拼完本体、拼完模型,最终要拼的是数据。

1600万段视频、1500万美元创作者报酬、10亿美元未来投入——这些数字背后,是Figure对“数据即壁垒”的深刻认知。

中国企业在数据上并非落后。

智元的AGIBOT WORLD、宇树的UnifoLM-WBT、优必选的RoboMIND、自变量的QUANXTA Zero,都在各自路线上有扎实积累。

但相比Figure的全球化众包网络,中国企业的数据获取方式仍偏“重”——自建采集场、自有遥操设备、内部闭环。质量可控,但规模天花板明显。

更值得警惕的是标准问题。

今天每一家都在用自己的采集格式、自己的标注规范、自己的场景定义闭门造车,攒下的数据彼此听不懂、接不上。

规模再大,也是一个个互不相通的池塘,而不是一片海。

对中国机器人产业来说,比“再造一个更大的数据集”更紧迫的,是让各家数据能对话、能流通、能协同训练的通用规则。这件事谁先做成,谁拿到的就不只是数据,而是整个行业的“接口定义权”。

机器人时代的“石油”,是人类每天重复的、琐碎的、真实的物理行为。

谁能以最低成本、最大规模、最高质量地获取这些行为,谁就能训练出最“像人”的机器人。

中国机器人企业会不会跟进Figure的“采集经济体”模式?

短期看,自建采集场和开源数据集仍是主流;长期看,当数据规模成为决定模型能力的关键变量,众包、零工、平台化的数据采集必然会进入中国的机器人产业。

问题不是“跟不跟”,而是“什么时候跟”、“以什么方式跟”、“由谁来牵头”。

参考文章:

机器人前瞻《Figure正式发布Index:覆盖108个国家和地区,超1600万段视频》

腾讯科技《为了给机器人囤数据,Figure全球悬赏人类“干活”》

融中财经《花了十年,优必选终于把机器人卖出去了》

T之家《2026年具身智能数据竞赛进入下半场:九家头部玩家的四大路线》

本文来自微信公众号“壹番财经”(ID:finance_yifan),作者:龙二,36氪经授权发布。

+1
3

好文章,需要你的鼓励

参与评论
评论千万条,友善第一条
后参与讨论
提交评论0/1000

36氪AI测评

选靠谱AI,看真实评测
查看
36氪AI测评官方交流社区
加入

36氪项目推荐

咨询项目审核和入驻
联系
36氪项目推荐订阅号
关注

下一篇

36氪APP让一部分人先看到未来
36氪
鲸准
氪空间

推送和解读前沿、有料的科技创投资讯

一级市场金融信息和系统服务提供商

聚焦全球优秀创业者,项目融资率接近97%,领跑行业