具身数据5S店:去营业厅做家务,就能训练机器人
在湖南郴州,一家中国移动营业厅门口挂着一块新招牌——“具身数据采集 5S 店”。不是卖手机的,不是办套餐的。你进去领一套夹爪、一双特制手套和一台头戴相机,经过简单培训,就可以开始做家务。叠衣服、擦桌子、开冰箱、摆碗筷。每做一个动作,都是在采集机器人训练数据。
这不是科幻。首期投放的 1000 套设备,满产状态下每年能采集 100 万小时的数据。
一个被数据饿着的行业

机器人行业现在最大的瓶颈不是硬件,不是算法,是数据。
大语言模型有整个互联网当训练集,几万亿 token 随便喂。但机器人呢?机器人需要的是物理世界的数据——手怎么抓杯子、怎么拧瓶盖、怎么在厨房里转身而不撞到冰箱。这些数据不是从网页上爬下来的,是一秒一秒”做”出来的。
一台真机遥操采集,需要一个人操控真实机器人完成每一个动作。一个熟练操作员一天能采集的有效数据,可能还不够一个模型训练十分钟。而人类示范数据(无本体采集)虽然比真机便宜,但需要人亲自上手做,费时费力。
这个矛盾催生了一整个行业——具身数据服务商。
97 家玩家,一年 44.7 亿

量子位最近做了一次不完全统计,国内具身数据赛道已经挤进了 97 家玩家。70 家做数据采集,27 家做数据基础设施。
过去一年,光是不做本体、不做模型的”独立数据服务商”,就有 15 家拿到了融资,总额约 44.7 亿元。听起来不少?放在整个具身智能赛道里看,其实不算多——今年上半年,具身”大脑派”公司半年就融了 223 亿元。
数据服务商们的生存策略五花八门。有免费上门保洁顺便采数据的——公司派一个人去你家做家务,手里拿着采集设备,一举两得。有把数采做成 VR 游戏的——枯燥的重复动作包装成闯关任务,采集员更愿意干。还有更先进的:把真实机器人接入互联网,采集员不用跑到数采工厂,远程就能”云操控”。
郴州的 5S 店属于”无本体采集”路线——人直接完成动作,通过夹爪映射和第一视角相机记录,机器人本体不需要在场。这种路线设备便宜、场地灵活,非常适合大规模铺开。
四条技术路线,没有一条能单干

目前的具身数据采集技术路线分为四类。
真机遥操是最传统的方式:人操控真实机器人做任务,同步记录动作和传感器数据。这条路线的玩家最多——22 家,其中 13 家是国资数据平台,7 家是机器人公司。国资平台的优势是”不怕重”——买本体、租场地、雇操作员,这些投入对它们来说不是问题。
无本体采集是近一年最火的路线。人直接动手干活,通过动捕、夹爪映射、头戴相机采集数据,不需要机器人参与。成立于 2024 年 9 月之后的公司占了绝大多数,技术分支也最丰富——Ego 视角、肌肉电信号采集、触觉采集……
仿真合成在虚拟环境中批量生成数据,曾经被认为是最具性价比的方案。但过去一年里,曾经坚定的仿真派们纷纷开始”走多路线”。原因很简单:sim2real gap(仿真到真实的差距)一直没有一个好的解法,真实世界的摩擦、形变、力觉反馈,仿真的还原度始终不够。
还有一种路线叫互联网视频蒸馏——从 YouTube、B 站上的海量视频里提取动作知识,转化成机器人可学的数据。走这条路的目前只有一家公司,宣称能把综合采集成本降到行业平均水平的千分之五。
但无论哪条路线,都没有谁能独自满足机器人的训练需求。行业有一个经典比喻:数据金字塔。不同层次的数据需要不同的采集方式,层与层之间谁也替代不了谁。
数据越多,机器人越聪明?

数据够多了,机器人是不是就真能像人一样干活了?
不一定。具身数据和语言数据有一个根本差异:语言数据是结构化的,一段文字说清楚了就是一个训练样本;但物理世界的数据需要”对齐”——同一个动作,从不同角度、用不同力度做出来,对机器人来说可能意味着完全不同的东西。
还有一个更深的问题:如何保证采集数据的质量?一个人戴着夹爪在营业厅里叠衣服,叠得对不对、动作是否标准,这些都需要实时校验。目前行业里的主流做法是人工审核 + 自动化初筛,两条腿走路。
但不管怎么说,郴州那家营业厅已经开起来了。1000 套设备摆在那里,普通人走进去就能参与训练机器人。这本身就是一件值得注意的事——具身智能的数据飞轮,正在悄悄转动。
来源:36 氪 | 量子位
