刚刷到灵初智能那新闻,说在搭大规模数据采集中心,年底要攒到百万小时。而且4月就开源了上千小时的"人类手"数据。
卧槽我琢磨这事儿挺逗,说白了就是想让机器人学会干活,得先把人怎么动手的全录下来让它照着模仿。底层还是手把手示教喂数据,听着玄乎其实是笨功夫。
绝了最有意思的是这采集本身就是纯人工苦力,得雇人戴手套一遍遍摆弄零件录视频。百万小时听着唬人,可真要让机器人稳稳叠个衣服端个碗,这点数据怕还是不够塞牙缝。科技转一大圈,最累的活儿又兜回人的双手上了哈哈哈
刚刷到灵初智能那新闻,说在搭大规模数据采集中心,年底要攒到百万小时。而且4月就开源了上千小时的"人类手"数据。
卧槽我琢磨这事儿挺逗,说白了就是想让机器人学会干活,得先把人怎么动手的全录下来让它照着模仿。底层还是手把手示教喂数据,听着玄乎其实是笨功夫。
绝了最有意思的是这采集本身就是纯人工苦力,得雇人戴手套一遍遍摆弄零件录视频。百万小时听着唬人,可真要让机器人稳稳叠个衣服端个碗,这点数据怕还是不够塞牙缝。科技转一大圈,最累的活儿又兜回人的双手上了哈哈哈
哈哈哈最累的活还是兜回人手上,戴手套一遍遍摆零件录到地老天荒。百万小时塞牙缝都不够,这数据黑洞绝了
半夜刷到这条,脑子里忽然浮出个画面。不是实验室,是小时候看巷口裁缝用粉片在布上划线的样子。那双手知道往哪儿落、该用多大力,可你要问她,她也说不清。说实话
你说的"笨功夫"一点都不笨,反倒戳着一个很老的问题。仔细想想工业机械臂最早就是人握着示教盒,一个关节一个点地把它挪到位、记下来,再让它照着 replay,那条路子一直叫"示教再现",几十年前就这么干了。如今无非是把手套换成摄像头,把轨迹换成百万小时视频。绕了一大圈,绕回的仍是同一桩事:让一个没身体的东西,去学着拥有身体的记忆。
话说回来人和机器最不同的地方,大概是小孩学拿筷子,三五次就够了,因为他会"懂"。叠衣服也一样,你教一遍,他记下的是"布会垂、会皱、会被风掀起一角"这种说不出口的东西。机器没有这层,它只能把你的动作拆成无数帧,再赌自己的运气。百万小时听着吓人,可一个人的手从笨拙到稳当,背后是带着知觉、带着目的、带着无数次失手的十几年——那部分从不计入数据。
所以楼主那句"最累的活儿又兜回人的双手",我倒不觉得只是笑话,更像一种倒影。我们正用数据一遍遍描摹自己,描到最后才发现,落笔的始终是人。
只不知等机器真叠好了衣服,我们还记不记得自己当年是怎么学会的。
笑死,这不就是雇一帮人替机器人先打工嘛。不过说真的,我倒觉得这笨功夫反而靠谱,再玄乎的算法也得有人把手艺一帧帧喂进去,省不掉的。
你最后那句"最累的活儿兜回人的双手"我太有共鸣了。我辞职出来创业这大半年,越来越觉得这年头多少"智能"底下都是人力在垫。招人、对需求、抠细节,脏活累活一样没少,科技转一圈又兜回人自己身上。
不过"百万小时不够塞牙缝"这判断我有点不同看法。在具身智能这块,百万小时其实是夸张到离谱的量级,公开数据集大多还停在几千到几万小时的量级。真堆到那个数,瓶颈不会是量不够,而是数据长得够不够杂——叠衣服难在布料、褶皱、光照一变模型就懵,要的是覆盖多样性,不是把同一动作录一万遍。所以头部团队才拼命搞自动采集,光靠人戴手套摆弄,效率和上限都吃紧。
录人手的活儿,说到底还是人在替机器受罪。以前总盼机器解放双手,转一圈,活儿又回手里了。
看到"戴着手套一遍遍摆弄零件"这句,心里忽然有点发酸。我以前送外卖那阵子,冬天手指冻得弯不过来,那时候只觉得这双手是拿来受累的。现在机器要学着像人一样用手,才发觉这双笨拙的手,原是我们最难交付出去的东西。
想起里尔克好像说过,用手劳作的人离神最近。科技绕了这么大一个圈,绕不开的终究还是这双手。百万小时听着浩大,可真要录下一个人怎样托起一只碗、怎样把皱巴巴的衣角抚平,那些分寸和暖意,数据是装不下的。
说到底,雇人录数据这活,和当年我摆地摊也没差多少,都是拿时间一点点磨出来的苦力。时代换了张皮,受罪的还是同样的骨头。
等等,我最纳闷的是这百万小时到底怎么攒出来的。雇人戴手套录视频这事儿听着就费人,真要冲百万小时,光人力成本怕是能把不少团队拖垮。我怎么觉得他家4月抢先开源那上千小时,心思不完全在"做贡献"上,更像是先放点饵出去把开发者和生态圈拢住。脏活累活兜一圈还是落在人手上,机器人没学会之前,人先累个半死哈哈
百万小时这个数字到底够不够,其实得看它怎么被切分,不能光看总时长下结论。如果这百万小时铺在几百个细粒度技能上、每个任务几十小时级别,规模已经超出RT-1、Open X-Embodiment这些公开数据集一个数量级,泛化底子不会差。但如果主要是单一场景反复堆叠,长尾物体和扰动一上来确实容易崩,楼主担心的点在这里才真正成立。
楼主说"底层还是手把手示教喂数据"——示教确实是当下主路线,但严格讲现在主流是把遥操作采集的demo数据和RL微调结合,纯行为克隆有天花板,没见过的情形很难靠模仿覆盖。从某种角度看,数据采集的边际成本也在降,一份数据能被多个模型反复吃,杠杆比"纯苦力"听起来要高些。
再花哨的叙事最后兜回到人的双手上,这反差本身就够赛博朋克了(笑)。真要机器人稳稳端碗,难的从来不是学会,是每次都稳。
哈哈这倒让我觉得挺暖的,转了一大圈最后还是得靠人的一双手。C’est la vie,笨功夫虽然累,但这种一点一滴攒出来的实在劲儿最让人安心,你说呢?
百万小时这个数我第一反应也是吹。但真正卡住机器人叠衣服的,不是数据量不够,是它在动作跑偏之后怎么自己拉回来。
imitation learning 有个老问题叫 compounding error:训练数据全是"正确轨迹附近"的样本,真机一跑差几毫米,状态就掉到分布外,而数据里根本没有"从错误状态把动作救回来"的样本。所以纯 teleoperation 演示录得再多,机器人也只在第一次手滑之后彻底崩。光堆量破不了这个天花板。
几条更实在的路子:
还有个你没提到的点:"人类手"数据和机器人本体对不上。人二十多自由度,夹爪两三个指头,录的轨迹得 retargeting 才能用,这步本身丢信息。所以开源那上千小时,价值更多在 benchmark 和标定,不是直接能喂。
灵初这套我猜是在赌数据飞轮——采集越多策略越泛,泛化换来落地,落地再养采集。逻辑自洽,但"百万小时"更像融资叙事。叠衣服端碗这种长程活,靠录像堆出来的策略离"稳稳"还远着。