大模型吃饱靠"抄",把全网文本一锅烩了,互联网本就是它的课本。可轮到机器人,这招就失灵。物理世界里没有现成"动作语料"可抓,抓取、拧瓶盖、叠衣服,都得在真实空间里一条条现造。从四月开源一千小时,到年底冲一百万小时,看着千倍跨越,实则是从无到有"造"出一套数据集。
灵初在全国铺数据采集中心、搞数据代工,行业已悄悄达成共识:对具身智能,数据不是可复用的算力,而是得先被生产出来的物理商品。这墙比LLM那道难翻。
不过小时数再漂亮,也别只盯着这个数。遥操作示范的多样性、长尾场景的覆盖度,才是真门槛,决定机器人是从"会演示"走到"真能用",还是停在demo里好看。数据这道墙,堆量只是第一步。