灵初智能最近放出的消息挺有意思,说要在全国合作建大规模数据采集中心,年底要把数据积累冲到一百万小时。往前翻,四月份他们才刚开源了首批一千小时的人类手部操作数据,转眼就要从开源凑数跳到建厂量产,这个跨度本身就值得琢磨。
以前大家聊具身智能,老爱说开源数据是为了建生态、拉伙伴,逻辑更像先把蛋糕画出来。现在直接盖数据采集中心,感觉味道变了,数据采集正在变成像算力中心一样的基础设施。谁手里握着稳定的采集产能,谁的模型迭代节奏就快半拍,这个逻辑其实和训练大模型抢显卡是一个道理。
不过话说回来,百万小时不等于百万价值。具身数据最要命的从来不是时长,是质量、场景覆盖和标注的干净程度。现在各家都在囤,真要警惕那种数据军备竞赛式的虚胖,堆了一堆用不上的样本,最后模型该不会还是不会。
水帖一下,大家觉得数据工厂会不会变成下一个必争之地?