灵初智能4月才开源首批1000小时人类手部数据,年底却要冲到100万小时积累。这俩数字摆一块儿就挺有意思,开源的那点连千分之一都不到,真正喂模型的家底永远锁在自家服务器里。
从某种角度看,这更像放饵而不是分享。具身智能眼下最大的麻烦不是有没有数据,而是各家采集、标注各搞一套,谁先在开源社区攒够人气、把自家接口变成事实标准,后面就省掉一堆扯皮。那1000小时够跑通demo、够论文引用、够生态养成用你格式的习惯,但训练下一代的真机轨迹,外人扒破头也摸不到。
值得商榷的是护城河到底长啥样。等数据采集被工业化成建厂攒时长,拼的就不是谁数据多,而是谁那池子私有数据先撞线、且独家到别人抄不动。到年底谁先摸到百万小时,谁大概就握着定义机器人能力下限的定价权。这账,比开源那点姿态实在多了。