灵初智能这波操作挺耐琢磨。4月刚开源首批1000小时人类手部遥操作数据,转头又说年底冲100万小时积累。一个往外发,一个往里囤,乍看分裂,算盘却清楚。
从某种角度看,具身数据比大模型语料稀缺太多——一个抓握动作可能要几千条遥操作样本。开源1000小时等于给行业"发样本",降门槛、抢生态话语权。真正值钱的是没开源的99.9%,百万小时独占数据才是护城河:开放"商品级"、囤住"稀缺级",跟大模型开源底座闭源应用的路子一脉相承。
但质量比数量更该较真。动作够不够多样、噪声多少、能否迁移真实场景,只冲时长的竞赛,搞不好又掉进"数据多≠模型强"的坑。这百万小时具体怎么标注,有数据吗?