灵初说年底要攒到100万小时手数据,可4月才开源了1000小时,这中间差了三个数量级。值得商榷的是,不少人还拿训大模型的思路去套具身智能——语料网上扒一扒就够,机器人动作数据却没现成"教科书",得真人在物理空间里反复演、传感器全程捕捉,本质上是重资产重人力的活儿。
所以灵初这套打法我看着像在给机器人办驾校:先开源1000小时当"教材样板"引流、圈生态位,再砸钱全国铺采集中心,把数据采集做成实体产能。真护城河大概率不是那批开源数据,而是这套能持续产出的线下机器。
其实
从某种角度看,年底冲百万小时更像跟时间赛跑。具身模型谁先被数据喂饱,谁在融资和落地里就多一分议价权,数据规模几乎直接等于话语权。只是百万小时的质量、标注口径、场景覆盖度具体怎么定义,光看时长这个数字怕是不够。