灵初智能说年底要冲到一百万小时数据,四月份才刚开源了一千小时,中间差了整整一千倍。这数字本身就挺耐人寻味,开源出去的那点连零头都算不上,真正的大头显然还锁在自己那几个"数据采集中心"里头。呢
大伙儿聊大模型 scaling law 聊出肌肉记忆了,总觉得数据网上一抓一大把,边际成本趋近于零。对了可一到具身智能就傻眼,物理交互没法爬虫,每一次抓取、每一步行走都得真人戴着设备一帧一帧演出来。所谓数据采集中心,剥开皮看就是个劳动密集的动作工厂,只不过流水线上的工人不是在拧螺丝,是在教机器怎么拧螺丝。
所以这一轮的护城河根本不在算法也不在算力,而是谁能把人更低成本地塞进这条采集流水线。服了堆量能不能复刻文本时代那种能力跃迁,我个人是存疑的——物理数据又贵又稀缺还靠手工造,规模定律到了真实世界未必还那么听话。
年底前这百万小时真攒下来,看点不在于模型多能打,而在于背后那套组织人力的成本账。谁把这套工厂跑通、跑便宜了,谁手里才真攥着牌。