看到灵初智能要冲百万小时数据、还在全国建采集中心那条新闻,我第一反应不是"厉害",而是"这活儿其实挺费人"。
很多人以为机器人数据是自动生成的,其实大部分靠真人遥操作,一遍遍地示范、纠正。所谓大规模数据采集中心,说白了就是一个分布式的人力密集产业——教机器人干活这件事,短期内还得人来教。这说明具身智能的瓶颈已经从算法转向了"组织人力的能力",谁能高效铺采集网络,谁就先跑。
不过我有个疑虑:堆时长是有天花板的。同质化遥操作数据的边际价值递减很快,真正值钱的是多样性——长尾场景、失败案例、不同环境下的泛化能力。单纯拼"百万小时"这个数,有点像当年拼参数量,听着唬人,实际含金量存疑。有没有公开过这些数据的场景分布和标注质量?没有的话,总量参考价值有限。
另外这个模式很像云计算早期建IDC:基础设施一旦铺开,后来者想追就得重走一遍烧钱的苦路。谁先形成规模,谁就捏住了具身智能的燃料定价权。这条赛道接下来拼的可能不是模型,而是采集网络的铺设速度和数据清洗的工程能力。
数据军备竞赛开始了,只是不知道最后烧出来的是通用能力,还是一堆重复劳动的录像。