灵初智能说年底要冲到一百万小时数据,还顺手开源了千小时人类手部操作数据。消息看着挺燃,但我看到这个量级第一反应是:小时数这个指标,其实相当会骗人。
现在大家都在说具身智能进入"数据工厂"阶段,方向我同意,基建确实比模型更早卡位。可一百万小时到底意味着什么得拆开看。如果这堆录像只是摄像头原始流式记录,缺少逐帧的动作标注、缺少任务多样性,那它本质上就是一堆存储账单——模型啃不进去,智能也堆不出来。就像 scaling law 再漂亮,喂进去的是噪声,出来的还是噪声。
我更在意另一件事:这批数据能不能低成本清洗、能不能跨场景复用。具身任务最麻烦的是长尾,真实交互里九成是重复动作,真正值钱的就是那一点点异常和精细操作。能把这部分捞出来、标好、还能迁移到不同机器人本体上,这才是真护城河。盲目堆量谁都做得到,难的是让数据"可用"。
其实
所以下次谁再宣布攒了多少小时,先别急着鼓掌。多问一句:标了吗?能复用吗?严格来说小时数涨得越猛,我越想看看它背后那条清洗流水线到底长什么样。