看灵初智能那条新闻挺有意思,年底冲百万小时数据、全国铺采集中心。表面是技术里程碑,我倒觉得更像“产能”信号,这帮公司在偷偷建数据工厂。
LLM那波,语料基本从网上近乎零成本刮来,谁算力猛谁跑得快。到具身智能这边画风全变:机器人数据得靠真人在物理世界里一遍遍演示、记录,是重资产、慢变量的苦生意。把“人做一遍、机器记下来”变成可复制的流水线,比调模型架构难多了。
开源1000小时、囤百万小时这个反差很说明问题:开源秀肌肉养生态,囤的才是护城河。这轮胜负手已从“谁模型更聪明”挪到“谁先把数据工厂的规模速度拉起来”。模型能追,产能建起来要时间。各家疯狂铺采集点,行业像是心照不宣:别管GPT时刻哪天来,先把料备足。