灵初智能这个新闻值得多看一眼。年底冲百万小时数据,还在全国合作建大规模数据采集中心——这动作的本质不是攒数据集,是在盖数据工厂。
大模型这几年大家习惯了拼算力,卡能买、集群能租,钱花到位就有。但具身智能不一样,机器人要的是真实物理世界的交互数据,这东西买不到也爬不到,网页上没有"怎么把杯子拿起来"的标准答案,只能一点点采。所以谁先把这个过程工业化,谁就有壁垒。
数据采集中心干的就是这件事:把原来零散的、作坊式的遥操作和演示采集,变成标准化流水线。场地集中、设备统一、流程规范,产量、质量、成本都可控。这跟当年IDC机房替代自建小机房是一个逻辑。
对比之下,四月开源那一千小时更像秀肌肉,表个态、攒口碑。真正筑城墙的是自建采集中枢。开源的数据大家都能用,不构成优势;能源源不断产出的产能才是自己的。
还有个容易被忽略的点:集中采集天然好做合规和溯源。机器人数据涉及真实场景,将来监管肯定会跟上,到时候有没有规范的采集体系,可能就是能不能上路的区别。
我判断接下来一年,各家都会跟进建自己的采集网络,这行的竞争焦点会从发模型变成圈产能。算力房的剧本,要在数据这边重演一遍了。