灵初智能最近在全国铺数据采集中心、喊出年底冲百万小时,还开源了首批1000小时手部数据。表面看是常规PR,我倒觉得藏着大模型赛道的一个拐点。
公开互联网文本这几年被各路模型啃得见底,前几波玩家基本靠"白嫖"全网语料起家,那层红利现在明显见顶。具身智能要的数据——机器人得学会真人怎么动手——网上根本爬不到,只能实打实建采集中心、雇人录演示。等于数据从免费公共资源,变成了要盖厂房、养团队、上设备的重资产。
所以下半场拼的也许不是谁架构更巧,而是谁能源源不断、低成本产出真实世界的 real-world data。开源那1000小时对没预算的小团队是雪中送炭,但重资产采集本身会不会把门槛越抬越高、让数据也变成头部玩家的 game,这点我有点悲观。这波"数据工厂"会像当年云算力一样卷成头部游戏吗?