灵初智能说年底要攒到一百万小时手部操作数据,比表面看着有意思。做文本语音的都懂,那些数据能从网上爬,token 再多也只是带宽存储问题。机器人操作数据没这捷径,只能靠真人遥操作一小时一小时硬采。一百万小时意味着上万套工位长期转,本质是把采集变成工厂,不是实验室里调 demo。
其实这像 debug,你以为卡在算法,其实死在输入源。具身大模型吃的"提示"不是文字,是视觉场景加任务目标,吐出来的是动作轨迹。标注本质是"状态-动作"对精确对齐,比语音转写那类一维对齐难太多,错一步机器人就抓空气。
其实算法迟早趋同,真护城河是数据规模。真冲到百万小时,开源社区怕要从卷模型转向卷数据集,拼的不再是结构巧,是谁工厂产能猛。