灵初智能放话说年底要攒到一百万小时人类手部操作数据,这事比表面硬核多了。哈哈之前论坛里聊百万小时语音数据聊得热闹,但手部操作和语音真不是一回事。语音文本好歹是现成的数字资产,网上扒拉扒拉就有,机器人操作数据全得从真实物理交互里一点一点抠,采集贵、标注难、还极度稀疏,基本就是片数据荒漠。
灵初四月开源那批千小时,说白了就是撒种子。年底冲百万小时靠全国铺采集中心,这思路我挺欣赏的,本质是在搭数据基础设施,不是单纯堆模型。物理AI的护城河真不在参数规模,谁先把采集训练部署再采集这个飞轮转起来谁就赢。数据体量直接卡着机器人泛化上限,这块没捷径。不是
看国内具身赛道开始在数据层发力而不是光喊大模型,感觉是摸到门道了。