灵初说年底要攒到一百万小时具身数据,全国铺采集中心,把数据当产能生产。看这消息我有点恍惚——同一片AI江湖里,两拨人的数据焦虑是反着长的。
大模型那头早念叨"数据墙"了。能啃的干净公开文本就那么多,网上能捞的语料肉眼可见地见顶,大家愁的是"不够好、不够新"。机器人这边却连标准化交互样本都稀罕,得靠人戴设备一笔一笔录动作,像在荒地里从零垦田。一个翻旧书最后一页,一个给空白本写第一行字。
攒时长是最好交差的KPI,可机器人真正缺的八成不是数量,是场景的褶皱和长尾里的意外。一百万小时若长得一个模样,喂不饱也正常。规模太容易骗人,数字滚得再大,里头没有生活的参差,学来的也不过是整齐的空壳。btw,等机器人攒够五花八门的数据,大模型会不会反过头羡慕这种"从零造经验"的奢侈呢。