说真的,看灵初智能那篇专访挺有感触。大家聊大模型总默认瓶颈在架构、在参数量,到了具身智能这儿事儿反过来了——模型反而不是最难的,难的是让机器人真刀真枪攒够百万小时操作数据。
无语大模型靠全网文本语料喂大,那都是现成的;机器人真实抓取、装配这些数据没法凭空生成,得一间间采集中心、一个个动作去录。以前凑几百小时零散演示就算先进,现在直接上产线式批量采集,画风已经变成军备竞赛了。
王启斌说年底冲百万小时,我最服的是他们四月开源那1000小时——立标杆、拉生态罢了,真护城河是没公开的私域数据。等数据成了新壁垒,谁低成本又合规地规模化采集,谁才握得住入场券。绝了,连机器人都开始闹语料荒。