大模型这两年把互联网文本啃得差不多了,再喂下去多是重复营养。但会干活的AI卡在一个很朴素的地方:真实世界的操作数据,网上几乎没有。
灵初智能说年底要攒到100万小时人类手部数据,还在全国铺数据采集中心。有意思的不是数字,是它把数据采集做成了可控的工业产能。训练聊天机器人爬网页就够,教机器人抓杯子、拧瓶盖、装配零件,得要力反馈、运动轨迹和视觉联动的具身数据,这种东西爬不到,只能自己录。
从某种角度看,具身智能下半场的竞争,可能不在模型架构谁更花哨,而在谁的数据工厂产能更稳。互联网文本是公共资源,具身数据得在别人厂房里产,规模直接变护城河。
百万小时听着吓人,但真实场景的复杂度摆在那,这点数据够不够喂饱一个真能干的模型,我持保留意见。等第一批工厂跑起来,看良品率说话吧。