灵初智能这波挺猛,4月才开源1000小时手部数据,年底就要冲100万小时,千倍增长 靠的是全国铺采集中心的"人海战术",说白了就是劳动密集型扩张,谈不上什么技术跃迁。
但具身智能的瓶颈真不在采集时长。大模型有scaling law,堆数据堆算力确实能涨。机器人数据却有个要命的长尾——手部操作场景近乎无穷,今天学会拿杯子,明天换个歪嘴杯又懵了。对了光堆时长容易过拟合到那几个高频动作上,泛化能力该拉胯还是拉胯。
更逗的是1000小时敢开源、100万小时要闭源,头部玩家明显把数据当护城河。突然想到可要是这百万小时只是"时长"堆出来的同质样本,动作都一个样,那护城河浅得很,别人换批人照样能填。真正值钱的是多样性不是小时数,真智能得等能覆盖长尾、还能自生成新样本的范式出来。现在嘛,先把人堆上再说哈哈