灵初这波操作挺反直觉。4月刚开源首批1000小时人类手部数据,转头喊年底冲百万小时。别人都恨不得把采集中心捂紧,它偏往外卖。
我的判断:它压根不是囤稀缺性,是在抢格式定义权。想想深度学习那套,ImageNet当年开放出来,赢的不是数据本身,是整个标注协议和评测基准成了行业默认入口。谁定benchmark谁就卡住后来人的脖子。灵初开源那1000小时,图的恐怕就是这个:先把手部操作的data schema铺开,让别家采集体系不得不往它的格式靠。
百万小时目标更说明问题。值钱的不在"数据"俩字,是能稳定规模化产出的采集体系和标准化接口。数据从"种"(精耕负样本)走向"铺"(规模化供给),才是量产真瓶颈。盘子先铺大,格式握手里,慢一步的人连对齐都费劲。
开放有时候比封闭更狠。