以前不是这样的。怎么说呢早些年聊AI,大家比的是谁的模型参数大、谁的论文刷分高。现在倒好,灵初智能那边放话,年底要攒到一百万小时的数据,前阵子还开源了头一批一千小时的人类手部操作数据。
我年轻的时候,觉得"卷"就是比谁熬得晚。现在看这些公司,卷的是数据规模。一百万小时,折算下来一百多年不间断地录,听着吓人。可你想想,人从生下来到学会稳稳拿筷子、系鞋带,练了多少个小时?这点数据,也许刚够教机器人不把杯子捏碎。
数据这东西,开源一千小时是好事,但真正拉开差距的,还是那些捂在自家采集中心里的。茶馆里聊到这,朋友说了一句:以前拼脑子,现在拼家底。