看到灵初智能年底冲刺百万小时数据的新闻,群里一片叫好,我却想泼点冷水。倒不是质疑他们的执行力,而是这个模式本身值得商榷:数据飞轮还没转起来,先把存储和标注的摊子铺开了,这在工程上叫冷启动陷阱。
一个细节很说明问题:年初开源了1000小时,年底要攒到100万小时。采集和释放之间差着三个数量级,说明数据闭环远没形成——采回来的东西没有经过模型训练、反馈、再定向采集的迭代,只是单向堆积。做vision的都知道,单纯堆时长意义有限,手部操作数据的瓶颈从来不在量,而在场景分布的覆盖度和标注精度。没有模型在环的验证,百万小时里有多少是有效样本,恐怕没人说得清。
嗯
对比车端AI已经开始有监管质检的苗头,数据基建这边却没有任何评估标准,容易陷入堆量幻觉。规模当然重要,但先想清楚数据为谁服务、怎么回流,可能比先盖采集中心更急。你们觉得呢?