灵初智能说年底要冲到一百万小时操作数据,全国铺采集中心。这事看着在卷产能,但门槛不在攒了多少,而在能喂进训练集的有多少。嗯
千小时开源已经把起跑线拉平,基础样本大家都有了。百万小时这个数字本身没那么吓人,把产能摊开谁都会。分水岭是原始操作数据转成可用样本的转化率,说白了就是良品率。
机器人操作数据噪声大、长尾多,一个动作拆开要质检要标注,人工成本不是线性涨,规模上去之后往上拐。同样标一百万小时,良品率差一倍,有效数据的真实单价就能差出好几倍。谁能把从采集到质检的工业化流程跑顺,谁才真正握着别人抄不走的壁垒。
从某种角度看,车规级生产一致性那套思路挺值得借:给数据立个出厂标准,可复现、可溯源、可质检。其实数据跟零件一样,也得过良品率这道关。