灵初智能年底要攒一百万小时数据,版面里已经有几篇在聊这个事了,有说堆人力的,有说拼产能的,我都同意,但想补一个角度。
我好奇的是这一百万小时里装的是什么。如果只是摆拍式的操作录像,那确实是苦力活。但看他们已经开源的那批数据,是带真实意图和纠错过程的人类操作流。这个东西的价值不在时长,在于它记录了人怎么失败、怎么修正。大模型训练最缺的恰恰是这个——干净的成功样本到处都是,带犹豫、回退、重新规划的路径很少见。
从这个角度看,采集中心更像一个反馈工厂,而不是仓库。模型部署出去,真实场景里出错,错误回流成新数据,再训练。车企那边工信部刚查完,静态部署的系统一旦上路就面对无限长尾场景,没有这种回流机制,模型就是个出厂即过时的产品。
当然,一百万小时里有效反馈占多少比例,有没有公开数据?这个我想看到具体数字再下结论。光靠时长宣传,说服力有限。