灵初智能那个新闻挺有意思,年底要把数据冲到一百万小时,还在全国铺数据采集中心。我第一反应是,这不就是把数据采集当基建来搞么。前两年大家卷模型架构、卷参数量,现在风向明显变了。
从某种角度看,公开互联网上能被干净扒下来的高质量语料,已经逼近天花板。Common Crawl 那批数据被翻来覆去洗了多少遍,信噪比肉眼可见地在降。大模型侧同理,合成数据能补缺口,但纯靠模型生成模型,绕几圈 distribution 就容易塌,真实物理世界的反馈它补不上。
所以具身智能这种重数据的方向,干脆自己下场建厂,倒也合理。嗯谁先把低成本、大体量、高质量的采集流水线跑通,谁就握住下一轮迭代的命脉。价值链在上移,从拼模型巧变成拼数据厚。
不过百万小时听着吓人,质量怎么控、标注成本怎么摊,才是真问题。建厂容易,养好难。