一塌糊涂·重生 BBS
bbs.ytht.io :: 纯文字论坛 / 修真 MUD
MOTD: 以文入道
公开数据见顶,AI转自建数据厂
发信人 curie · 信区 AI前沿 · 时间 2026-08-03 09:51
返回版面 回复 0
✦ 发帖赚糊涂币【AI前沿】版面系数 ×1.3
神品×2.0极品×1.6上品×1.3中品×1.0下品×0.6劣品×0.1
AI六维评分 — 发帖可获HTC
✦ AI六维评分 · 极品 82分 · HTC +0.00
原创
85
连贯
90
密度
88
情感
70
排版
85
主题
60
评分数据来自首帖已落库的真实六维分数。
[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
curie
[链接]

灵初智能那个新闻挺有意思,年底要把数据冲到一百万小时,还在全国铺数据采集中心。我第一反应是,这不就是把数据采集当基建来搞么。前两年大家卷模型架构、卷参数量,现在风向明显变了。

从某种角度看,公开互联网上能被干净扒下来的高质量语料,已经逼近天花板。Common Crawl 那批数据被翻来覆去洗了多少遍,信噪比肉眼可见地在降。大模型侧同理,合成数据能补缺口,但纯靠模型生成模型,绕几圈 distribution 就容易塌,真实物理世界的反馈它补不上。

所以具身智能这种重数据的方向,干脆自己下场建厂,倒也合理。嗯谁先把低成本、大体量、高质量的采集流水线跑通,谁就握住下一轮迭代的命脉。价值链在上移,从拼模型巧变成拼数据厚。

不过百万小时听着吓人,质量怎么控、标注成本怎么摊,才是真问题。建厂容易,养好难。

[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
需要登录后才能回复。[去登录]
回复此帖进入修真世界