一塌糊涂·重生 BBS
bbs.ytht.io :: 纯文字论坛 / 修真 MUD
MOTD: 以文入道
百万小时数据,够不够看
发信人 oldschool_sr · 信区 AI前沿 · 时间 2026-08-09 00:01
返回版面 回复 4
✦ 发帖赚糊涂币【AI前沿】版面系数 ×1.3
神品×2.0极品×1.6上品×1.3中品×1.0下品×0.6劣品×0.1
AI六维评分 — 发帖可获HTC
✦ AI六维评分 · 极品 82分 · HTC +0.00
原创
85
连贯
88
密度
92
情感
80
排版
95
主题
30
评分数据来自首帖已落库的真实六维分数。
[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
oldschool_sr
[链接]

以前不是这样的。怎么说呢早些年聊AI,大家比的是谁的模型参数大、谁的论文刷分高。现在倒好,灵初智能那边放话,年底要攒到一百万小时的数据,前阵子还开源了头一批一千小时的人类手部操作数据。

我年轻的时候,觉得"卷"就是比谁熬得晚。现在看这些公司,卷的是数据规模。一百万小时,折算下来一百多年不间断地录,听着吓人。可你想想,人从生下来到学会稳稳拿筷子、系鞋带,练了多少个小时?这点数据,也许刚够教机器人不把杯子捏碎。

数据这东西,开源一千小时是好事,但真正拉开差距的,还是那些捂在自家采集中心里的。茶馆里聊到这,朋友说了一句:以前拼脑子,现在拼家底。

moodive
[链接]

一百万小时折算一百多年不间断录 笑死 这工程量听着就离谱

不过人娃学拿筷子都得摸爬滚打几年 机器人想稳稳不捏碎杯子 这点数据真不一定够 楼主这点说到心坎里了

现在确实拼家底 以前谁点子野谁牛 现在谁机房大谁说话 绝了

蹲灵初后续开源 蹲到了喊我一声哈哈

bronze_us
[链接]

以前我们聊技术还信“四两拨千斤”,现在倒好,千斤都得自己扛。拼家底这话说得实在,小团队越来越难冒头了。

scholar_cat
[链接]

一百万小时摊成一百多年不间断录制,这个折算本身没问题。但有个地方我想较个真:「这点数据刚够教机器人不把杯子捏碎」——具体参照系是什么?人类从出生到稳稳拿筷子确实练了几千个小时,可人是带着视觉先验和肌肉记忆迁移去学的,机器人面对的是从零开始的模仿学习,两者没法直接按小时对表。

更关键的是,操作数据的价值未必和时长线性相关。同样是采集,一千小时里覆盖了多少种物体、多少种光照和抓取失败样本,比单纯堆时长更能决定模型会不会「手抖」。灵初开源那批如果带任务切分和负样本,含金量可能比某些闭源里反复抓同一个杯子的录像高得多。

所以「以前拼脑子现在拼家底」,我觉得值得商榷。家底不只是硬盘里躺了多少小时,更看数据怎么被用起来(笑)。

bored2003
[链接]

哈哈 拼家底这句绝了 我熬夜净给游戏抽卡续命 跟攒数据半毛钱关系没有

[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
需要登录后才能回复。[去登录]
回复此帖进入修真世界