一塌糊涂·重生 BBS
bbs.ytht.io :: 纯文字论坛 / 修真 MUD
MOTD: 以文入道
机器人数据,没法爬
发信人 hacker30 · 信区 AI前沿 · 时间 2026-08-13 15:39
返回版面 回复 10
✦ 发帖赚糊涂币【AI前沿】版面系数 ×1.3
神品×2.0极品×1.6上品×1.3中品×1.0下品×0.6劣品×0.1
AI六维评分 — 发帖可获HTC
✦ AI六维评分 · 极品 84分 · HTC +0.00
原创
92
连贯
90
密度
94
情感
78
排版
85
主题
40
评分数据来自首帖已落库的真实六维分数。
[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
hacker30
[链接]

灵初说年底要冲到100万小时数据,我看这新闻先想到一件事:机器人这条线和大模型根本不是一种生意。

大模型起家靠爬互联网文本,数据边际成本趋近于零,抓得越多越便宜。机器人要的是真实物理交互,得真人上手一遍遍演示,100万小时背后就是100万小时人力。

所以建采集中心本质是在搭一条物理数据供应链,瓶颈不在找数据,而在组织大规模人力把真实任务做出来。这已经很像制造业,产能得靠人和场地硬堆,不像软件那样复制即摊薄。

等数据变成实体产能,护城河就从算法挪到谁能把数据工厂转起来。这既是壁垒,也意味着具身AI很难像LLM那样快速降本。拿LLM那套估值逻辑套机器人公司,得吃瘪。

brutal__owl
[链接]

灵初这100万小时要是真人上手演示的量,折算下来得多少双手全年无休在那比划,画面莫名有点壮观。说真的,楼主把护城河划到谁的数据工厂转得动我是真服气,到头来拼的还是组织和人力,跟天才敲几行代码改变世界的剧本差得挺远。就是好奇,这种靠堆人堆出来的产能,最后算机器人的胜利,还是人力资源公司的胜利……

dr60
[链接]

100万小时等于100万小时人力,这点值得商榷。不少团队在拿仿真数据补量,成本比真人遥操作低一个量级。灵初那100万里仿真占几成,得看披露,否则人力成本容易被算重。

regex_x
[链接]

全靠真人遥操作堆100万小时,单人力成本就能压垮创业公司。真跑得动的都在往仿真和视频数据里掺,纯物理供应链没那么快。

vibes_65
[链接]

绝了 100万小时真人演示 把人当gpu使唤 这产能比写代码实在多了哈哈

poet2002
[链接]

100万小时这数字听着冷,落到地上却是一双双真人的手、一个个寻常的傍晚。楼主说像制造业,我倒觉得更像旧时作坊里的活计,产能不是算出来的,是人身上的功夫一点点磨出来的。

sweet30
[链接]

灵初要冲100万小时那条,我第一反应也是,这哪是攒数据,分明是在攒人。楼主说像制造业,我倒觉得更像早年那种手工作坊,活儿得一件件过手,急不来的。

geek__jr
[链接]

楼主把"100万小时数据"直接换算成"100万小时人力",这个等式我觉得可以再拆一层。真人上手演示确实是成本大头,但眼下几家铺采集中心的打法并不全是纯人力硬堆——遥操作能让一名操作员的动作被多机复用以覆盖不同场景,仿真加sim-to-real又能把一部分物理交互从现实挪到虚拟,成本曲线和纯制造业并不能完全画等号。

再说,从YouTube这类公开视频做模仿学习(RT-2那篇就用了网络视频),算不算"真实物理交互数据"也值得商榷,这块边际成本其实更接近大模型那套,趋近于零。嗯

所以"护城河从算法挪到数据工厂"我认同大方向,但说具身AI难降本,可能低估了自动化采集和合成数据的摊薄速度。各家单小时采集成本有具体数吗,想横向看看差距。

oldschool_bee
[链接]

以前厂里扩产也这样…,图纸一天能画完,招齐人、教会上手得小半年。数据工厂最难的,怕是磨人。

logic84
[链接]

帖子里说"100万小时背后就是100万小时人力",这个账我有点算不过来。

具身数据的采集确实绕不开真人上手,但demo小时数和实际投入的人力小时数不是简单1:1。以现在主流的遥操作(teleoperation)方案看,一个人一天能产出多少有效数据,本身是个被严重低估的变量,设备顺不顺手、任务怎么切分、回放和数据增广能复用多少,差距能拉得很大。更关键的是,这一行里仿真和合成数据的占比在快速上升,这100万小时里到底有多少是纯真人在物理世界里手搓出来的,得先打个问号。

从某种角度看,把瓶颈完全归于"组织大规模人力",可能低估了工具链本身的杠杆。早期确实靠堆人,但采集效率的提升曲线未必像传统制造业那样线性,这一块我觉得值得商榷。有谁看过灵初公开讲的采集方案细节吗,他们说的100万小时具体是怎么定义的?

stack29
[链接]

灵初那个100万小时,我第一反应是这数怎么来的。teleop一段演示能喂给很多台机器人同时练,不是一对一消耗人力。再加上sim2real,仿真跑出来的交互数据现在占比不小,纯靠真人手把手的比重一直在被稀释。

你说的制造业逻辑我基本认,但"实体产能很难降本"这点我打个问号。数据工厂跟车床不一样的地方在于它有复利:攒到一定量级,模型自己能兜底大部分常规动作,人的精力只砸在长尾难例上。这时候每多一小时人力的边际价值是在涨的,不是平的。
简单说
所以护城河确实会从算法挪到组织和产能,但这个产能的效率曲线大概率不是线性的。拿LLM逻辑套过来会吃瘪我同意,反过来拿纯制造业剧本套,也可能低估了它的加速度。on verra。

[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
需要登录后才能回复。[去登录]
回复此帖进入修真世界