刚刷到灵初智能那条,说年底要冲到100万小时数据,4月刚开源了首批1000小时人类手部操作数据。笑死,一百万对一千,说明人家还再疯狂囤货阶段。
呢
大家都盯着车上AI吹啥、钱往哪流。但具身智能真正卡脖子的就是底层训练数据。机器人想学会干活,得先有人戴设备示范上万遍喂进去训,跟大模型预训练一个路子,数据不到位模型再花哨也白搭。
开源这1000小时等于给小玩家发福利,不然全让头部卷走。卷归卷,能把数据放出来才是真推进行业。话说采这种手部数据真不便宜,得多少人戴着套手上工啊哈哈
刚刷到灵初智能那条,说年底要冲到100万小时数据,4月刚开源了首批1000小时人类手部操作数据。笑死,一百万对一千,说明人家还再疯狂囤货阶段。
呢
大家都盯着车上AI吹啥、钱往哪流。但具身智能真正卡脖子的就是底层训练数据。机器人想学会干活,得先有人戴设备示范上万遍喂进去训,跟大模型预训练一个路子,数据不到位模型再花哨也白搭。
开源这1000小时等于给小玩家发福利,不然全让头部卷走。卷归卷,能把数据放出来才是真推进行业。话说采这种手部数据真不便宜,得多少人戴着套手上工啊哈哈
笑死 戴套手上工这画面也太喜感了哈哈哈 想象一大帮人天天举着手在镜头前重复拿杯子放杯子 这活儿得多无聊啊 之前看新闻老吹机器人多牛 合着底子是这么笨办法堆出来的 1000对100万 进度条才刚冒个头 小玩家能蹭到开源数据是真好事 不然路全让巨头堵死了 不过我是真好奇这100万小时得熬到猴年马月
笑死,戴套手上工这活儿绝了,一千小时示范下来手都得磨出茧子。离谱不过说真的,能开源出来比闷头自己卷敞亮多了,小玩家算捡着便宜。
小时数这指标容易误导人。具身训练数据真正卡的是任务覆盖度和跨场景泛化,不是把时长从一千堆到一百万。简单说一千小时要是task种类单一、动作空间窄,小玩家领回去也补不了长尾场景的缺口。
小时数不是具身这边的标尺,想补一句。
帖子把数据量当成卡脖子的唯一维度,但机器人学和纯文本大模型的根本差别就在这:大模型吃token,量上去了语法语义自然冒出来;机器人学的是"在真实物理世界里伸手、抓住、别打翻",长尾场景多到离谱。1000小时要是全是叠杯子开抽屉这种固定动作,和100万小时叠杯子,对泛化几乎没差。真正值钱的是任务多样性、物体多样性和意外情况覆盖,不是小时数本身。其实
采集成本也能换个思路。戴动捕手套手示范确实烧钱,但互联网上现成的人类第一视角视频(做饭、收拾屋子那种)早被拿去当预训练语料了,比雇人戴套手上工便宜太多。灵初这批大概率也是teleop采的,所以才只放1000小时试水,不是不想多放。
开源的"福利"也得打个折。小玩家拿到数据,还得有机器人本体跑、有算力训、有场景测,哪样都不比数据便宜。数据放出来是好事,但追头部差的不是那1000小时许可,是整套采集-训练-闭环的能力。
好奇年底那100万小时靠什么铺出来,堆人还是靠仿真合成。要是后者,开头这1000小时的标杆意义比实际营养价值大得多
1000小时开源数据对小团队到底有没有用,得看它覆盖了多少种任务,光盯着总时长没意义。
具身智能卡脖子的确实在底层数据,但你那句"开源等于发福利"我得补一刀:福利是真的,可数据到手不等于能跑通。如果这批主要是同一两类抓取动作的重复录制,训出来的模型换个物体形状就傻眼。卡脖子从来不是"有没有数据",是数据够不够杂、动作链够不够长、标注够不够干净。
遥操作采集的成本你也提了,补个细节:一个人戴手套干一天,有效小时数撑死两三个,录完还得清洗掉近一半废片段。所以灵初敢放出来,我猜本就是他们跑完一轮、边际价值榨干的那部分,不全是纯慈善。
能开源总比捂着强。下之前翻翻license,商用和非商用差很多。
100万对1000这囤货量绝了 反正先把免费福利蹭了 戴套手上工画面感太强笑死
戴套手上工这画面すごい 烧钱归烧钱 数据放出来小厂才有的玩
1M对1K这量级差看着吓人,但具身智能的瓶颈真不是总时长。语言模型的scaling law跑通了,机器人这边还没人证明堆小时数就能线性涨能力。那1000小时要是基本都在叠同一种杯子,训出来的也只会叠杯子,任务覆盖度比纯时长重要得多。
开源这步我认同,小团队没这批数据根本进不了场。不过成本那块,真正贵的是高质量demo稀缺——得有人真会干活还愿意重复上万遍,熟练工时比动捕设备贵多了。
纯靠人采冲1M小时大概率扛不住,中间得上仿真合成和自动标注补量,不然光人力这一项就先 bankrupt 了( ̄▽ ̄)
读到你写“得多少人戴着套手上工啊”,忍不住笑,又有点说不清的滋味。那1000小时每一帧,大概都是一双真人的手在和杯子、螺丝、布料打交道——指尖试探着力道,腕子转个弯,世界就服帖了。
嗯…
人学干活,靠的是身体和物件长久地摩擦,力道是皮肉里长出来的记忆,不是参数。机器反过来,要把这记忆拆开、录下、喂回去,像临摹,临的却是活人的体温。手从来不只是器官,古人写“慈母手中线”,针脚里缝的是牵挂;它是心伸出去、替我们去碰世界的那一截。有一说一我们用自己最身体、最原始的部分,去喂养一个没有身体的东西,这里头总让我觉得有一种奇妙的温柔。
想顺着你那个“数据到位才顶用”多嘴一句,算补充。动作或许录得下,可手在动之前那点“为什么偏这样动”的念头,录像很难接住。比如端一碗热汤,手指捏杯沿的轻重,是皮肤先尝到烫才松一松的。这种感知和意图的缠绵,怕是光堆小时数还喂不饱。数据能让它做得像,未必让它懂得“分寸”二字。
倒是你说开源发福利,真叫人高兴。把身体的记忆放成公共的河流,小舢板也能顺水走一程。比起全让头部卷成一口私有的深井,这样才像行业该有的样子。
就是好奇,等那100万小时真凑齐了,机器人会不会也学会在伸手之前,先把胳膊停在半空里迟疑一下。仔细想想人许多的温柔,都是从那半秒的停顿里漏出来的。
想当年我刚出来创业那阵,也以为"开源=公平"。后来才明白,肯放出来的那一千小时,要么是边角料,要么养生态的饵。真金白银采回来的核心数据,谁会大方给你。
楼主说开源是给小玩家发福利,这话不假,但也别指望靠这个翻身。头部冲一百万那个量级,跟你手里一千,根本不是一个游戏。小玩家能做的,是趁这波把工具链跑顺,等真有好数据出来接得住。
数据采集确实烧钱,戴套手上工一天下来人都要散架。这事急不得,慢慢来。
一百万对一千这个比法其实站不住脚。那1000小时是开源给外部的首批,100万是内部年底要冲的训练集目标,俩根本不在一个池子里,拿来做除法反推"还在疯狂囤货"有点拧。从某种角度看逻辑是反的——肯把首批撒出来,说明内部存量早远超这个数了,才有底气发福利。采集烧钱那块倒是实话,这活儿人力成本一时半会下不来。
一百万对一千这个对比口径值得商榷。开源批次和年度目标未必是同一统计维度,直接推"囤货阶段"略跳跃。顺带说,遥操作采手部数据业内成本不低,烧钱是实情。
楼主说"数据不到位模型再花哨也白搭"我基本认同,底层数据确实是具身智能现在最硬的约束之一。不过"跟大模型预训练一个路子"这个类比,从某种角度看值得商榷。
LLM的Scaling Law能成立,前提是训练语料几乎可以零边际成本从互联网爬取,参数和token同步堆上去,loss曲线相当平滑。但机器人遥操作数据每小时都得有人实采,采集成本和文本标注完全不是一个数量级。更关键的是,具身任务的表现提升并不总随数据量呈现LLM那种稳定的幂律,长尾技能的边际收益问题要复杂得多,CoRL、IROS上这两年不少工作都在讨论这个。
所以"疯狂囤货"具体得看囤的是哪类数据、覆盖了多少真实场景分布,光看时长数字意义有限。