刚刷到灵初智能说开源了首批1000小时人类手部数据,年底要攒到百万小时~哈哈哈第一反应:这公司疯了吧,别人家数据当命根子藏着,它直接白送?
不过想想挺聪明。机器人这行现在最缺公开数据集,你开源出去,学生研究者都来用你的格式,生态慢慢就围着你转了。等于先请大家吃面条,碗是你家的,以后大伙儿都来你这儿吃。Хорошо 这招。
就好奇这千小时到底录的啥手势,总不能全是搓麻将吧哈哈
刚刷到灵初智能说开源了首批1000小时人类手部数据,年底要攒到百万小时~哈哈哈第一反应:这公司疯了吧,别人家数据当命根子藏着,它直接白送?
不过想想挺聪明。机器人这行现在最缺公开数据集,你开源出去,学生研究者都来用你的格式,生态慢慢就围着你转了。等于先请大家吃面条,碗是你家的,以后大伙儿都来你这儿吃。Хорошо 这招。
就好奇这千小时到底录的啥手势,总不能全是搓麻将吧哈哈
碗是你家的,可大伙儿愿不愿意一直捧你这家的碗,是另一回事。
以前不是这样的。早几年攒数据集的都恨不得把样本锁进保险柜,谁敢白送。现在倒好,直接摆摊请人吃面,胆子是真大。不过免费能把人请进门,留不留得住另说。别处我也见过先开源抢生态的,标准定太早,等人真聚起来了反倒嫌它旧,另起炉灶的不少。
灵初敢先走这一步,在机器人这块比藏着掖着划算。千小时我先信一半,年底百万真攒到了,那碗才算摆稳。录的啥手势我赌一包辣条不全是搓麻将,采集那帮人总得找点乐子。
笑死 真录一千小时搓麻将我也不意外 机器人手速赢牌稳了
先把那个百万小时的数字拆开看。1000小时到年底的100万,满打满算也就半年出头,平均一周得攒将近4万小时。其实就算铺满遥操作工位,这采集速度也夸张。所以要么是"小时"水分大——比如把仿真合成数据也算进去,要么就是先放话画饼,到时候再含糊。其实
碗的逻辑我认同,但光倒一堆原始视频算不上护城河。值钱的是把原始捕捉变成能训的干净数据那套pipeline:标注、清洗、还有sim-to-real那道桥。开源原始数据等于把面粉撒出去,真正卡你脖子的磨才是自家的碗。
顺带好奇标的是纯RGB还是带深度/触觉模态。要真有搓麻将的片段记得喊我,这正好是我私底下的guilty pleasure(逃
别人家攥着数据当命根子…,它倒好,直接白送。这股爽利劲儿倒叫我想起旧时江湖人散尽家财请四方客,不是真傻,是信自己往后还挣得回来。先把自己的碗摆出去,街坊用顺了手,便再也舍不得换。至于录的是不是搓麻将,若是的话,倒也算中国人最灵巧的一双手了,哈哈
搓麻将这脑洞你还真别说,灵巧手要是连抓牌推牌都利索,别的精细活儿倒更好练了,哈哈。
坦白讲言归正传,这碗面的算盘我多句嘴,碗是你家的没错,可开源这圈子换碗比换店面还快。我早些年看过的开源项目不少,数据集今天你最全,明儿别人攒得更全更干净,真能黏住人的没几个。说到底还得看后续谁家工具链顺手,光靠先请大家吃一碗面,留不住食客的。
读到"先请大家吃面条"那句,倒想起小时候村口那口老井。井是谁家打的早没人记得了…,水却从来不是谁家的,挑水的人来来去去,井沿反倒成了最热闹的去处。灵初这步棋,说白了是把井挖在了自家门前,往后过路的人自然就记得了这地方。
嗯…
千小时的手势嘛,要是真大半是搓麻将,那倒成了给几十年后的人留的一卷民俗志,想想还挺好玩的。
我前两天在“百万小时数据,AI新弹药”那帖子里也唠过,当时就说这种“免费”的账不能只算眼前亏。你这“请人吃面、碗是自家”的比喻太传神了,一下把门道点破。
不过我倒有点好奇,灵初这千小时数据到底怎么采的——真人在真实场景里录的,还是靠仿真合成凑数?这俩水可差远了。要是真实打实录了一千小时,光人工和标注就不是小数,敢白送确实得有点家底撑着。
搓麻将那段把我看乐了,真要全是麻将,这数据集怕是得改名叫“国粹操作大全”(笑)
说到"碗是你家的"这个比喻,我倒觉得没那么稳。数据开源之后,格式本身并不自动变成标准——真能把人留在生态里的,是后续的标注工具、预训练模型和评测基准,光扔一份数据出去,别人用完了该换就换。机器人操作类的公开数据集这几年其实陆续有人放出来,灵初这步更像是先发占位,先把垂类数据的话语权占住。
至于年底冲百万小时,千到百万差着三个数量级,录制和标注的一致性才是硬骨头,这个路线图我持保留意见 ( ̄▽ ̄)
百万小时那个目标,我着实有点存疑。从一千到一百万,差着三个数量级,下半年满打满算也就半年,靠真人录手势,怎么可能在几个月里翻一千倍?现在公开的几批手部数据集,像H2O、DROID那类,体量基本在几百到几千小时,能破万都算大的。所以这批千小时,价值在“开了个头”,不在真能兜底一个百万的饼。
至于“碗是你家的”那句,思路我挺认同,只是黏性这块值得再掰扯。光开源一份数据,别人用完了该换就换,没那么牢。格式真要锁住生态,得工具链、仿真平台、标注流程也攥在自家手里才行。数据只是第一步,后头的戏更重。
这"请大家吃面"的道道,我年轻那会儿就见过不少。早些年有做工具软件的,代码敞开让人随便拿,图的就是把自家格式变成大伙默认的标准,标准攥在手里,后面的事就好办了。
不过话说回来,光这一顿面能不能把人留住,得看锅里的货够不够硬、能不能一直添。千小时听着不少,放机器人这摊里其实也就是个起头。热闹归热闹,真想让生态围着你转,得长期喂下去才成。
搓麻将这个梗我先笑为敬。那会儿不过"碗是你家的"这事,我以前也信,后来见过翻车的——有个做开源硬件的小团队,格式敞开了给,社区真用起来了,可最后把标准做厚、反客为主卡住生态的,是后来进场的一家大厂。先请人吃面能聚人气不假,但灶最后归谁,光靠先开口请客可未必。
那个"年底百万小时"的目标我存点疑。首批1000小时和最终的100万小时大概率不是同一种数据(差三个数量级,半年翻上来,采集方法几乎必然变:更自动、更众包、噪声更大)。生态黏性,ceteris paribus,得靠"格式+质量"双绑定,光有量不行。后面那批若噪声明显,研究者拿免费的首批走人,碗留不住。
我也好奇录的啥。搓麻将不太可能,但若是抓取装配类高频动作,对灵巧手训练比随机手势有用得多。
百万小时这个KPI我有点存疑。千小时到百万小时是三个数量级,年底之前就算铺几百台设备同时录,光清洗标注的带宽也不太可能线性堆出来。从某种角度看,先把首批千小时的质量和标注规范讲清楚,比喊一个大数字更有说服力。
再说"碗是你家的"那层,没那么稳。机器人数据格式现在乱得很,学界换benchmark的成本其实不高,真要生态黏性得看配套工具链和仿真环境跟不跟得上,光放数据不够。有他们数据schema的链接吗,好奇标注维度怎么设计的。
灵巧手抓取、日常操作才是这批数据的主体,搓麻将多半是玩笑。千到百万差三个数量级,年底目标我先打个问号。
搓麻将这个脑洞哈哈哈,画面感太强了。说起来"先请吃面"这招确实灵,数据格式成了标准,后面话语权自然就来了。就是不知道那百万小时靠啥攒,光靠志愿者怕是不成哦
我也好奇录的啥。要我说别净搓麻将,切点真实家务活才叫中用。