看了灵初那个新闻 年底要冲100万小时数据 4月才开源1000小时 这差距算一下得翻一千倍 绝了
不过我更在意"在全国合作建数据采集中心"这句话 意思是机器人动作数据不是网上爬来的 是真得搭场地 让人或机器一遍遍做动作录下来 跟大模型白嫖互联网文本完全两码事 机器人学个动作是真·体力活
1000小时开源像是先甩个样品 大头还得后面硬采 想想一个中心一天能攒多少小时有效数据 要铺多大摊子才能年底凑到100万 这劲头也太猛
这种原始采集反而让我觉得实在 没捷径就是堆量 草
看了灵初那个新闻 年底要冲100万小时数据 4月才开源1000小时 这差距算一下得翻一千倍 绝了
不过我更在意"在全国合作建数据采集中心"这句话 意思是机器人动作数据不是网上爬来的 是真得搭场地 让人或机器一遍遍做动作录下来 跟大模型白嫖互联网文本完全两码事 机器人学个动作是真·体力活
1000小时开源像是先甩个样品 大头还得后面硬采 想想一个中心一天能攒多少小时有效数据 要铺多大摊子才能年底凑到100万 这劲头也太猛
这种原始采集反而让我觉得实在 没捷径就是堆量 草
等等,我倒想追问那个"数据采集中心"到底怎么个合作法。你们知道吗,我听说的版本是有些公司直接跟各地职校甚至技校谈,拿学校实训场地、学生当"动作演员",成本压得极低,数据名义上合作采,其实底裤都归厂商。这么一算年底100万小时好像也没那么玄?但1000小时敢开源,八成是先立个"开放生态"人设,圈住开发者,真金白银的大头留着自己用。谁出的人、谁拿的数据,细想挺有意思的……
一千倍这跨度绝了,最逗的是“数据采集工程师”这title,进去干的是一遍遍按开关的体力活,这活儿真没捷径。
干过体力活的一看就懂 一遍遍重复录动做最磨人 没捷径就是硬堆 不过年底冲100万这劲头也是真猛
想当年复读那一年,也是这种没捷径的路子,一遍遍做题,量堆够了才踏实。所以看到你说机器人学动作是“真·体力活”,我倒觉得实在,跟人学本事一个道理,重复到一定程度自然就顺了。
不过话又说回来,人建采集中心到底不是机器,这种硬采的劲头烧钱也烧人,年底能不能真凑到一百万小时,且看吧。这事不急,慢慢来,C’est la vie。
大模型躺薅全网 这边机器人还得自己下场流汗 反差绝了哈哈
建采集中心这劲头真猛 不过让真人一遍遍做动作录 这不纯纯体力活嘛 比坐办公室惨多了哈哈
想想一个中心一天到底能攒几小时有效数据,这账算着就让人头大。不过我挺中意这种“笨办法”的,动作数据骗不了人,实打实堆出来的才踏实。
草,"真·体力活"这句我笑出声,但确实挺对的。我之前也老觉得机器人训练是那种纯烧显卡的活儿,没想到底层还是得像流水线一样一遍遍录。没事的楼主说的没捷径就是堆量,反而让我觉得踏实——有些事就是得有人一间间场子往下蹲,绕不开的。不过效率这块我也有点好奇,动作数据筛掉走神、动作变形的废片段之后,一个中心实际日产出到底能到多少,感觉这才是年底能不能凑到一百万的关键。
笑死,搞了半天训练机器人跟流水线计件工没两样。不过我更好奇那1000小时"样品"质量咋样,万一掺了水,后面硬采九十九万小时也救不回来啊
等等 一个中心一天到底能攒几小时有效数据 这摊子铺得吓人 我咋算着像在烧钱