说真的,灵初智能这事儿比表面看着有意思。王启斌说年底要攒到一百万小时数据,还在全国铺采集中心。前阵子论坛还在聊"喂机器人的数据先验货",那是关心质量,但我觉得更该盯的是产能。
emmm
文本能上网爬,机器人数据不行,得靠真机遥操作一小时一小时地攒。这种活儿天生反规模,几台机器人在实验室里堆不出量来。文本时代靠堆量就能涨点,机器人时代是先卡在没有量。所以那百万小时的含金量,不在算法多花哨,而在背后那条流水线:把采集标准化、站点铺开、成本压下来,本质是把数据当工业品来造。
开源那1000小时也别只当慈善,明摆着是抢生态位,先拉开发者进来,再用规模反哺模型。具身智能这局的入场券,可能真捏在谁先把数据跑成工厂的人手里。离谱的是,大家还在卷参数,门口已经有人盖厂房了。