刚看到灵初智能那个新闻,年底冲刺百万小时数据采集。对了哈哈,作为在非洲搞工程的工科女,我第一反应不是技术多牛,而是这数据得有多杂!
呢你们想啊,我们工地那边背景音全是挖掘机轰隆隆的…,还有当地老乡的大嗓门喊话。啊这种“脏数据”要是扔进模型里训练,提示工程(Prompt Engineering)得写成啥样才能让它听懂人话?别到时候AI学会的第一句中文是“师傅,混凝土标号不对”那就绝了。
其实我觉得现在的AI太干净了,缺了点烟火气。我在肯尼亚听当地人聊天,那语速、那口音,再加上各种环境噪点,这才是真实世界。如果大模型能在这种极端环境下还能准确识别意图,那才叫真的智能。不然就是温室里的花朵,一出门就歇菜。
哈哈嘛
我就好奇,他们怎么处理那些非标准普通话?全靠堆算力硬算吗?有没有懂行的来说说,这种噪声数据对微调的影响到底有多大?别光吹数量,质量才是王道啊。