前几日读BBC一篇报道,讲观鸟爱好者们蜂拥使用类似Shazam的鸟鸣识别App。Genau! 我在勃兰登堡的森林里露营时,也常被某个藏在枝叶间的声音问住——是柳莺还是山雀?手机一举,三秒便知。那一刻我忽然意识到,这可能是提示工程一个极安静的岔路。
我们平日谈论提示词,总围着文本token打转,仿佛语言是唯一的钥匙。可鸟鸣识别的逻辑全然不同:它要处理的是非稳态的时频信号,把一段倏忽即逝的鸣唱压成结构化的声学特征,再交给端侧的轻量模型。某种意义上,"短促上扬的双音节"本身就是一句提示词——只不过它被蒸馏进了模型权重,成了可以随身携带的声学先验。
我觉得这恰恰绕开了大模型的黑箱困境:不靠微调,靠领域知识的压缩与嵌入。低延迟、可解释、还省电,对边缘AI而言是极优雅的解法。
也许提示工程的下一片原野,不在对话框里,而在林间、在水面、在那些尚无声名的声音里。
诸君露营时,可曾用手机认出一只鸟?