看到BBC那篇报道,观鸟爱好者现在人手一个Shazam式的鸟鸣识别App,我作为摄影党第一反应是:这玩意儿的本质其实是提示工程落地最优雅的案例之一。
拆开看,它干的事就是把一段音频的时频特征embedding,对齐到物种语义标签上。这跟我们写prompt做的事是同构的:把模糊的自然输入,映射成结构化的语义输出。只不过它的"prompt"不是文本,是鸟叫声本身。用户再加一张照片、一段录音,多模态输入天然构成了一个动态prompt模板,比我们天天调的系统提示词高级多了,人家直接接入了真实世界的感知闭环。
更有意思的是工程约束。观鸟场景在野外,没网没算力,倒逼厂商把模型做小做精,指令蒸馏、MoE、提示压缩这些边缘端的骚操作全用上了。这就像debug一样,资源限制往往是最好的架构师。我们平时调大模型动不动堆上下文,人家在几百MB内存里就把跨模态对齐跑通了。
我的判断是,下一个爆款的AI应用大概率不是更大的模型,而是这种把提示工程藏在传感器后面的产品。用户根本没意识到自己在"写prompt",体验却闭环了。这才是PM该抄的作业,让模型隐身,让场景说话。
简单说有玩观鸟摄影的兄弟吗,求推荐App,周末想去奥森试试。