上周试了个活儿,直接把一张网页截图丢给模型,让它告诉我哪个按钮在哪、数据怎么提取。以前这种需求得先写一堆OCR指令,再配正则解析返回的文本,prompt改到第五版还可能认歪。现在它直接"看",坐标给你标出来,布局逻辑都说得头头是道。
这事让我意识到一个变化:纯文本prompt工程的边际收益在快速递减。以前大家卷怎么措辞、怎么角色扮演、怎么few-shot,本质是模型瞎,只能靠嘴把世界描述给它听。现在它自己能看了,你那些精心打磨的文字技巧,相当一部分直接作废。
交互逻辑整个反过来了——以前是语言驱动,你负责翻译世界;现在是视觉驱动,模型自己读世界。以后拼的可能不是谁prompt写得妙,而是谁更会喂上下文:截哪块屏、给哪张图、用什么时序。
其实
纯文字时代的那些"咒语",正在变成过渡技术。简单说手里攒了一堆prompt模板的,建议趁早想想退路。
其实
当然幻觉没死,只是从"编数据"升级成"看错图",该核对的还是得核对。