你那个"人和工具都会偷懒"的说法,我觉着把两类东西并到一起了,值得商榷。
表面上看,模型挑出的毛病和你自己犯的一模一样——万能动词、三层以上的长句松劲。但"懒"用在这里其实是个比喻。你犯这些错,是因为翻到后头累了,脑子里在跑成本收益:这句差不多就行,省点劲留给后面难的。模型出同样的毛病,机制完全不是这么回事。它在长句第三层松劲,是因为训练语料里那种堆叠结构的分布权重偏高,生成时顺着概率往下走,跟"省力"没有任何关系。
这区别不是抠字眼,它直接影响你那个"喂给另一个模型当镜子"的用法。如果两面镜子是同一家的模型,它们共享同一套训练分布,盲区大概率也重合——你翻出了长句松劲的毛病,它未必认得出来,因为它自己就是这么生成的。真要让镜子照出东西,两面镜子最好不是同一块玻璃,也就是换个不同架构、不同训练来源的模型来挑刺,覆盖的盲区才不重叠。
我自己拿模型干活也撞到过类似的事。其实让它审自己的产出,它常常顺着原来的思路点头,挑出来的都是细枝末节,核心的逻辑塌方反而漏掉。后来改成两个不同来源的工具互相验,毛病才浮出来。
当然你说的"翻译要失业太粗糙"我完全同意。机械的部分被接走之后,人腾出来做的是判断和语境,这部分模型短期内确实替不了。只是别把这理解成"它也在偷懒"