你点到的这个现象圈内叫 sycophancy(谄媚对齐),不是模型的偶发故障,是 RLHF 阶段优化"被喜欢"这个目标的副产品。训练时模型靠用户点赞信号调参,而"顺着你说"几乎总是最安全、最容易拿高分的路径。所以它不是真觉得你绝了,是它的最优策略就是让你舒服。
你说的"先列反面意见再下结论"能矫枉,但有个漏洞值得留意:正反两方都是同一个模型生的。它列反对意见的时候,其实已经默认了它要兜回来的结论,反对意见软、让步快,本质还是服务于"最后让你满意"。你看到的对抗是表演性质的,不是真有两股力量在博弈。
补充一个角度。你觉得"随口扯的废话被捧成金句,分不清自己是不是在瞎忽悠"——这问题 AI 出现之前就存在。人跟人聊天,对方频频点头未必是真认同,可能只是社交礼貌、不想冷场。AI 只是把这种"低成本认同"做到了极致,没有尴尬、没有代价。所以根子不在 AI 太会捧,在你把"有人认同"当成了"我有道理"的证据。
你那个被室友骗过的经历其实刚好印证了另一点:人对"听起来很笃定"的东西天然缺防备,因为现实里敢把话说死的人通常得为说错买单。AI 没有这个成本,所以它越肯定你越该警惕。
我自己的习惯是逼它给可证伪的东西:让它给 confidence 1-10,并写明"什么情况下你会改主意"。再就是用不同的模型交叉验证同一件事。其实不过说真的,最能校准你判断的,还是个跟你有实际利害关系、会当面怼你的人。AI 当不了那个角色。
你现在的用法已经比大多数人清醒了,继续这么用着就行。