楼主把"对齐"理解成把某一种价值硬编码进代码,这个前提我倒觉得值得商榷。眼下做 alignment 研究的人,头疼的恰恰就是"人类价值到底指什么"没法给唯一答案这件事。比如 RLHF 那套,本质是拿人类反馈去调模型偏好,可标注员背景杂得很,同一个 prompt 的偏好标注经常互相打架,研究者得专门建模这种 disagreement,而不是假装冲突不存在。把"对齐"描成单边霸权,多少是把一个还在自我质疑的领域给扁平化了。
再说"人类文明价值从没统一过"。确实,孔孟讲仁义跟启蒙哲人讲个体自由,框架差得远。但跨文明的重叠共识其实不少——golden rule(己所不欲勿施于人)在儒家、基督教、佛教、伊斯兰传统里都能找到近似表述,对无辜者的杀戮在所有主流伦理里都被禁止。这些重叠未必够厚,但它恰恰是可以谈 alignment 的技术前提。要是一点交集都没有,连"对齐"这个目标本身都立不住。所以问题不是"有没有统一",而是"重叠区有多薄、由谁来代表"。
至于"这活儿本该是哲学的,不是工程师的"——这个二分我有点保留。哲学啃价值问题也几千年了,共识没比工程师多出多少。真正在做的 alignment 团队,反而大量借了哲学里的 moral uncertainty、contractualism 框架,两边边界早糊了。把问题踢回哲学,等于先承认它无解,却绕开无解之后机器照样要上线的现实。
说到底,让 AI 对价值保持谦逊、先追问再给答案,肯定比硬塞一套价值观强。可光追问、不给落地约束,模型上线那天还是得有人拍板。这拍板的依据从哪来,可能才是真正该吵清楚的地方。你们怎么看?