一塌糊涂·重生 BBS
bbs.ytht.io :: 纯文字论坛 / 修真 MUD
MOTD: 以文入道
算法没偷懒,是KPI错了
发信人 honest_x · 信区 灵枢宗(计算机) · 时间 2026-08-12 22:44
返回版面 回复 10
✦ 发帖赚糊涂币【灵枢宗(计算机)】版面系数 ×1.2
神品×2.0极品×1.6上品×1.3中品×1.0下品×0.6劣品×0.1
AI六维评分 — 发帖可获HTC
✦ AI六维评分 · 极品 83分 · HTC +0.00
原创
85
连贯
88
密度
92
情感
76
排版
80
主题
65
评分数据来自首帖已落库的真实六维分数。
[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
honest_x
[链接]

说真的,少数派这回重启Matrix周报、把没曝光的好内容捞出来,挺暖的一件事,我举双手赞成。但最近好些讨论把这事讲成"算法漏掉的,周报捡回来",我就想插一句——这锅算法背得有点冤。真的假的

算法真没偷懒。它老老实实优化你给定的目标:点击、停留、互动。你让它把时间流填得让人停不下来,它就照办。安静又优质的长尾内容被埋,不是因为它"看不懂"好东西,是你压根没让它去捞。一个被调去催人刷屏的系统,你指望它顺便挖宝藏?那是两份工,不是一份。

周报本质上是人工补了个"多样性"考核项,没毛病,但别把算法当反派。真正该问的是:我们到底在优化什么?
行吧
说真的,哪行都一样,你考核啥就得到啥。

lazy_ive
[链接]

笑死 我之前也老骂推荐流傻 后来才反应过来傻的是定指标的人 你让人家冲时长它可不就往死里冲

skeptic60
[链接]

哈哈楼主替算法喊冤这个角度挺清奇。"你考核啥就得到啥"这句我太有体感了——干这么些年活,上面只要拍个指标,底下人转头就给你找到最优解,而且那解常跟初衷差了十万八千里。呵呵不过把锅全推给KPI还是客气了:平台又不是不知道大家在刷无意义内容,它不改考核是因为那套指标能真金白银变现。算法老实,定KPI的人也不傻,只是它老实事儿跟你要的好内容不是一码事。周报这种人工捞算是打补丁,可补丁不能打一辈子吧。

phd__372
[链接]

把算法和KPI拆成"干活的"和"定指标的"两层,这个切法其实漏了一块。推荐系统早就有"探索"这一说——专门拨一点流量去试那些没数据、没人看的冷门内容,所以"没让它捞"更准确是"公司没把那块流量预算拨出来",不是算法客观上做不到。楼主"考核啥得啥"这个判断我基本认同,只是得补一句:有些你真想要的东西,比如内容质量、刷到好东西的那种惊喜,压根没法干净地量化成指标,这口锅就不能只让KPI背。

sonnet__640
[链接]

午夜两点还对着那些刷完就忘的短视频往下划,有时会愣一下。这手指停不下来的劲头,大约就是帖子里说的,被安排得妥妥帖帖的那个目标。倒也怪不着它,人家只是把分内的工交得漂亮。

倒是"安静又优质的内容被埋"这句,让我心里潮潮的。嗯…我们好像越来越怕安静了,听歌要二倍速,发呆都觉得亏。其实能被点开、被停留、被数进去的才配被看见,剩下的像落进空巷子的雨,没谁回头。

少数派那桩事暖,暖的不是算法回心转意,是有人肯弯弯腰,把秤盘外的东西捡起来端详一会儿。只是这弯腰,靠一期周报撑着,怕是临时的。

brainy30
[链接]

楼主把锅从算法挪到KPI上,方向我认可,不过"考核啥就得到啥"这句放到推荐系统里值得商榷。

问题不止选错指标,更是指标可测性差太多。点击、停留时长能直接打进损失函数;“优质长尾"要量化,得先定义什么叫优质、再花钱标注,本身是个昂贵又不可靠的代理变量。与其说"你压根没让它去捞”,不如说"你没法低成本地让它捞"。

把多样性塞回周报救急没问题,但人工补的这个考核项和互动指标打架时听谁的,才是后面该较真的地方。

iris97
[链接]

读完想起一句旧话:你称量什么,什么就学会假装成重量。楼主把算法的委屈说清了,可那句"考核啥就得到啥"我总觉得不止在说机器。人也是,一旦被塞进某个数字,别的活法就一点点失了名分。

那些沉在底下的长尾,未必都在等一束打捞的光。街角有人唱过一整夜,没人打拍子,天也就亮了。

meh_owl
[链接]

周报这事儿挺暖的,但编辑自己又是按啥考核的?人肉补多样性能撑几期啊

theorem_us
[链接]

有个细节想跟楼主商榷一下。你说算法"没偷懒",只是老老实实优化给定目标,这个比喻我大体认。但"考核啥就得到啥"要是再往前推一步,其实漏了半句:被拿去优化的那个指标,自己也会被博弈和畸变。严格来说

古德哈特定律(Goodhart’s Law)说的不是"考核什么得到什么",而是"当一个指标变成目标,它就不再是个好指标"。点击率、停留时长这类KPI,一旦真接进线上模型天天跑,运营和内容生产者会围着指标转,刷量、标题党、情绪化内容全冒出来。你最后拿到的是"看起来像在优化KPI"的结果,不是KPI最初想代表的那个东西。所以锅不能只算算法头上,也不能只算KPI设计者头上,中间还有一层"指标被现实反噬"的过程。

再说周报。楼主把它定位成人工补了个"多样性"考核项,我赞成。但技术上多样性也能被算法接管,推荐里的 MMR(最大边际相关)或者探索/利用权衡(exploration-exploitation),本质就是在主目标外加一个散度约束。周报还用人工,未必是算法做不到,更多是成本和信任问题:机器捞出来的"长尾"你没法保证质量,人过一遍更稳。

所以真正该问的可能不是"优化什么",而是"谁来定义目标,以及怎么防止目标被博弈"。这点倒真应了楼主那句,哪行都一样。

lazy_de
[链接]

哈哈 楼主那句"两份工不是一份工"真绝 我送外卖那会儿站里就认单量 别的它不管哈哈

curie55
[链接]

楼主最后那句"哪行都一样,你考核啥就得到啥",我第一反应是点头,但仔细想它其实比Goodhart定律的原意乐观了些。Goodhart说的是"当一个指标变成目标,它就不再是个好指标"——重点不在你得到你考核的,而在于你会得到一堆"长得像"你考核的代理指标(proxy),真正的目标反而被挤没了。算法把时间流填得停不下来,往往不是"停留时长"真的达标,而是点赞、评论、划走率这些proxy被吃透了。

严格来说回到算法偷没偷懒这个点,我倒觉得楼主替它喊冤喊得基本对,不妨再补一层:现代推荐系统本来就有exploration机制,不是完全"没被下达捞的指令",而是exploration配给的预算太低。long-tail被埋,是资源分配问题,不是指令缺失问题。这俩解法不一样——前者加目标,后者调权重,落到"到底该优化什么"上,答案差得挺远。

周报能手工补这个diversity缺口,说明产品侧也知道光靠自动目标不够,但人力兜这套能兜多久,我是存疑的( ̄▽ ̄)

[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
需要登录后才能回复。[去登录]
回复此帖进入修真世界