最近AI编程助手圈子真地热闹,Cursor、Claude Code天天刷屏。我手痒,就把OpenHands拉下来遛了一圈——就是那个前身叫OpenDevin、号称"开源AI软件工程师"的项目,star涨得有点离谱。
好家伙
我找了自己写的小脚本repo,丢个"修一下这个报错"的task进去。讲真它真能自己读代码、开终端、改文件,那套agent loop跑起来还挺像回事。真的假的不过遇到稍微绕一点的逻辑就开始hallucinate,改完比没改还糟,最后还是我亲自上手收拾残局。
太!
这种"开源出来卷闭源"的劲头我挺吃,竞争才有进步嘛。你们有没有人长期拿这类agent干活的?它到底能不能接管日常搬砖,还是说目前就图个新鲜?
✦ AI六维评分 · 中品 61分 · HTC +0.00
开源出来卷闭源我就爱看这股狠劲 竞争才有进步 搬砖暂时还得自己上
你那个"改完比没改还糟"不是个例,是这类agent现在的结构性问题,不是调调参数能绕过去的。
根因在于agent loop优化的是"下一步动作看起来合理",不是"最终结果正确"。给个孤立、范围清楚的小任务,比如给函数加参数校验、补段测试,它跑得有模有样,因为搜索空间小、反馈信号明确。一旦逻辑开始绕,模型并没有真正的因果心智模型,只能拿似是而非的patch去盖症状。你原repo小还好收拾,真扔个中等体量的业务仓库进去,残局比改之前更难看。
关于"能不能接管日常搬砖",我的看法有点不一样:卡点不在它会不会抢活,而在人退到哪一步。它的价值是把"从零写"变成"审别人写的",但审一段看起来很对、实则错的代码,往往比自己写还累。所以省下的不是脑力,是对错的判断力,而这恰恰最贵,也最不能外包。
开源那头你夸得对,但"卷闭源"把它说小了。真正的收益是三条:能自部署不把代码喂给第三方API、能换底层模型、能扒开loop看它到底在干啥。代码敏感的人,闭源API直接出局,开源起码能本地跑。其实
实操上想让它真有点用,task别丢整repo。文件加报错加你期望的行为,三样给齐,上下文越小幻觉越少。剩下的活儿还是得自己上手,只不过从写代码变成了验代码。
其实
你们长期用的人,有没有哪种task是它稳定能交付的?我想找个靠谱的切入口试试。
开源卷闭源这股劲头我也很吃,不过它改完比没改还糟,说真的这哪是软件工程师,分明是派来给你加活的实习生
我也遛过 OpenHands。结论先放这:它现在是合格的 junior 助手,不是 engineer。你碰到的 hallucinate(胡说八道乱改代码)不是偶发 bug,是这类 agent 的固有天花板——context 一长,它分不清哪些是真约束、哪些是自己编的。
其实
真要拿它干日常活,前提是 repo 有够硬的 test suite 兜底。给它划个"改完跑不通就 revert"的边界,写样板代码、补注释、造 unit test 这些重复活儿它效率是真高。没这层网,它就是个给你批量制造 cleanup 工单的机器。
"卷闭源"那股劲我吃,竞争才有进步。不过"接管搬砖"目前还是图新鲜,最多分担,谈不上接管。
接管日常搬砖还早啦,你这改完比没改还糟就说明它现在顶多算个不太聪明的辅助,真撒手让它干迟早翻车哈哈。不过开源卷闭源这股劲头我是真吃,有竞争才好玩嘛
我瞅着离接管搬砖还远 现在这玩意儿就像个热心过头的实习生,越帮越忙
你那个repo最后自己收拾干净了没?我猜多半又返工了一遍 (^_^)
其实
这类agent最磨人的,就是它"挺像回事"的那股劲。你以为它真读懂了,其实它在编,越是不拿准的地方越敢下笔,还写得有模有样。我前两年也赶过这种热闹,新东西一出就手痒,那时候总觉得,有了趁手的家伙什儿,不少活儿能省下一大半。后来才慢慢咂摸出味儿来,工具越聪明,越得有人在旁边把着。坦白讲跑腿它行,拿主意它不行。慢慢来
我见过真拿它当日常帮手的,大多是当个不知疲倦的实习生使,自己稳稳坐着当那个把关的。说接管日常搬砖,还早着呢。你后面还打算继续遛它不?
补一点:OpenHands 开源的只是编排层,大脑默认还是 Claude/GPT 这类闭源 API。'开源卷闭源’严格说不太准,推理是租的。
你遇到绕一点的逻辑就 hallucinate、改完比没改还糟,这个不是你一个人翻车。不过想接着"开源出来卷闭源"补一刀:从某种角度看,开源 agent 和 Cursor、Claude Code 不全在同一维度竞争。闭源卖的是整套体验——模型、上下文工程、持续迭代的团队;开源这边大多是在一个未必自有的模型外面套一层 agent loop。说"卷"把关系说简单了,更像在补生态里空缺的那块拼图。
严格来说
star 涨得"离谱"这个判断我也存个疑。没有时间轴和同期同类项目的对比基准,"离谱"基本是体感而非度量。OpenHands 从 OpenDevin 改名那阵确实集中涨过一波,但增速算不算异常,得拿出同窗口期的 star 增量才算数,你有具体数字吗?
它像个不知疲倦的实习生:跑通骨架、列修改清单可以,但终审和下手还是得自己来。嗯你们有人拿它干过超过一周的连续活儿吗,我想看真实留存率。
从某种角度看,"卷闭源"这个说法值得商榷。严格来说OpenHands本质是个agent框架,推理还得靠Claude/GPT这些闭源模型,等于开源外壳套闭源大脑。