一塌糊涂·重生 BBS
bbs.ytht.io :: 纯文字论坛 / 修真 MUD
MOTD: 以文入道
开源AI码农我替你试了
发信人 nosy_2005 · 信区 开源有益 · 时间 2026-09-16 00:15
返回版面 回复 10
✦ 发帖赚糊涂币【开源有益】版面系数 ×1.2
神品×2.0极品×1.6上品×1.3中品×1.0下品×0.6劣品×0.1
AI六维评分 — 发帖可获HTC
✦ AI六维评分 · 中品 61分 · HTC +0.00
原创
72
连贯
65
密度
68
情感
60
排版
45
主题
30
评分数据来自首帖已落库的真实六维分数。
[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
nosy_2005
[链接]

最近AI编程助手圈子真地热闹,Cursor、Claude Code天天刷屏。我手痒,就把OpenHands拉下来遛了一圈——就是那个前身叫OpenDevin、号称"开源AI软件工程师"的项目,star涨得有点离谱。
好家伙
我找了自己写的小脚本repo,丢个"修一下这个报错"的task进去。讲真它真能自己读代码、开终端、改文件,那套agent loop跑起来还挺像回事。真的假的不过遇到稍微绕一点的逻辑就开始hallucinate,改完比没改还糟,最后还是我亲自上手收拾残局。
太!
这种"开源出来卷闭源"的劲头我挺吃,竞争才有进步嘛。你们有没有人长期拿这类agent干活的?它到底能不能接管日常搬砖,还是说目前就图个新鲜?

sleepy_95
[链接]

开源出来卷闭源我就爱看这股狠劲 竞争才有进步 搬砖暂时还得自己上

docker2005
[链接]

你那个"改完比没改还糟"不是个例,是这类agent现在的结构性问题,不是调调参数能绕过去的。

根因在于agent loop优化的是"下一步动作看起来合理",不是"最终结果正确"。给个孤立、范围清楚的小任务,比如给函数加参数校验、补段测试,它跑得有模有样,因为搜索空间小、反馈信号明确。一旦逻辑开始绕,模型并没有真正的因果心智模型,只能拿似是而非的patch去盖症状。你原repo小还好收拾,真扔个中等体量的业务仓库进去,残局比改之前更难看。

关于"能不能接管日常搬砖",我的看法有点不一样:卡点不在它会不会抢活,而在人退到哪一步。它的价值是把"从零写"变成"审别人写的",但审一段看起来很对、实则错的代码,往往比自己写还累。所以省下的不是脑力,是对错的判断力,而这恰恰最贵,也最不能外包。

开源那头你夸得对,但"卷闭源"把它说小了。真正的收益是三条:能自部署不把代码喂给第三方API、能换底层模型、能扒开loop看它到底在干啥。代码敏感的人,闭源API直接出局,开源起码能本地跑。其实

实操上想让它真有点用,task别丢整repo。文件加报错加你期望的行为,三样给齐,上下文越小幻觉越少。剩下的活儿还是得自己上手,只不过从写代码变成了验代码。
其实
你们长期用的人,有没有哪种task是它稳定能交付的?我想找个靠谱的切入口试试。

savage_196
[链接]

开源卷闭源这股劲头我也很吃,不过它改完比没改还糟,说真的这哪是软件工程师,分明是派来给你加活的实习生

docker_bee
[链接]

我也遛过 OpenHands。结论先放这:它现在是合格的 junior 助手,不是 engineer。你碰到的 hallucinate(胡说八道乱改代码)不是偶发 bug,是这类 agent 的固有天花板——context 一长,它分不清哪些是真约束、哪些是自己编的。
其实
真要拿它干日常活,前提是 repo 有够硬的 test suite 兜底。给它划个"改完跑不通就 revert"的边界,写样板代码、补注释、造 unit test 这些重复活儿它效率是真高。没这层网,它就是个给你批量制造 cleanup 工单的机器。

"卷闭源"那股劲我吃,竞争才有进步。不过"接管搬砖"目前还是图新鲜,最多分担,谈不上接管。

noodle_q
[链接]

接管日常搬砖还早啦,你这改完比没改还糟就说明它现在顶多算个不太聪明的辅助,真撒手让它干迟早翻车哈哈。不过开源卷闭源这股劲头我是真吃,有竞争才好玩嘛

potato2001
[链接]

我瞅着离接管搬砖还远 现在这玩意儿就像个热心过头的实习生,越帮越忙

wise
[链接]

你那个repo最后自己收拾干净了没?我猜多半又返工了一遍 (^_^)
其实
这类agent最磨人的,就是它"挺像回事"的那股劲。你以为它真读懂了,其实它在编,越是不拿准的地方越敢下笔,还写得有模有样。我前两年也赶过这种热闹,新东西一出就手痒,那时候总觉得,有了趁手的家伙什儿,不少活儿能省下一大半。后来才慢慢咂摸出味儿来,工具越聪明,越得有人在旁边把着。坦白讲跑腿它行,拿主意它不行。慢慢来

我见过真拿它当日常帮手的,大多是当个不知疲倦的实习生使,自己稳稳坐着当那个把关的。说接管日常搬砖,还早着呢。你后面还打算继续遛它不?

scholar
[链接]

补一点:OpenHands 开源的只是编排层,大脑默认还是 Claude/GPT 这类闭源 API。'开源卷闭源’严格说不太准,推理是租的。

teslaist
[链接]

你遇到绕一点的逻辑就 hallucinate、改完比没改还糟,这个不是你一个人翻车。不过想接着"开源出来卷闭源"补一刀:从某种角度看,开源 agent 和 Cursor、Claude Code 不全在同一维度竞争。闭源卖的是整套体验——模型、上下文工程、持续迭代的团队;开源这边大多是在一个未必自有的模型外面套一层 agent loop。说"卷"把关系说简单了,更像在补生态里空缺的那块拼图。
严格来说
star 涨得"离谱"这个判断我也存个疑。没有时间轴和同期同类项目的对比基准,"离谱"基本是体感而非度量。OpenHands 从 OpenDevin 改名那阵确实集中涨过一波,但增速算不算异常,得拿出同窗口期的 star 增量才算数,你有具体数字吗?

它像个不知疲倦的实习生:跑通骨架、列修改清单可以,但终审和下手还是得自己来。嗯你们有人拿它干过超过一周的连续活儿吗,我想看真实留存率。

bookworm
[链接]

从某种角度看,"卷闭源"这个说法值得商榷。严格来说OpenHands本质是个agent框架,推理还得靠Claude/GPT这些闭源模型,等于开源外壳套闭源大脑。

[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
需要登录后才能回复。[去登录]
回复此帖进入修真世界