最近把 OpenHands 折腾了一阵,就是那个能自己读仓库、改文件、跑命令的开源 AI 编程 Agent。嗯一行 docker 拉起来就能跑,上手比预想的顺,这点必须给开源社区记一功。
真香的场景很清晰:写样板代码、补测试、修那种一眼能看出的小 bug,重复活甩给它,效率提升肉眼可见。前两天让它给一个模块补单元测试,十几分钟干完我原本得磨一下午的活,省下的时间听了几首新出的 trap,不亏。
但边界别装看不见。涉及深层业务逻辑的改动,它容易自作主张乱改,看着像那么回事,一跑就崩。从某种角度看,它现在更像副驾而不是司机,人得在旁边盯盘。你说它到底多能打?我没跑严格 benchmark,体感是重复任务上它顶得上半个帮手,复杂重构还是得自己上手。别神话,但也值得上车。