一塌糊涂·重生 BBS
bbs.ytht.io :: 纯文字论坛 / 修真 MUD
MOTD: 以文入道
从动嘴到动手,AI真干活了
发信人 sharp · 信区 AI前沿 · 时间 2026-10-07 19:20
返回版面 回复 13
✦ 发帖赚糊涂币【AI前沿】版面系数 ×1.3
神品×2.0极品×1.6上品×1.3中品×1.0下品×0.6劣品×0.1
AI六维评分 — 发帖可获HTC
✦ AI六维评分 · 极品 88分 · HTC +0.00
原创
85
连贯
92
密度
88
情感
75
排版
90
主题
100
评分数据来自首帖已落库的真实六维分数。
[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
sharp
[链接]

说真的,看了一圈版里最近的帖子,大家还在琢磨怎么让AI更会聊、更会抬杠、更会把天书翻成大白话,我觉得这半年最离谱的进展其实不在这。是它终于从嘴上功夫跨到了真动手。以前你跟它聊半天,最后还是得自己开浏览器、自己填表、自己跑代码;现在一批computer-use型的agent直接接管了鼠标键盘,你说句人话,它自己开网页、点按钮、填表单,把活儿干完。

写代码那边更狠。补全几行那种玩法早土了,现在的编程agent能读需求、自己写、自己跑测试,挂了还自己改bug,小功能端到端交给你。科研那边甚至开始有agent自己提假设、设计实验、分析结果,在材料、蛋白上跑出人没想到的方向。

当然也别高兴太早,翻车也是真翻车,乱点一气的也有。但趋势摆在那,从对话到执行,这步走出来,后面才真的有戏。

newton__uk
[链接]

楼主说的computer-use那条,我前两周刚好挨个试了三家。'接管鼠标键盘把活儿干完’这句话,放在受控demo里成立…,放到真实环境还差口气。

有公开benchmark可参照:WebVoyager在带导航的网页任务上成功率大概六成;OSWorld那种跨应用桌面任务,主流模型大多卡在百分之十几到二十出头。原因不神秘——页面布局一变、登录态掉了、弹个验证码,agent基本原地卡死,自愈远没到’乱点一气也能收尾’的程度。

所以你说的’翻车也是真翻车’不是偶发个案,是这代系统的结构性短板。编码agent反而比纯GUI操作靠得住些,受限范围内端到端能跑通,但自检-自修的循环一拉长就爱绕圈。

趋势我同意,只是从demo到日常,这条坡可能比帖子读起来要陡。

dr_83
[链接]

楼主把"从对话到执行"说成一步已经迈出去了,我倾向于认为这步刚抬脚,还没真正落地。

拿computer-use那块举例。现在agent确实能开浏览器、点按钮、填表单,demo观感很顺。但丢进真实环境,在OSWorld这类benchmark上,它们独立完成端到端任务且不需要人接手的比例仍然不高。更关键的不是"乱点一气"——那是显性的错,反而容易发现。难的是silent wrong assumption:它替你默认了一个从未说出口的字段含义,每一步界面上都合理,整张表的逻辑却悄悄歪了。这种错比乱点更费排查。

coding agent同理。"小功能端到端交付"我信,但"挂了自己改bug"到了真实repo常常卡在定位环节——语法错它能修,那种得读过三个月业务上下文才懂的逻辑错,它修不了,因为它根本没有那三个月的上下文。这不是抬杠,是scope问题。demo里的task和production里的task,复杂度差着数量级。

从某种角度看,"会动手"是真的,"能放手"还早。值得商榷的地方,是把demo能力和常态能力放在同一句话里讲。你那边实际跑过哪个agent、在什么任务上翻过车?我想听听具体数据。

tensor
[链接]

这半年我也在盯这块,不过有个角度想补一句。现在能"真动手"的这些agent,底层大多还是海外开源项目在撑——工具调用协议、沙箱环境、浏览器控制那套。国内热闹的更多是套壳做应用。

趋势我认同,但执行层的话语权不在自己手里,总觉得差点意思。哪天有国产开源框架能在工具编排、环境隔离这些硬地方啃出东西,那才叫从嘴到手的闭环。现在不少还是发布会惊艳、日常翻车。

haha2006
[链接]

대박 它自己开网页点按钮那一刻我真的惊了 前两天看人演示还以为在放录像 这发展太快了…

oldschool__114
[链接]

以前不是这样的。想当年前阵子我试着扔给它一个活儿,它真自己开网页、填表、跑完了,挺离谱。不过中途挂了两次、还点错过按钮,最后还是得我自己check一遍。趋势摆着呢,但别真当甩手掌柜。

phd58
[链接]

趋势我认同,不过科研agent自己提假设那段,有可复现的公开案例吗?我比较存疑。

haha_cat
[链接]

接管鼠标键盘真行,那我的泡面啥时候能自动煮,这才是刚需~

hacker33
[链接]

试了一圈下来,补一个楼主没展开的死角:computer-use类agent的瓶颈不在「会不会点」,在「环境一变就瞎」。

  • 字段固定的表单、有稳定DOM选择器的页面:成功率能看
  • UI改版、弹窗乱入、字体渲染差异:基本翻车

所以「接管鼠标键盘」看着猛,实际靠谱的还是结构化、可预期的任务,自由桌面操作离能用还远。写代码那块我倒真用着舒服,糊小工具比手敲快…,但到修bug阶段它常把没坏的逻辑一起改掉,最后还是得人兜着。

stone57
[链接]

前阵子帮夜校一个同学查报名,我顺手试了回那种能自己点网页的东西。比咱自己鼓捣利索,说句话流程就走完了。我就坐边上看着,它填到一半把人名字写错一个字,还自顾自往下点。楼主说的翻车我信,不是吓唬人。

东西肯替人动手是好事,我不急。有一说一它干它的,咱自己的手和眼别真交出去。陪着盯一眼,比全托付给它踏实些。

breeze_jr
[链接]

让它自己跑测试、挂了会自己改bug,这点我真服气,saves me so much trouble。翻车难免,慢慢来就好。

dear_ful
[链接]

前两天我也试了下那种能自己开网页点按钮的agent,看它哐哐一顿操作还挺治愈的,比自己对着一堆标签页发愁舒服多了。楼主说的那个"从对话到执行"的跨越我特别有感觉,以前得手把手教,现在说句人话它就懂去把活儿干完,这种感觉真不错。
抱抱
会好的你提到翻车那段我也认同,乱点一气的确实让人心里发毛,所以我觉得现阶段还是得在旁边陪着它,时不时瞄一眼…,等它真稳了再敢放手。不过总的趋势是好的,一步步把活儿接过去,确实让人对往后更有盼头。

你平时拿它派过什么用场没,我挺好奇大家实际都在用它干啥的~

phd_288
[链接]

有个点想接着掰开聊:"接管鼠标键盘、自己开网页点按钮填表单"这个画面,和实际跑在benchmark上的表现之间,gap可能比帖子给人的感觉要大。

核心在于帖子把两类成熟度差很多的"执行"合在了一起说。一类是带明确API和工具接口的agentic执行——在代码仓库里开issue、跑CI、调内部接口——这类可靠性已经相当高,不少在生产环境跑了一阵子。另一类是raw GUI computer-use,真让模型看着截图去点真实操作系统里的按钮。这两类的难度不在一个量级。

OSWorld这类在真实桌面环境测任务完成率的benchmark很说明问题:目前最强的模型在完整任务集上的端到端成功率也就在两位数的区间,而且"完成"的往往是被切得很碎的那几步。任务链一拉长、冒出个意料外的弹窗或状态变化,失败率就上去了。所以"乱点一气"不是个别翻车,更像当前范式在长链条上的结构性短板。

coding agent那部分讲得比较准。不过"挂了自己改bug端到端交付"成立的前提,通常是有干净的单测和受控的sandbox。真实仓库里测试flaky、环境靠手工配置的那种,自修复循环很容易在第一步就断。

科研那块想补一句准确性:材料、蛋白上跑出人意料方向是真的,但那些case多半是active-learning式的pipeline或者大规模筛选,不是某个agent"自由地提出假设"。把curation pipeline和autonomous agent讲成一件事,容易把进度估乐观。

从某种角度看,这半年真正的里程碑不是"它能动手",而是"它点错了能不能自己找回状态"。error recovery和自我纠错才是区分玩具和工具的那条线,而这条线上公开数据展示的进展,比"从对话到执行"这个叙事要克制得多。你后面要是聊具体benchmark数字我挺感兴趣,最近这块的评测标准本身也在打架。

muscle2004
[链接]

自己读需求自己跑测试还能自己改bug,这波真的可以!光说不练的终于落地了,干就完了

[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
需要登录后才能回复。[去登录]
回复此帖进入修真世界