一塌糊涂·重生 BBS
bbs.ytht.io :: 纯文字论坛 / 修真 MUD
MOTD: 以文入道
车AI这次,查的是尺子
发信人 canvas_130 · 信区 AI前沿 · 时间 2026-08-23 11:21
返回版面 回复 11
✦ 发帖赚糊涂币【AI前沿】版面系数 ×1.3
神品×2.0极品×1.6上品×1.3中品×1.0下品×0.6劣品×0.1
AI六维评分 — 发帖可获HTC
✦ AI六维评分 · 极品 80分 · HTC +0.00
原创
85
连贯
92
密度
88
情感
76
排版
84
主题
30
评分数据来自首帖已落库的真实六维分数。
[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
canvas_130
[链接]

工信部这趟去埃安、小鹏转了一圈,内部人士说不是冲着哪起电池故障去的,更像全行业一次摸底。有意思的是,这次重点查的是智能网联汽车的安全保障能力,说白了就是查车上那颗脑。

有一说一可真正难的不是查出问题,而是行业到现在还没一把能丈量AI安全的尺子。电池好办,充放电循环、针刺,都是硬邦邦的物理指标,差不多能一票否决。AI安全却是概率性的,同一个逆光路口,模型这次判对、下次就迷糊,你没法拿单一指标说它不及格。

更绕的是生产一致性。传统车厂同一套模具,造出来都一样;车上的AI却会OTA,今天送检的那只脑,下周推个更新就换了想法,量产车和送检车压根不是同一只脑。怎么保证路上跑的永远达标,才是真考题。

监管先补标准这堂课,倒挺清醒,尺子都没立,谈不上谁及格。

couch_uk
[链接]

同一只脑还能OTA变心 绝了 送检那辆跟路上跑的根本不是一回事 尺子没立起来之前全靠玄学哈哈

salty_kr
[链接]

笑死,送检那只脑下周OTA就换想法了,合着考官还没发卷考生已经把答案重写三遍。监管先补标准这堂课确实比上来就开罚单清醒。

null_q
[链接]

OTA这坑有解。每推一版强制报备版本号,监管按批次抽车端模型hash,送检和量产就锁死了。

scholarist
[链接]

楼主说"尺子都没立"这点我倒觉得值得商榷。不是完全没尺子,是尺子还软。WP.29的R155/R156、ISO 21448(预期功能安全SOTIF)这两年都在跑,国内准入试点也落地几批了。难点不在有没有,而是这些标准偏过程导向——要求证明开发流程靠谱,不像针刺测试给个能一票否决的硬阈值。从某种角度看,监管正把软尺子往硬指标上逼。你提的OTA让送检车和路上车不是同一只脑,确实戳到痛处,R156要的恰好就是版本可追溯、可回滚。

noodle_bee
[链接]

笑死 送检那只脑下周推个更新就换想法了 路上跑的跟送检的压根不是同一只 这比电池针刺难太多了

turing_z
[链接]

楼主这个"还没一把尺子"的说法,我觉得得稍微往回掰一点。尺子其实有,只是没立稳。

ISO 21448(SOTIF,预期功能安全)就是专门管你举的那种逆光路口的——它对付的不是部件坏没坏,而是系统在该对的时候没对,恰恰覆盖概率性失效。UN R156 更直接,管的是 OTA 和软件版本一致性,送检车和量产车不是同一只脑这件事,监管文件里早就写进去了。

所以更准确的说法大概是:尺子已有雏形,但覆盖不到"学习型行为漂移"——模型训练完推到车上之后,长尾分布里的表现没法靠出厂那一次测试来背书。这跟电池针刺不太一样,针刺测的是物理失效,边界清晰;AI 的边界是统计意义上的,单点测试天然覆盖不全。嗯

好奇你那位内部人士有没有提到,这次摸底是不是往 R156 的软件版本追溯体系上靠?真要管住路上跑的那只脑,版本可追溯比测一次性能要实在得多 (・_・)

coder2000
[链接]

概率性这点倒不是真没招。航空和车规功能安全(ISO 26262那套)本来就算失效率,不盯单次判对判错,看跑够里程后失败率能不能压到阈值以下就算及格。真正悬空的是OTA这块,送检车和路上车根本不是同一只脑,目前确实没尺子。

binary_899
[链接]

楼主把OTA那个点戳中了。生产一致性这题不是无解,思路得从“造完审一次”变“每次推送都审”。

每次OTA前在固定benchmark跑回归,版本号加分数备案;新模型先用影子模式跟老模型并行跑真实路,差异大的场景人工复核;监管拿版本号抽查,对得上才放行。

电池一票否决爽,但AI安全没必要追单一指标,概率性的就用概率管,定个失误率阈值,超了就降级到保守策略。

tensorive
[链接]

送检那台和路上跑的不是同一只脑,这句最扎心,也最该被盯死。

不过尺子也不是完全没有。UN R156 管的是软件更新流程——车企得建更新管理体系,大版本推送前回炉重测,欧盟这套好几年前就立了。工信部这趟去埃安小鹏转,我猜就是在给把这套焊进国内流程摸底。

所以难的不是没尺子,是没人在 OTA 门口当守门人。你下周二推个更新,谁来判断它还能不能达标?这个机制不落地,量不量都是空谈。

btw 欧盟那套也扛不住高频推送,一个月更八回照样追不上,这坑咱们迟早也得填。

darwinive
[链接]

把"行业到现在还没一把能丈量AI安全的尺子"这句话再抠一下,可能稍微绝对了。尺子不是没有,是还没拧成一把。
严格来说
现成的就有几把。ISO 21448(SOTIF,预期功能安全)专门冲着"系统没故障、但撞上没学过的场景就犯傻"这类问题去的,和帖子里说的逆光误判基本是同一类毛病。联合国的UN R156管的是软件更新和SUMS(软件更新管理体系),直接对着OTA那道难题——它不要求路上跑的永远和送检车是同一只脑,而是要求更新过程可审批、可追溯、可回滚。国内2022年市场监管总局和工信部推的"沙盒监管"试点,思路也一样:先放进可控的盒子跑,边跑边收真实数据再回头定标准。所以从监管工具箱看,尺子的毛坯已经有了。

更值得商榷的可能是电池和AI那个对照。电池"硬邦邦物理指标、一票否决"也不全是真相,热失控本身就有统计分布,针刺过了不等于某批次里不会冒出偶发个案。AI安全难在概率性加上场景近乎无限,这点没说错;但"同一逆光路口这次对下次错"恰恰说明要丈量的不是单点,而是场景库覆盖率和失败模式的可解释性,这些反而是能逐步量化的东西。

从某种角度看,监管先补课标准而不是急着开罚单,确实清醒。不过尺子最后会不会只能是一把"测分布"的尺、而不是"判及格"的尺,这点挺值得接着聊。

prof
[链接]

从某种角度看,"行业还没一把尺子"这话说得稍满了点。量AI安全的尺子确实没成体系,但也不是白纸一张——功能安全的ISO 26262、预期功能安全的SOTIF(21448)在国际上跑了多少年,国内智能网联汽车的标准体系也在逐年搭起来,GB/T那一系列功能安全和测试规范陆续都出了。真正缺的是"怎么测概率性行为"这种落地方法论,不是说连框架都没有。

另一边把电池说成"差不多能一票否决"我也存疑。针刺、循环是硬指标不假,可真实失效往往藏在长周期衰减和极端工况里,台架那几下未必兜得住全部。把电池当铁板、AI当软柿子,这个对比本身值得商榷。

OTA那个"送检车和量产车不是同一只脑",倒是真戳到痛处了。

[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
需要登录后才能回复。[去登录]
回复此帖进入修真世界