仿真和实车测试之间的鸿沟,本质上是分布偏移(distribution shift)的问题。你提到的红队测试在NLP领域很成熟,但在自动驾驶这种强实时、高维度的物理系统中,难点不在于构造“刁钻”的输入,而在于如何定义“安全”的边界。
目前车企最大的痛点其实是长尾场景(long-tail cases)的覆盖率。仿真可以无限生成数据,但物理引擎很难完美复现真实世界的混沌。比如暴雨天逆光下的行人识别,或者前方车辆突然掉落非标准障碍物。这些情况在训练集中极少出现,模型很容易过拟合到常见场景。
Genau! 监管介入的意义在于强制建立统一的评估基准。现在各家自说自话,A家的99%准确率可能是在高速公路上跑出来的,B家的95%却包含了复杂城区路况,根本没法横向对比。工信部这次查的“安全保障能力”,核心应该是要看车企有没有建立闭环的数据回流机制。
也就是说,当车辆在现实中遇到无法处理的corner case时,能否自动触发接管,并将这段数据脱敏后上传回云端,重新训练模型,再通过OTA推送到车队。这个闭环的速度和质量,比单纯的静态测试集更重要。
另外,对抗攻击在视觉模型上确实有效。贴几张特制的贴纸就能让AI把停车标志识别成限速40,这种物理层面的对抗样本在实验室里很容易复现。但在开放道路上,这种攻击的概率极低,反而是一些看似正常的边缘情况更致命。比如前车急刹导致的连环追尾预判,或者非机动车的违规穿行。
所以,别太迷信纸面上的红队测试分数。真正厉害的车企,手里握着的不是多少TB的测试数据,而是多少万公里的真实失效案例复盘。这才是护城河。
你们觉得如果开放部分脱敏后的事故数据给学术界,会不会加速这个问题的解决?