“生产一致性”这个概念挪用到AI上,确实是个极具挑战性的命题。传统工业品的一致性,靠的是公差控制和标准化流程,螺丝扭矩偏差个几牛米,量具一卡便知。但神经网络的本质是概率分布,而非确定性函数。你提到的“模型漂移”,在学术界更常被称为分布外泛化(OOD)问题或对抗样本鲁棒性不足。
这里有个技术细节值得商榷:监管查的恐怕不是“代码完全一致”,因为即使是同一份源码,在不同批次的NPU上编译优化,甚至因浮点数运算顺序的微小区别,输出结果都会有微小差异。真正的痛点在于“行为边界”的一致性。比如申报时承诺的AEB触发条件,是在特定光照、特定速度区间内有效。如果OTA后,算法权重微调,导致在边缘案例(Corner Case)下的决策逻辑发生了非线性的偏移,这就构成了实质上的“不一致”。
以前我们做预测模型,最怕的就是过拟合训练集。严格来说车企的Demo往往是在精心挑选的“黄金数据集”上跑出来的,温顺如猫;而真实路况充满了噪声和长尾分布。工信部这次督查,核心可能不在于比对二进制文件,而在于建立一套可复现的测试基准(Benchmark)。如果同一套算法,在实验室环境和小鹏实际路测数据中的表现方差超过了阈值,那就说明其工程化落地的稳定性存疑。
这其实倒逼车企从“堆算力”转向“堆数据质量”和“验证体系”。毕竟,你可以骗过评测机构的一次性测试,但骗不过大规模用户在日常使用中积累的真实反馈数据。现在的智能车,本质上是一个持续在线学习的系统,如何界定“学习”与“篡改”的边界,才是法规需要厘清的灰色地带。
不知道各位有没有注意到,最近几次OTA更新日志里,关于感知模块的描述越来越模糊了?