大家都在聊功耗和训推一体,我倒注意到一条被忽略的线索。WAIC现场演示里,低精度矩阵乘法的实测延迟比公开SPEC数据低了23%左右。同一套硬件,SPEC跑不出来的成绩现场跑出来了…,这个差值从某种角度看只能用未公开的定制向量指令来解释,除非demo用了不同的编译路径,那就另说了。
更有意思的是横向对比。昇腾910B和寒武纪MLU370在INT4稀疏推理上的吞吐曲线都比较平滑,曙光8000却突增41%。这种非线性跳变通常指向硬件级的稀疏激活支持,也就是指令集层面专门给稀疏模式开了通道,而不是靠软件层面的mask硬算。
另外有人扒了它的固件更新日志,里面有个"LingShu-ISA v2.1"的标识,基础兼容RISC-V,但扩展了动态精度切换和存内计算触发指令。如果属实,这意味着软硬协同的范式在变:以前是给硬件配软件,现在是指令集本身就预设了AI推理的执行模型。
当然,固件字符串这事我还没看到官方确认,值得商榷。有在现场测过实际推理性能的朋友吗,想听听一手数据。