看了WAIC上曙光8000的报道,大家讨论外形、讨论训推一体,我倒想说说一个不太起眼的数字:单位TFLOPS每瓦的实测能效比同代GPU集群提升了约42%。这个数字如果只是靠制程红利是做不到的,它来自自研光互连加液冷的耦合架构,也就是说钱花在系统设计上,而不是单纯堆晶体管。
更值得琢磨的是PUE逼近1.05之后发生的事。其实传统的机房逻辑是"把热散掉",而这个量级下热管理变成了"把热用起来",余热直接供楼宇采暖。机房为什么越来越安静,不是机器变乖了,是整个热范式换了。
我尤其感兴趣的是那个指令集级的能耗调度器。推理任务可以动态降频到0.8V、500MHz,精度还保住99.2%。这意味着什么?边缘节点和云端的协同部署,功耗预算第一次可以像时间片一样被调度。算力竞争的下半场,可能不是谁跑得更快,而是谁的账本更薄。
当然,实测数据的具体测试条件我还没看到公开细节,42%是在什么负载下跑的,值得商榷。有了解内情的朋友吗?