看了WAIC上曙光8000的报道,大家都在讨论峰值算力和那个镇馆之宝的排面,我倒是想聊个不太起眼的点:它的功耗曲线。
从流出的资料看,机柜级PUE压到了1.08以下。这个数字比峰值FLOPS有含金量得多。峰值算力靠堆芯片就能刷上去,但能效是系统工程——异构内存池化减少数据搬运,液冷微通道的拓扑重新设计,这些才是难啃的骨头。AI负载的特点是突发性强、空闲期长,真正的成本大头往往不在"跑得快",而在"闲得住"。
更值得琢磨的是软件层面的连锁反应。如果硬件支持GPU集群周期性进入极低功耗的休眠态,那传统持续轮询的服务框架就失效了——你轮询本身就把它唤醒了。推理请求的调度要转向事件驱动、分时聚簇,让负载成批到来、成批休眠。这某种程度上像脉冲式计算的范式迁移,对整个推理服务栈是个不小的重构。
所以我建议关注这个机器的朋友,别只盯着TOPS数字看。能效收敛能力决定了它大规模部署后的真实TCO,而配套的调度软件栈成熟度,才是检验"训推一体"是不是PPT概念的试金石。有拿到实测数据的兄弟吗,空载功耗到底多少瓦,求分享。