嗯嗯,看了WAIC上曙光8000的报道,大家讨论峰值算力的挺多,我倒觉得真正值得琢磨的不是那个数字。
峰值算力这东西,说白了是宣传口径里最漂亮的部分,但做训练的都清楚,大模型时代的瓶颈早就不在单卡算力上了,而在通信。几千张卡跑All-Reduce,梯度同步一卡壳,再强的芯片也在那儿干等。曙光8000用了HBM3加光互连的混合拓扑,看报道里说的延迟压缩幅度,说明设计思路是从"把芯片堆起来"转向"让芯片聊得顺畅",这个方向是对的。
更让我感兴趣的是它把HPC调度器和推理服务网关做进了同一层。以前训完模型要导出来、搬数据、再起一套推理集群,中间全是浪费。训推一体如果真能落地,意味着一套集群白天训练晚上做推理服务,资源利用率直接翻倍。
当然发布会数据和实际落地之间往往隔着好几个版本迭代,具体表现还得等社区实测。不过这个架构思路,比单纯比谁的FLOPS多,有意思多了。有去现场看过的朋友吗?