看了WAIC上曙光8000的报道,说点我的观察。展台没拿FP16峰值算力说事,反而现场跑实时4K视频超分,这个信号挺明确的——国产算力的叙事正在从"跑分"转向"能不能用"。
太!
说实话峰值算力这东西,硬件圈混久了都知道,纸面参数和实际吞吐经常差着好几倍,瓶颈全在互连和调度上。曙光这次把CPU-GPU异构集群的一致性内存访问做进去了,等于绕开CUDA指令层的依赖,从系统架构层面解决问题,这比堆卡难得多,也值钱得多。
配套的SDK走IR中间表示统一调度,PyTorch模型号称零修改迁移。这个要是真落地,意义不小——以前国产卡最大的痛点不是算力不够,是迁移成本劝退,改代码改到怀疑人生。生态这层窗户纸捅破了,后面才是规模的生意。
当然宣传归宣传,实际集群效率还得看真实负载的数据,等开源社区的实测吧,我蹲一个。