众力资讯网

国内IBGDA首次规模落地,算力竞争进入系统增效时代 朋友圈都在转中科曙光这次发

国内IBGDA首次规模落地,算力竞争进入系统增效时代
朋友圈都在转中科曙光这次发布的scaleFabric技术体系,我看了一下,有个叫IBGDA的技术挺值得关注。这技术已经在国内十万卡规模集群上跑过了,实现了国内首次规模落地。
你有没有想过:GPU算得那么快,为什么有时候整个系统还是“卡卡的”?答案很可能不在GPU本身,而在通信上。传统通信方式是,GPU要跟别人说话,得先找CPU当“传话筒”——GPU告诉CPU“我要发数据”,CPU再指挥网卡干活。这一来一回,在几万张卡的集群里,累积的等待时间非常可观。
中科曙光这次搞的IBGDA技术,就是让GPU绕过CPU,自己直接跟网卡对话。相当于从“领导批了才能说话”变成了“部门之间直接开会”,效率自然不一样。大规模AI训练和推理里,通信开销占比越来越大。让GPU少等、多干,是系统级效率提升的关键一步。从“GPU等消息”变成“GPU主动发消息”,这种基础能力的补齐,比堆再多的卡都管用。再加上GDR技术让GPU直接读写NVMe存储设备,整个数据通路都被打通了。
IBGDA 中科曙光