智东西 作者 李水青 编辑 漠影 智东西9月19日报道,在9月17日‑19日举办的华为2026年全联接大会上,华为围绕 灵衢互联 架构及 超节点集群 ,推出 昇腾960芯片、昇腾960超节点、OceanStor M900 AI记忆存储 等一系列AI基础设施新品,引起产业多方关注。 其中,“灵衢”成为贯穿所有发布、高频出现的关键词,引起了很多人的好奇。 灵衢是什么?有什么过人之处? 华为常务董事、ICT BG CEO杨超斌在主题为“灵衢互联,架构创新,构建Agentic AI算力底座”的演讲中,给出了完整答案。 简单来说,灵衢(UnifiedBus),是华为整个算力底座的 统一互联总线协议 。它把CPU、NPU、DPU、DDR、SSD等多种计算与存储单元统一互联起来,并进一步贯穿单机、超节点和超大规模集群。 传统互联下,十万卡集群实际算力使用率只有约20%,难以扛住AI Agent时代的计算需求。华为公布的数据显示,基于灵衢的单集群可支持100万颗AI处理器, 10万卡 集群的模型浮点算力利用率(MFU)从 20% 提升至 35%。 为什么华为把这次架构创新的关键点钉在“通信”上? 这要从AI Agent时代的 计算需求变化 说起。 一、通信成AI Agent算力胜负手,三大挑战“逼”出灵衢架构答案 AI Agent时代,通信正在成为算力“胜负手”。 现在,模型参数规模已经从万亿级走向10万亿级,未来可能进一步达到20万亿甚至50万亿;上下文长度也从几K级来到几M级,未来可能达到几十M。与此同时,人与Agent的交互频次也远高于模型。 作为AI底层的计算系统,需要同步支持超大模型推理、高频次调用、多种工具使用、多层级信息传递与存储,面临诸多挑战。 1、通信量平方级暴涨,10万卡MFU不足20% 第一个挑战来自通信范围极速变大。数据并行域内的通信量与参数量呈近似平方关系,不可掩盖的通信时间占比成倍增加,MFU快速下降。 典型MoE模型在10万卡集群上的MFU不到20%。如何打破MFU随集群规模快速下降的趋势,成为计算系统面临的第一道难关。 2、一种算力喂不饱所有AI负载,异构协同与内存池化成刚需 第二个挑战来自AI业务负载多样化。Prefill(预填充)与Decode(解码)呈现出不同的计算特征与访存特征,因此P、D分离,用不同算力来满足。 面向未来更大模型、更低时延的推理,Decode中的Attention与FFN,由于计算与访存特征差异,用专用算力来加速可以提升效率。 同时,随着Agent应用普及,CPU与NPU配比发生变化,计算系统需要异构算力协同、内存资源池化,实现动态、高效调整。 3、上下文持续变长,旧互联撑不起多级缓存 第三个挑战是上下文持续变长带来的存储压力。无论是训练还是推理,都必须构建层次化的多级缓存架构,包括HBM、DDR、SSD分层分级,成为必然选择。 现有PCIe加RoCE网络,难以满足缓存所需要的时延与带宽需求。未来PB级的KV Cache,也需要更大的带宽、更低的时延来匹配。 可以说,通信,开始成为计算系统性能的关键。 它需要超强互联能力,支持异构算力高效协同和扩容;也需要打破物理极限,实现算力、内存等资源池化;还需要超大带宽和更低时延,保障计算系统的通信效率。 灵衢,就是华为针对这些变化给出的架构答案。 二、一套协议打通芯片到集群,灵衢四大竞争力重装算力底座 灵衢的核心,是用一套协议贯穿从芯片到集群的整个系统,把复杂协议归一,统一内存语义,消除协议转换开销。 杨超斌谈道,其竞争力可以概括为以下四个维度: 1、协议归一,统一内存语义。 传统计算系统采用主从架构,服务器内部CPU和内存可以通过load/store指令直接访问,但跨节点访问通常依赖RDMA的Send/Receive消息传递。数据需要反复打包、拆包,还要进行协议转换。 灵衢要做的,就是从协议层重新组织这一过程。华为将CPU、NPU、DPU、内存、存储、网卡等核心组件统一基于灵衢协议互联,实现十几种协议归一;同时在超节点内部统一内存语义,实现全局内存统一编址。由此,其互联带宽从百GB级提升到TB级,RTT通信时延从7微秒压缩至2微秒,降低约70%。 2、多样算力,异构协同。 CPU、NPU、内存和SSD等计算、存储单元通过灵衢直接对等互联,形成去中心化的平等访问方式。这样一来,计算系统可以根据不同业务需求灵活配比CPU和NPU,同时具备可扩展性,而不必受制于固定的节点结构。 3、分级存储,全局池化。 随着AI模型不断变大,单颗芯片、单台服务器能够提供的内存容量越来越难满足需求。灵衢通过分级存储和全局池化,将多种混合介质纳入统一资源体系,提高内存利用率。 4、光电互联,灵活组网。 当超节点从千卡走向万卡,电互联开始受到物理距离、带宽和功耗等限制。
发表评论