9月17日,在2026华为全连接大会召开期间,神州鲲泰正式推出基于鲲鹏、昇腾950技术路线的新一代产品矩阵:搭载鲲鹏950的KunTai R722 K3均衡型服务器,以及基于昇腾950DT的KunTai A989 I5标准服务器、A989 I5风冷超节点与KunTai Pod 2000 A5液冷超节点。四款新品横跨通用计算与大模型训推,不仅是常规产品迭代,也释放了值得关注的信号——当“超节点”仍是行业热词时,神州鲲泰已把它从概念推进到了可选型产品阶段。
超节点为何成为“胜负手”
大模型参数量百倍级扩张,MoE稀疏架构与Agentic智能体应用兴起,训练向万亿参数演进,推理进入超长上下文、海量Token、多模态协同新阶段。传统依靠以太网RoCE组网的服务器堆叠集群,通信时延高、内存墙突出、算力MFU利用率受限,难以释放新一代芯片的全部能力。
“算力底座的竞争已经从单芯片算力比拼,转向算-网-存系统协同能力的较量。”神州鲲泰产品专家孙亚楠向媒体表示。在他看来,超节点已经成为大规模训推任务的最优解,是AI计算与高端通用计算的关键技术方向。这也解释了此次发布为何以“超节点”为主线,因为竞逐的焦点已从芯片参数,转移到系统级工程能力。
“超节点”概念走热,行业泥沙俱下,不少厂商的宣传中,普通服务器堆叠也被冠以超节点之名。孙亚楠给出了自己的评判标尺:真正超节点必须同时满足三条硬性标准。一是专用高速硬件总线互联,如灵衢UnifiedBus,区别于以太网RoCE的消息通信,减少协议转换与数据拷贝带来的时延开销;二是全域内存统一编址,支持内存语义Load/Store远端内存、无需数据拷贝,“这是和普通集群最本质的差异”;三是端到端全栈软硬件协同,芯片、互联硬件、CCU、驱动、操作系统、通信库完整适配。
“仅用以太网组网,哪怕硬件规格再高,也只是服务器堆叠,无法突破内存墙与通信瓶颈,算力无法充分释放。”孙亚楠说。这番表态直指行业痛点,也为“什么是真超节点”立了一把尺子——对处于信息不对称中的下游客户而言,这三条标准具有不小的市场教育价值。
双矩阵的技术底牌
此次发布呈现出了“双轮”结构。通用计算侧,KunTai R722 K3搭载鲲鹏950,整机性能提升1.4倍,内存带宽提升2.25倍,并首发灵衢接口,面向金融、运营商、大型政企的核心交易、大型内存数据库与数仓场景,承接小型机迁移。AI智算侧,昇腾950DT三款整机分层卡位:KunTai PoD2000 A5液冷超节点支持1024卡集群与256TB内存统一编址,MFU可达约45%,面向新建大型智算中心与万亿MoE模型预训练;KunTai A989 I5风冷超节点最大提供14.2 PFLOPS算力,推理吞吐达前代A3节点的1.5—2倍,支持768卡灵活组网;KunTai A989 I5标准服务器则以业界唯一16卡Full-mesh组网,覆盖小集群推理与中型模型微调。
风冷与液冷并存,值得留意。孙亚楠坦言,两者的取舍在于“牺牲单机柜极限算力密度,换取存量机房兼容”:液冷整机柜追求极限算力密度,但对机房基础设施改造要求高;风冷超节点则无需改造液冷管路,直接利旧传统风冷机房,“客户场景互补”。在智算中心“先建后用”的当下,这种务实分层,为存量机房与新建智算中心提供了不同的入场券。
值得关注的是,新品在技术细节上的几个“首次”。KunTai R722 K3搭载的鲲鹏950是业界首款3D封装处理器,通过Dielet“零距离通信”降低Die间通信延迟、提升通道带宽,为更多核心与更大Cache提供物理基础;配合重构微架构与场景化内核调优,业务性能可提升35%,并支持SVE2与INT8矩阵向量吞吐优化,推理性能同步跃升。面向大数据、数据库等重负载场景,新增DPA加速;安全层面支持满带宽内存加密与CCA机密计算架构,硬件级隔离且加密不影响内存访问带宽,为金融、政务等敏感场景补齐信任底座。可靠性上,CPU故障隔离及修复、L3上电替换、内存Cache Line冗余修复,直指核心业务对连续稳定运行的要求。
液冷与风冷两款超节点,则展示工程化的另一面。KunTai PoD2000 A5依托低温混流装甲冷板、高效TPSU电源、柜级正交架构、星云8000 LPO光互联与2+2光路保护,在功耗、散热、互联、供电四维做全栈优化,千卡MTBF达300小时,直接对应训练场景的可用性与运维成本。KunTai A989 I5风冷超节点通过灵衢2.0协议实现整框NPU互联总带宽13.4 TB/s,内存读写带宽最高4.0 TB/s,配合业界唯一的5ms极致时延,为Agent多智能体协同提供低延迟底座;16卡Full-mesh标准服务器则让NPU无转发直连,兼顾中小规模集群的灵活部署。
算力价值的兑现:全链路与生态协同
昇腾950DT对MXFP4低精度算力的支持,是此次发布的另一关注点。MXFP4能显著降低权重、激活、KVCache的显存占用,提升长上下文、MoE与Agent推理吞吐,减少显存硬件投入。但孙亚楠特别强调,FP4能力不能只依靠芯片硬件:“昇腾950DT内置FP4计算单元只是基础,必须整机全链路打通。”神州鲲泰在KunTai智算整机上完成了硬件链路、驱动与CANN软件栈的适配,实现HiF8、FP8、MXFP8、MXFP4全链路支持。“如果整机软硬件链路未打通,上层业务无法调用FP4能力,收益无法兑现。”这一表态是对行业“唯芯片论”的纠偏——低精度红利最终要靠整机工程能力兑现。
超节点系统工程门槛高,整机伙伴与芯片厂商如何分工,是产业关注的焦点。按孙亚楠的介绍,华为提供鲲鹏950、昇腾950DT芯片,以及灵衢UnifiedBus总线、CANN软件栈、CCU通信单元等底层底座能力;神州鲲泰则把测试与客户验证中发现的互联、散热、适配问题反馈华为,双方持续迭代整套软硬件体系。
尽管产品已就位,孙亚楠对产业阶段保持清醒:“国产超节点不是芯片简单堆叠,属于系统工程。伴随鲲鹏950、昇腾950DT原生支持超节点硬件能力,以神州鲲泰为代表的整机伙伴,已经把超节点从概念推进到可选型产品阶段。但产业尚处早期,需要芯片、整机、操作系统、数据库、AI框架厂商持续协同打磨场景,推动规模化商用。”迁移方面,他也提醒,现有数据库与AI框架基于传统集群模型开发,适配全局内存特性、多方联合调优、运维模式改变都是现实挑战;但无需一次性重构,可分步迁移,先单机上线、再逐步适配超节点特性。
结语
从单芯片比拼到系统协同,从概念热词到可选型产品,神州鲲泰新一代产品矩阵的发布,标志着国产算力竞争进入“系统战”阶段。超节点的胜负手不在参数表的数字,而在全栈工程能力与生态协同深度。谁能在规模化商用这条路上走得更稳,谁才真正握有下一代算力底座的话语权。

评论
更多评论