Agent AI时代,AI正从技术验证走向规模商用,自身能力也在持续进化:参数规模迈向万亿级;多模态与多维数据深度融合;上下文限制持续突破,可支撑更长、更复杂的连贯推理。这一发展过程中,无论是依靠大参数、大算力、大数据探索能力上限,还是依托模型算法与算网设施协同优化落地方案,都对算力基础设施提出更高要求。相应地,探索构建布局合理、泛在连接、灵活高效的算力互联网,实现算存运力协同,也成为大势所趋。
这其中,作为AI规模化应用的先行领域,互联网行业迫切需要适配大模型训推、多模态交互、Agent自主决策等场景的一体化算力解决方案。然而,算力供给与业务需求之间仍存在明显错位,而在“如何建、如何优、如何用”大规模集群上,也面临诸多挑战。如何破解这些难题?在华为中国政企用户峰会2026期间举办的互联网行业圆桌会议上,华为用量身定制的大规模部署与算力释放实战方案给出了答案。
需求井喷与供给错位:互联网行业的算力之困
在AI驱动的产业变革浪潮中,算力成为决定大模型落地效能的关键基础设施。尽管业界秉持“更大算力探索更高智能”的共识,但算力从规模竞赛迈入系统协同阶段:从单点算力到系统协同,从通用方案转向场景协同,从封闭生态走向开放协同。即将规模上市的昇腾A5系列,将成为极具竞争力的方案。华为中国地区IT交付与服务部部长张岳普表示,“这标志着智算基础设施进入全新代际,为互联网行业的多场景AI算力需求提供更强大的底座。”
然而,算力升级在带来性能跃升的同时,也让集成交付的复杂度同步攀升,其中,灵活组网意味着更多配置组合,而高密度集群对稳定性提出新要求。不仅如此,算力的价值最终依靠性能释放来兑现,相同的硬件,不同的调优策略,模型性能差距可达数倍。在追求极致性价比的互联网行业,打通系统层、框架层、算子层、调度层全栈调优路径,极致释放算力效能、沉淀可复用的标准化技术范式,已成为AI业务规模化部署的必由之路。
事实上,算力升级的复杂性并非不可逾越的障碍,而是产业走向成熟的必经考验。谁能将复杂的系统协同转化为简单的服务交付,谁就能在新一轮竞赛中占据先机。华为中国政企互联网行业总经理黄健表示,“华为依托全栈服务能力与开放生态策略,以确定性技术供给和系统性调优经验,护航互联网企业平稳跨越规模化落地门槛。”会上,还阐述了昇腾A5系列产品与集成交付方案,并介绍了其模型调优方法与落地实践。
智算基础设施进入全新代际,昇腾A5系列有哪些硬核实力?
昇腾A5系列搭载全新950系列芯片,同步提供风冷、液冷两类硬件部署形态,适配不同机房条件与互联网业务需求。其中,液冷形态Atlas 950 SuperPoD单柜集成64张NPU,采用HiAM2.0铠甲冷板结构,主打万亿大模型预训练、大规模强化学习等高密算力场景;而风冷Atlas 650E、850E单节点搭载8张NPU,依靠VCE相变方式散热,无需机房大规模基建改造,适配微调、线上推理、推荐系统等轻量化算力业务。
硬件部署之外,芯片本身的代际升级同样关键。昇腾950系列芯片采用一代双芯差异化设计。其中,950PR配备大容量内存,侧重多模态、推荐Prefill场景;950DT拥有超高内存带宽,适配训练与解码任务。值得一提的是,该系列芯片完成算力配比、访存粒度、双模编程三重微架构升级,自带原生低精度量化能力,兼顾训练速度与显存占用,从芯片底层夯实算力基础。
芯片性能的释放更需依赖高效的卡间通信。灵衢2.0高速互联架构作为集群核心网络底座,全面升级UB专属总线,带宽大幅提升,原生支持1024卡超大超节点组网。该架构依托超大卡间带宽、超低跨卡时延及全域统一池化,解决MoE推理、长序列训练、强化学习交互场景的通信互联瓶颈难题。此外,灵衢2.0采用UB-Mesh+Clos混合拓扑与统一UBoE协议,针对LLM预训练、多智能体等互联网主流业务可显著提升性能。
在笔者看来,昇腾A5系列以芯片到集群的全链路协同创新,为互联网AI业务提供从极致能效到超大规模的无缝算力底座,加速智能生产力落地。
全域仿真与五层测试,构建标准化集群交付范式
性能之外,互联网行业还关注如何交付算力集群。华为基于成熟的智算超节点交付经验,在交付全流程中实践出大规模高密算力集群交付新范式。针对昇腾A5高密硬件、灵衢复杂组网带来的多重交付难点,搭建覆盖规划设计、硬件安装、网络部署、系统验收全流程标准化交付体系,配套全域仿真工具与五层全维度测试机制,同步兼顾集群落地效率与长期稳定运行能力。
在前期规划阶段,华为依托机房BIM三维建模开展算存网一体化仿真规划,自动生成完整LLD设计方案,精准测算线缆长度以降低采购成本,同时提前识别机房层高、供电、液冷管路等基建隐患,从源头规避后期改造风险。
进入现场施工环节,华为固化风冷与液冷全套标准化工序,引入专用搬运工装,并严格执行完整EHS安全规范;综合布线及灵衢组网均通过自动化工具批量配置校验,实现零错纤、零配置差错。与此同时,计算节点搭载DataTurbo存储客户端,配合分布式存储实现训练数据异步保存,支撑秒级断点续训,为后续业务稳定运行打下基础。
验收测试也是保障集群上线质量的关键一环。常规检测手段仅能识别少量显性硬件故障,大量链路、固件隐性问题无法提前发现,极易造成线上业务异常。为此,华为搭建物理、链路、网络、固件、框架五层全覆盖测试体系,分层校验芯片硬件状态、光纤链路损耗、总线互联带宽、驱动固件兼容性及模型长稳运行性能,全方位拦截各类潜在隐患,确保集群达到稳定可用的状态。
从前期规划、现场施工到上线前全链路测试,整套交付流程形成完整闭环,并围绕机房基建、硬件布线、集群组网、业务验证等关键环节建立起标准化管控标准。这一体系有效降低了智算集群部署的返工概率,为互联网大规模算力集群的稳定上线提供了完整的落地保障。
针对性破解训推性能瓶颈,充分释放硬件算力
算力效能又该如何释放?关键在于昇腾全栈调优技术,其能够应对互联网企业在大模型训练与推理中的精度、时延与吞吐挑战。该方案围绕互联网业务中强化学习、长序列推理、实时交互三大核心痛点展开落地实践:
在强化学习场景,针对训推不一致、训练易崩溃的突出痛点,配套标准化RL精度排查工具,能够快速定位Embedding层与反向算子的精度偏差。面向64K超长序列训练任务,TransferQueue异步流式引擎凭借数据流与控制流解耦的创新架构,有效解决了海量数据传输导致的CPU内存溢出及单步训练耗时过长问题。
推理侧的效能优化同样关键。针对MoE混合专家推理、AI Coding长序列核心场景,昇腾提供成套分层优化方案:其中,通用大EP体系搭配SmartMove预取、EPLB异步负载均衡,缩小专家之间悬殊的负载差值;FlexPD-Kvcache支持Prefill与Decode独立并行调优,大幅提升模型推理吞吐;多层次KV Cache池架构兼容vLLM、SGlang等主流推理引擎,依托热点多副本缓存提升命中率,多款代码大模型落地后,TTFT、TPOT等交互指标得到明显改善。
面向互联网实时对话等低时延线上业务,昇腾整合全套原生调优手段,配套完整模型实测数据。优化手段包含CPU细粒度绑核、通用算子融合、HOST与NPU异步调度、Flash Decoding、投机解码。
笔者了解到,昇腾全栈调优技术已在Qwen、DeepSeek等SOTA模型上取得显著成效。其中,RL训练精度对齐周期从1月缩短至1周,单步训练时长从11小时降至6.2小时,推理吞吐提升92%,切实帮助互联网企业加速SOTA模型的高效上线。这也充分验证了昇腾全栈调优技术的实力,为行业提供了一套可复用的算力效能释放路径。
不仅如此,在逛展过程中,笔者还注意到互联网展台展示的全栈AI解决方案,覆盖互联网推荐系统、多模态训练与推理、LLM预训练及MoE推理等核心场景。其中,互联网推荐系统已获头部电商平台采用,效果比肩全球领先水平;LLM预训练大幅降低算力训练成本,已在多家头部公司稳定运行;昇腾大EP方案已落地头部大厂的AI产品中,集群推理性能较原始方案实现翻倍。
写在最后
从单芯片比拼到系统级较量,从算力堆叠到生态协同,AI产业的竞争规则正在改写。作为AI应用的先锋阵地,互联网行业又该如何打造适配的一体化算力解决方案?在2026华为中国政企用户峰会期间的互联网行业圆桌会议上,华为互联网行业通过其在智算基础设施与全栈调优领域的技术实力与实践成果,回应了行业对于大规模智算集群“如何建、如何优、如何用”等关键命题。
可以预见,系统化、生态化、规模化的算力布局,将成为包括互联网在内的各行业释放AI生产力的支撑。此次圆桌探讨不仅为互联网行业的算力升级提供了切实可行的参考路径,更将其经验沉淀为可复制、可落地的实践范本,为更多行业的AI规模化落地开辟了借鉴之道。面向未来,华为将持续以“华为+伙伴”服务体系为基石,将前沿技术转化为千行万业触手可及的生产力,助力更多客户跨越AI落地的技术门槛,共同迈向高效、普惠的AI原生时代。

评论
更多评论