中关村在线

平板电脑

AI 算力扩张下的云网络重构:腾讯云7篇论文入选网络/系统领域国际顶会

当大模型训练迈入万卡集群的规模阶段,网络正在成为AI算力扩张的关键瓶颈。面对这一整套基础设施命题,腾讯云给出了自己的解法:截至8 月 21 日,腾讯云已在全球网络与系统领域CCF-A类国际顶会累计发表7篇关键论文,其中 5 篇收录于第 40 届SIGCOMM会议,另外两篇分别入选 NSDI 2026、NSDI 2027。

这些技术沉淀全部来自于腾讯云线上真实生产系统,覆盖 AI 服务器网络、DPU 硬件、公有云 RDMA 虚拟化、主机转发加速、智能网卡、异构网关与 VPC 高可用等完整技术链条。在国内云厂商同类技术探索中,腾讯云这种单一方向、成体系的产出,体现的是面向 AI 时代长期积累的工程沉淀,正在兑现为持续的技术突破。

缓解AI网络成本焦虑:低开销+高性能+原生管理

业界传统上会分开建设三类能力:用于大模型训练的高带宽网络、支撑部署运维和存储业务的业务网络,以及面向租户的虚拟化能力。但 AI 算力场景对管控、运维与租户体验提出了新要求,需要将上述能力实现整体交付。当前的通行方案是在原有架构基础上追加 DPU,并外挂专用控制器完成统一管理。每块 DPU 除承担高速数据转发外,还配备独立的管理算力与内存资源。但 AI 训练流量特征表现为流量大、负载稳定,带宽需求持续攀升,而控制面的管理开销基本保持恒定。这就导致批量部署 DPU 时,会重复购置大量得不到充分利用的管理算力资源;外置控制器则进一步增加硬件投入,抬高整体部署成本与运维复杂度。

论文《DistDPU: A Disaggregated DPU Architecture for High-Performance and Cost-Efficient AI Clouds》(解耦式DPU架构)在体系结构层面给出解法:将DPU拆分为承担编排与管理职责的Orchestration Module,以及负责高速转发的Execution Module,管理功能集中在一处,服务器扩展带宽时只增加后者,一台AI服务器的网络在机内形成闭环。这一架构不绑定特定互联形态,既可基于PCIe,也能兼容NVLink等机内互联。论文披露,该架构支持单机最高3.6Tbps带宽,对比多DPU堆叠方案最高降低单节点硬件成本77.1%、功耗59.3%,已在生产环境运行超过20个月,服务超过1万块GPU。

带宽扩展之后,多租户要在同一朵云里安全共享这些算力,同时保住训练性能。论文《Pegasus: A Data Center Network for Bare-Metal AI Cloud》(裸金属AI云数据中心网络)细化了解耦架构中执行单元一侧的设计:一块DPU虚拟化管理多张RNIC,减少GPU服务器内DPU的重复配置;两者经服务器原生的PCIe通道互联,DPU对RNIC的管控、云化流表的部署和运维信息的采集都在机内完成,不需要外挂专门的管理网络;DPU与RNIC上的两级流表完成地址转换与租户隔离,多租户隔离与性能无损同时成立;面向AI应用的流量需求,逐包负载均衡和基于信用量的拥塞控制交由RNIC硬件执行。截至2026年2月,该网络覆盖8000块GPU,70B稠密模型训练性能提升7.5%,7B MoE模型提升4.8%,LLaMA 7B训练提升53.2%,推理吞吐提升3.7%,用户请求平均完成时间降低7.2%。

RDMA让数据绕开操作系统内核直接传输,是AI训练和推理的关键传输方式,也是解耦架构中负责编排管理的DPU要接住的一环。进入多租户的云环境后,虚拟化让性能打折,租户之间互相干扰,网络规则也难以在线调整。论文《SkyRDMA: Fully Offloaded Cloud RDMA Virtualization》(全硬件卸载云RDMA虚拟化)将这层虚拟化能力整体迁移到网卡:CPU密度提高后,基于multi-root PCIe的socket-direct RNIC让单张网卡直连多个CPU socket,避免RDMA流量跨socket绕行;网卡上同时承载RDMA、VPC云网络、云盘、虚拟化等混合流量,分层QoS在网卡端口与PCIe传输两层共同执行隔离;vRDMA驱动拆分为前后两端,租户侧只保留轻量的前端,重操作和与硬件耦合的管控全部下移到网卡内嵌SoC,后端升级与变更对客户无感,也不入侵客户系统。实验显示,vRDMA性能接近裸金属,其QoS隔离机制将背景流量干扰下时延敏感业务的小消息时延最多降低6.2倍,控制面热更新耗时2.09至3.27毫秒且业务零停机,存量RDMA应用无需修改代码即可迁移。

升级云网络底层性能:扛住流量激增、密度暴涨两大重压

另一重压力来自传统云业务自身的升级。一边是流量,AI Agent、电商搜广推、游戏等业务对网络流量的请求持续增加;一边是密度,单位服务器能够支撑的CPU核数接近每年翻番,单机承载的会话规模随之膨胀。一条新连接到达时,主机网络要完成路由查找、ACL与安全组策略匹配、会话建立等一串操作;电商大促、游戏对战、微服务调用这类短连接密集型业务,会把新建流的压力持续放大,有大型客户的需求已达到单机每秒数十万乃至上百万次新建连接。硬件化可以提高效率,但云网络策略随租户需求持续变化,租户随时通过云API调整规则,系统必须保留快速调整的能力。

云主机上的新建连接,大多由DPU里的软件来处理。服务器核数和带宽不断升级,新建连接越来越多,这段软件最先成为瓶颈。论文《XFir: Accelerating New-Flow Setup on Host Servers of a Large Cloud Network》(云主机新流建立加速)将新流建立逻辑交给DPU内置的云网络协处理器执行,重新设计数据通路与查表结构,同时保留软件调整能力,兼顾性能与业务迭代的灵活性。实测单机新建流处理能力超过77.6万CPS,慢路径时延11.7微秒,较此前方案Fornax提升4.8倍CPS、降低69.2%时延,每台主机只需一块DPU。

另一项压力在智能网卡的会话表。网卡靠这张表记住每条连接,后续流量才能直接走硬件加速,表的容量决定能覆盖多少业务。腾讯云对约1.2万台主机的观测显示,12.1%的主机会话表超过百万条,最高达1600万条,比行业惯常规模高出一个数量级。行业惯例是用高速但昂贵的SRAM或HBM内存装下这张表,而代价是网卡要部署到数百万台服务器,这笔成本难以承受。论文《Dorado: Scaling SmartNIC Session Tables on Commodity DDRs》(SmartNIC会话表扩展)将会话表整体放在廉价的商用DDR内存上,重新设计表结构、处理流程与访存调度,保住了与高速内存同档的处理速度。在更少硬件资源下,其包处理速率提升33%,内存成本降低80%,支持1600万会话表项与50Mpps线速处理,已部署在数百万台服务器上运行超过三年。

分钟级故障定位、亚秒级流量恢复,构建一朵“超级云”

网络在正常运行时的吞吐和时延容易被测量,故障时刻的表现更能说明一朵云的实际质量。万卡集群中,一处路径异常可能波及多条业务;云网关由软件服务器、可编程交换机和FPGA等多种设备组成,出了问题往往要跨设备排查。

论文《CubeTrace: Microscopic Network Tracing for Heterogeneous Cloud Gateways》(异构云网关微观追踪)提出统一的追踪方法,把不同硬件上的处理环节标准化为同一类追踪单元,让一条网络流经过的每个环节都有记录可查,把丢包和时延问题定位到具体功能环节。该系统已在生产网关运行超过300个追踪单元,内存开销低于1%,将问题定位时间从数小时乃至数天缩短至分钟级。

把定位时间压到分钟级后,下一道关是流量恢复。论文《Harp: Improving VPC Network Availability via Efficient Failure Detection and Rerouting in Tencent Cloud》(VPC网络高可用)利用交换机的多路径转发特性,为每对通信主机维护一组可用物理路径并持续探测,故障发生时流量在亚秒级切换到健康路径,整个方案以软件实现,不依赖特定硬件或传输协议。论文披露,Harp将VPC网络中断时间降低78.71%至99.97%,已在腾讯云部署超过两年。

AI算力规模化之后,云网络要同时管住三件事:成本、性能与故障恢复。腾讯云这7篇论文共同回答了这些约束。它给出的路径,是把高频的转发处理交给网卡和DPU,把控制和诊断留给软件,让规模扩张、成本控制与稳定性改进同步完成。这些探索改变了算力的成本结构、训练与推理的效率,以及故障对业务的影响。当算力规模继续扩大,云网络如何被重新组织,正在成为云厂商之间的新竞争变量。

展开全文
人赞过该文
内容纠错

相关电商优惠

评论

更多评论
还没有人评论~ 快来抢沙发吧~

读过此文的还读过

点击加载更多

内容相关产品

说点什么吧~ 0

发评论,赚金豆

收藏 0 分享
首页查报价问答论坛下载手机笔记本游戏硬件数码影音家用电器办公打印 更多

更多频道

频道导航
辅助工具