中关村在线

热点资讯

微软提出全栈协同设计破局AI存储与功耗瓶颈

2026年9月14日,微软Azure硬件系统与基础设施负责人拉尼·博尔卡尔指出,当前人工智能基础设施所面临的瓶颈,并非单纯依靠扩大存储芯片产能即可缓解。她强调,存储问题本质上是系统性挑战,而非简单的供应链或元器件供应问题。

随着AI推理模型规模持续扩大、对话上下文长度显著增加,存储带宽与电力供给正逐渐超越计算能力,成为更难以逾越的硬性制约因素。当前多数AI系统采用多层级架构,受制于数据传输延迟与互连带宽限制,实际计算资源利用率往往不足两成。

对此,博尔卡尔提出“从芯片到系统”的全栈协同设计路径,覆盖模型结构、编译优化、芯片架构、高速互联网络以及供电管理等关键环节,进行深度联合调优。其核心目标是在既定存储容量与电力预算前提下,提升计算单元的持续活跃度,从而在单位时间内生成更多有效输出。

以微软自主研发的AI加速器Maia 200为例,该芯片并未依赖简单堆叠存储容量来应对瓶颈。它基于台积电3纳米制程工艺,集成216GB HBM3e高带宽内存,并同步在模型轻量化、数据处理方法与硬件架构设计三个维度发力,显著压缩键值缓存(KV Cache)占用。

在网络层面,微软构建了双层Scale-up互连体系,将网络接口控制器直接嵌入芯片内部,并配合定制化传输协议栈。此举不仅大幅降低通信延迟,也减少了因网络拥塞、故障恢复延迟或配置偏差导致的加速器闲置现象。

电力系统亦经历深刻重构。单台AI机柜功耗已由早先的数十千瓦跃升至数百千瓦量级,整个数据中心园区按吉瓦级电力需求进行整体规划。微软为此引入固态变压器与800伏直流供电架构,并在Cobalt 200处理器的每一枚计算核心中集成精细化电压与时钟控制模块。

博尔卡尔指出,任何单一技术突破都无法单独解除系统瓶颈,但当上述多项创新协同作用时,却能显著提升单位存储与单位电力所能支撑的有效算力输出。微软由此提出的“有效产出”评估维度,正推动人工智能基础设施的竞争焦点,从芯片数量的叠加转向系统级综合效率的深度比拼。

展开全文
人赞过该文 赞
内容纠错

相关电商优惠

评论

更多评论
还没有人评论~ 快来抢沙发吧~

读过此文的还读过

点击加载更多

内容相关产品

说点什么吧~ 0

发评论,赚金豆

收藏 0 分享
首页查报价问答论坛下载手机笔记本游戏硬件数码影音家用电器办公打印 更多

更多频道

频道导航
辅助工具