近日,国产大模型Kimi K3正式发布,凭借2.8万亿参数的规模,其综合性能已跻身全球顶尖行列,在前端编程等特定任务上表现尤为突出。要充分释放Kimi K3的潜力,高性能AI计算平台不可或缺。
从硬件适配角度看,当前市面上已量产的平台中,NVIDIA Blackwell架构的B200与B300芯片在理论算力上处于领先位置。但Kimi K3在设计之初即兼顾国产平台兼容性,并针对主流国产AI芯片进行了深度优化。有海外技术社区用户基于公开技术参数,对华为昇腾950DT与NVIDIA B300在运行Kimi K3时的能效表现进行了建模对比。由于昇腾950DT在国内尚处于初期部署阶段,海外尚未实现实际设备交付,该对比未基于实机测试,而是依托芯片规格参数进行系统级仿真推演。
对比对象除B300外,还包括华为前代产品昇腾910C。结果显示,在单位功耗下生成Token的数量这一关键能效指标上,昇腾950DT展现出明显优势。值得注意的是,其采用的制程工艺较B300落后两代,却仍能在整体系统效率层面实现反超,凸显出华为在异构计算架构、软硬协同与系统级优化方面的深厚积累,也印证了其长期坚持的“韬定律”技术路径的前瞻性与有效性。
昇腾950系列包含两款面向不同场景的型号:昇腾950PR与昇腾950DT。二者共享同一计算核心,但在内存子系统设计及目标应用领域上存在显著差异。昇腾950PR搭载昇腾950核心与HiBL 1.0内存方案,专为推理过程中的Prefill阶段及推荐类业务优化,在保障性能的同时,显著降低对高成本HBM3e或HBM4e内存的依赖,从而有效控制整体部署成本。
昇腾950DT则聚焦于推理Decode阶段与大模型训练场景。针对这两类任务对内存带宽与互联带宽的严苛要求,华为自主研发HiZQ 2.0内存架构,实现单卡144GB内存容量与4TB/s内存访问带宽,并将芯片间互联带宽提升至2TB/s。
基于昇腾950DT构建的Atlas 950超节点集群,最大支持8192张计算卡高速互联。该规模是上一代Atlas 900超节点(384卡)的21倍以上,亦为NVIDIA NVL144方案的56.8倍。整套集群具备8EFLOPS的FP8算力与16EFLOPS的FP4算力,总互联带宽达16.3PB/s,内存总量达1152TB。相较Atlas 900超节点,其训练吞吐能力提升17倍,达到4.91百万Token每秒。

评论
更多评论