中关村在线

热点资讯

Kimi K3大模型发布,昇腾950DT能效反超B300,国产AI算力实现重大突破

近日,国产大模型Kimi K3正式发布,凭借2.8万亿参数的规模,其综合性能已跻身全球顶尖行列,在前端编程等特定任务上表现尤为突出。要充分释放Kimi K3的潜力,高性能AI计算平台不可或缺。

从硬件适配角度看,当前市面上已量产的平台中,NVIDIA Blackwell架构的B200与B300芯片在理论算力上处于领先位置。但Kimi K3在设计之初即兼顾国产平台兼容性,并针对主流国产AI芯片进行了深度优化。有海外技术社区用户基于公开技术参数,对华为昇腾950DT与NVIDIA B300在运行Kimi K3时的能效表现进行了建模对比。由于昇腾950DT在国内尚处于初期部署阶段,海外尚未实现实际设备交付,该对比未基于实机测试,而是依托芯片规格参数进行系统级仿真推演。

对比对象除B300外,还包括华为前代产品昇腾910C。结果显示,在单位功耗下生成Token的数量这一关键能效指标上,昇腾950DT展现出明显优势。值得注意的是,其采用的制程工艺较B300落后两代,却仍能在整体系统效率层面实现反超,凸显出华为在异构计算架构、软硬协同与系统级优化方面的深厚积累,也印证了其长期坚持的“韬定律”技术路径的前瞻性与有效性。

昇腾950系列包含两款面向不同场景的型号:昇腾950PR与昇腾950DT。二者共享同一计算核心,但在内存子系统设计及目标应用领域上存在显著差异。昇腾950PR搭载昇腾950核心与HiBL 1.0内存方案,专为推理过程中的Prefill阶段及推荐类业务优化,在保障性能的同时,显著降低对高成本HBM3e或HBM4e内存的依赖,从而有效控制整体部署成本。

昇腾950DT则聚焦于推理Decode阶段与大模型训练场景。针对这两类任务对内存带宽与互联带宽的严苛要求,华为自主研发HiZQ 2.0内存架构,实现单卡144GB内存容量与4TB/s内存访问带宽,并将芯片间互联带宽提升至2TB/s。

基于昇腾950DT构建的Atlas 950超节点集群,最大支持8192张计算卡高速互联。该规模是上一代Atlas 900超节点(384卡)的21倍以上,亦为NVIDIA NVL144方案的56.8倍。整套集群具备8EFLOPS的FP8算力与16EFLOPS的FP4算力,总互联带宽达16.3PB/s,内存总量达1152TB。相较Atlas 900超节点,其训练吞吐能力提升17倍,达到4.91百万Token每秒。

展开全文
人赞过该文
内容纠错

相关电商优惠

评论

更多评论
还没有人评论~ 快来抢沙发吧~

读过此文的还读过

点击加载更多

内容相关产品

说点什么吧~ 0

发评论,赚金豆

收藏 0 分享
首页查报价问答论坛下载手机笔记本游戏硬件数码影音家用电器办公打印 更多

更多频道

频道导航
辅助工具