中关村在线

热点资讯

llm-d开源项目原生支持沐曦曦云C系列GPU,成首个国产GPU官方加速器

2026年9月8日,云原生分布式推理开源项目llm-d正式支持沐曦曦云C系列GPU,成为该项目官方加速器列表中首个获原生支持的国产GPU型号。

llm-d由Red Hat发起,底层依托vLLM、SGLang等主流推理引擎,并深度集成Kubernetes调度能力,目前由云原生计算基金会托管。项目重点围绕前缀缓存感知路由、负载感知调度以及Prefill与Decode阶段分离等核心机制展开建设,在GitHub平台已获得超过四千四百颗星标。

英伟达GPU、谷歌TPU、AMD GPU、英特尔XPU等国际主流算力平台均已在社区内完成部署实践并提供标准化指南。此次沐曦股份联合密瓜智能,率先完成曦云C系列GPU在llm-d生态中的全栈适配,成功验证了单卡、多卡及Prefill/Decode分离三种典型推理部署模式在该硬件平台上的可行性与稳定性。

大模型应用落地,芯片性能仅是起点;能否无缝融入云原生推理调度体系,才是真正影响规模化服务能力的关键环节。过去,国际主流开源项目多以境外芯片为默认设计前提,即便国产GPU已可运行通用推理框架,用户仍需投入大量精力处理底层兼容性与调度适配问题。本次集成实质性打通了从硬件到生产级推理系统的最后一环,为曦云C系列GPU提供了三条即开即用的部署路径:

其一为优化基线单卡路径:采用Qwen3-14B模型、张量并行度设为1,全面验证曦云C系列在llm-d标准服务栈下的基础推理能力;

其二为优化基线八卡路径:选用DeepSeek-R1-Distill-Llama-70B模型、张量并行度设为8,验证单机八卡配置下支撑超大规模参数模型的服务能力;

其三为Prefill/Decode分离路径:以Qwen3-14B模型配合Prefill加单Decode实例的拓扑结构运行,通过vLLM NixlConnector与llm-d路由Sidecar协同,实现KV缓存跨实例高效传输。

在性能实测方面,团队已在曦云C系列GPU上完成llm-d推理路由器的完整基准测试:Qwen3-14B单卡配置下,Prefill阶段峰值吞吐达每秒5773个token;DeepSeek-R1-Distill-Llama-70B八卡配置下,对应数值为每秒5468个token。上述两组实测数据已正式纳入llm-d社区公开性能标定矩阵,国内用户在沐曦平台部署时,可直接调用基于真实硬件环境生成的性能基准,显著降低工程落地门槛。

展开全文
人赞过该文
内容纠错

相关电商优惠

评论

更多评论
还没有人评论~ 快来抢沙发吧~

读过此文的还读过

点击加载更多

内容相关产品

说点什么吧~ 0

发评论,赚金豆

收藏 0 分享
首页查报价问答论坛下载手机笔记本游戏硬件数码影音家用电器办公打印 更多

更多频道

频道导航
辅助工具