中关村在线

企业站

OpenInfra、CNCF、PyTorch 罕见同台:算力稀缺时代,开源的破局之法

AI 的下半场,卡点会落在哪里?是更大的模型、更强的芯片,还是更聪明的智能体?

9 月 8 日上午,上海。CNCF、OpenInfra、PyTorch 三大开源基金会首次联合举办媒体发布会——三方的年度大会也在同一周同期举行。面对上面这个问题,三位受访人不约而同地将答案指向了同一层:卡点不在模型,在模型之下的基础设施。

出席媒体发布会的是 OpenInfra 基金会总经理 Thierry Carrez(阚雷)、CNCF 执行总监兼 Linux 基金会云与基础设施执行总监 Jonathan Bryce(傅兰石),以及 PyTorch 基金会执行总监 Mark Collier(科理怀)。他们分管三层栈、各有侧重,却不约而同地落到了同一个判断上:AI 基础设施已经不是单点突破的问题,而是整条栈能不能对齐的问题。

三家基金会的分工,原本是三条平行线。OpenInfra 处理最底下的资源抽象,把算力、存储、网络变成可按需切分的池子;CNCF 管编排调度,决定资源怎么分配、回收、复用;PyTorch 基金会离应用最近,决定模型怎么写、怎么在异构芯片上跑起来。三层拼起来,才是从一块 GPU 到一次推理的完整链路。过去这条链由不同社区各自维护,企业得自己当胶水;这一次同台,等于把这件事摆上了台面。

容易被忽略的,还有一层治理底色。三家都是中立基金会,开放治理、许可证可预期。在模型厂商忙着建围墙的当下,这套“谁都不拥有”的结构,反而成了稀缺品。

AI 始于基础设施

这句话,正是 Thierry 当天与媒体分享的其中一页 PPT 的标题。

每一个模型都取决于基础设施。每一项推理服务,都需要一套能高效调度稀缺异构算力的基础设施。每一个智能体,都对隔离与信任提出了新的要求。他随后报出一串数字:全球生产环境中的 OpenStack 核心数创下历史新高,达到 5500 万;其中 76% 运行的是完整的 OpenInfra Blueprint(Linux、OpenStack、Kubernetes 这一整套);2026 年的用户调研显示,三分之一的用户正用 OpenStack 支撑生产环境的 AI/ML 负载。

矛盾也随之而来:加速器难买,谁都在抢,只能把不同来源的算力混着用。“我们的目的是尽可能减少资源消耗,把资源分享给更多用户。对 AI 来说,我们希望 GPU 处在 100% 的使用状态。”Thierry 对媒体说。

两个正在发生的用例,恰好印证了这套逻辑。蚂蚁集团用 Kata Containers 的轻量级虚拟机为智能体做硬件级隔离,再通过 Agent Sandbox 接入 Kubernetes——这背后是更普遍的数据信任问题:66% 的企业拥有目前无法在 AI 流程中使用的私有数据。越南运营商 Viettel 则把型号各异的加速器收进同一个资源池,用 OpenInfra 加 Kubernetes 加 PyTorch/vLLM 的整套开源栈,对外提供多租户推理服务。百度也将于次日在大会上分享从基础设施到 token 服务的全栈开源方案。

智能体把流量曲线掰弯

在 Jonathan 看来,眼下的挑战集中在两个层面。其一是硬件:差异比以往任何一代都大——过去一台服务器就是 CPU、内存加网卡,现在还要区分不同架构的内存、不同层级的存储、不同型号的处理器。KV Cache 该放进内存还是高速存储,得对着具体负载逐层分配。

另一个层面更微妙:交互模式变了。以前是人点一下、输入一次,流量曲线大致可预测;现在换成智能体自己生成请求。“我最近看到一个例子是维基百科——互联网上最忙碌的站点之一。35% 的用户通过 Agent-driven 模式访问,却消耗了超过 60% 的资源。因为 AI 智能体不会遵循人类可预测的行为模式。”Jonathan 对媒体说。

这意味着,沿用已久的容量规划方法正在失效。这也是为什么 CNCF 社区里一批项目正在围绕 AI 负载重构自己——vLLM 能在多个 GPU 上扩展推理规模,而 Karmada 则把多集群编排推向了新的阶段。

云原生底座,开始接 AI 的活

发布会上的一条重磅消息:CNCF 宣布多集群编排项目 Karmada 正式毕业。这个 2020 年 11 月提交第一行代码、2021 年 9 月以 Sandbox 身份加入 CNCF、2023 年 12 月晋升 Incubating 的项目,如今已汇聚来自 292 家组织的 1214 位贡献者,GitHub Star 超过 5600。

CNCF 首席技术官兼 Linux 基金会云与基础设施 CTO Chris Aniszczyk 的评价点出了毕业的分量:随着组织把 Kubernetes 扩展到多集群、以及 GPU 资源受限的 AI 环境,如何以生产级方式协调这些资源,已经成为运营成功的关键。Karmada 达到毕业标准,证明它具备企业要求的技术成熟度、治理和安全实践。

而毕业的时间点,同样耐人寻味。同步发布的 v1.19 把重点放在分布式 AI 训练任务的多组件调度上,基于优先级的调度升至 Beta 并默认启用;2026 年路线图还包括多集群 AI 训练与批处理任务队列、面向 GPU 等加速器的 Kubernetes DRA(动态资源分配)多集群支持。多集群编排过去更多被当作多云容灾工具,现在开始承担分布式训练和跨域推理的调度职责——一个云原生项目的能力边界,正在被 AI 负载重新定义。

率先给出配套答案的,是国内厂商。阿里云把 Karmada 当作统一的多集群编排平面来管理 Qwen 的推理基础设施,GPU 利用率提升 25% 到 30%,可用性达到 99.99%;招商银行则走另一个方向,用 CNCF 项目 HAMi 做 GPU 共享与拓扑感知调度,把硬件池利用率做到 100%,分布式训练的跨机调度开销降了三成。Bloomberg、Trip.com、DaoCloud 等也各自分享了 Karmada 在多区域容灾、混合云容量和 AI Token Factory 架构上的落地经验。

可移植性:开源给锁定开的药方

Mark 则将话题引向了更高一层:可移植性。PyTorch 社区有 12000 名贡献者、覆盖 2000 家组织;vLLM 一年内贡献者增长超过 280%。来自中国开发者的贡献约占 PyTorch 的 44%;按开发者规模计,中国已是 PyTorch 全球第二大贡献群体——在 vLLM 上,中美开发者数量已经打平。

「硬件会不断多样化,但我们不希望软件层面走向碎片化。所有的架构几乎每天都在变,唯一能协调这件事的方法,就是开源。」——Mark Collier

被问及平台锁定时,他的回答有些出人意料:竞争本身就是最好的防锁定手段。开源技术给了市场更多替代方案——可选的模型越多,用户越容易把某个模型搬进自家基础设施里去改。此外,他还透露,开放模型的快速采用与 PyTorch 的增长高度一致:模型不只靠 PyTorch 训练,还可以基于 Ray 等项目微调出专用模型。

发布会当天还宣布了三位 PyTorch 基金会新成员:阿里云(白金)、寒武纪(白金)、蚂蚁集团(黄金)。国产芯片厂商走进成员名单,意味着硬件多样性正在被写进开源项目的路线图,而不是被当成外部变量。

中国市场:从最大的用户群体,走向上游创新的源头

问答环节中,一个关于中国的问题被抛给三位负责人:中国企业与开发者,如何更深入地参与 CNCF、OpenInfra、PyTorch 社区,从用户走向上游共建者?

三位负责人的回应里,中国市场的分量被反复提及。Mark 在演讲中给出了一组数字:来自中国的开发者贡献了 PyTorch 约 44% 的代码,按开发者规模计已是全球第二大贡献群体;在 vLLM 上,中美开发者数量已经打平。「中国在上游贡献、社区活跃度以及各技术栈的参与度上,都发挥着至关重要的作用。」他说。

支撑这份底气的,还有体量。OpenInfra 十一万成员中 10% 来自中国,是全球第三大社区;CNCF 统计中国有 175 万云原生开发者,其中约 40 万专注 AI 流水线。面向这样的社区,Mark 的邀请很直接——希望更多中国公司加入会员、参与共建;Thierry 则向中国用户发出举手之约:分享自己怎么用、遇到了什么问题,这才是参与的第一步。在开源社区里,使用经验的公开本身就是最有价值的贡献。

Jonathan 从另一个角度佐证了中国的位置:其他市场的公司通常直接采购 Anthropic、OpenAI 的服务,而在中国,开源是第一选项。他以招商银行为例——这家服务 2.5 亿用户的银行,用完全开源的基础框架结合 DeepSeek 等前沿模型拼出自己的组合。我们看到中国公司正在领导开源技术和开源 AI 的开发。

在硬件侧,信号同样清晰。中国的硬件创新密集涌现,越来越多芯片公司意识到,软件是自家硬件走向市场最快的路,而开源是最有效的方式——寒武纪以白金成员身份加入 PyTorch 基金会,正是这一逻辑的注脚。为了让中国开发者的参与有更顺手的入口,CNCF 还在中国成立了 CNCC(Cloud Native Community China),由本地社区领袖组织各地活动。

在三位负责人眼中,中国早已不只是全球最大的开源用户市场,更是创新不可或缺的源头。对于三大基金会而言,如何接住中国开发者的能量,已经是一个战略级的命题。

为什么是三方:一条 AI 链路,三层缺一不可

被问到“为什么是三家”,Chris Aniszczyk 的回答几乎不用展开:“要在任何芯片、任何云、任何智能体上运行基础设施,一个项目无法做到,一个基础设施也无法做到。”三大基金会各管一层,各自都能讲出一套路线图,但 AI 负载跨过整条栈——资源抽象、编排调度、模型框架——站到一起,才算把链路补齐。

这条链过去是断的。企业得自己当胶水,把 OpenStack、Kubernetes、PyTorch 拼在一起用;AI 负载把对延迟、利用率、隔离性的要求抬高之后,胶水层的工程量和风险,已经超出任何一家企业单独维护的能力。三家基金会联合起来,等于把这道工序从企业手里接了过去。

算力这边,账更现实。GPU 一卡难求,企业被迫把不同厂商、不同型号的加速器混着用;硬件越多样,软件越容易碎片化。要解开这个结,只能三层一起动:OpenInfra 把异构硬件抽象成统一资源池,CNCF 在多集群间调度分配,PyTorch 让模型在任意芯片上跑起来。前面提到的招商银行、阿里云能交出那样的利用率数字,前提都是这三层在协同工作。

更深一层,是竞争的单位变了。行业正从模型时代迈向系统时代,模型几乎每天都在更新,训练与推理的边界正在消融,创新的速度取决于信息在整条栈里的流动——模型层的新需求要被调度层和资源层快速消化,硬件层的新能力要被框架层快速吸纳。没有哪家公司能独自维护这么多层,基金会的价值,恰恰在于提供一个中立的协作界面,让竞争的厂商愿意把代码放进同一层公共地基。

问答环节里,Chris 提及了另一句容易被忽略的问题:基金会的角色,是“充当桥梁,将不同的业界、学界和产业界的人聚集一堂”。AI 从实验室走进生产环境,技术问题背后,是算力谁出、标准谁定、代码谁维护的协作问题。三家基金会把发布会办到一起,做的正是这件事:把各自维护的那一层,接到同一条链上。

写在最后

一个多小时结束得很快,随后是合影和寒武纪加入 PyTorch 基金会的签约仪式。台上三个人讲的虽然大部分是 Kubernetes、OpenStack、PyTorch 这些开源的技术名词,落到最后却是同一件事:AI 已经跑进生产环境,接下来要较量的不是谁的模型更聪明,而是谁能把手里那些昂贵、异构、又不太听话的算力真正用起来。

Mark 在收尾时把视野拉得更远:我们正从模型时代迈向系统时代。信息流动得越快,系统就学得越快。构建开放的系统,让社区和生态自由交流,模型就会越学越快。这句话放在这场发布会上,更像是在描述正在发生的事:同一天,Karmada 官宣毕业,寒武纪签约为白金成员。模型在快速更替,承载模型的那条开源栈,正在被越来越多的厂商和开发者一起维护。

展开全文
人赞过该文
内容纠错

相关电商优惠

评论

更多评论
还没有人评论~ 快来抢沙发吧~

读过此文的还读过

点击加载更多

内容相关产品

说点什么吧~ 0

发评论,赚金豆

收藏 0 分享
首页查报价问答论坛下载手机笔记本游戏硬件数码影音家用电器办公打印 更多

更多频道

频道导航
辅助工具