9月8日,在KubeCon + CloudNativeCon + OpenInfra Summit + PyTorch Conference China 2026大会期间,致力于构建可持续云原生软件生态系统的 云原生计算基金会(Cloud Native Computing Foundation,CNCF) 宣布,中国领先商业银行之一的招商银行荣获 KubeCon + CloudNativeCon + OpenInfra Summit + PyTorch Conference China 2026 CNCF 最终用户案例研究大赛冠军。
CNCF 首席技术官 Chris Aniszczyk 表示:“随着 AI 工作负载不断扩展至金融等关键基础设施领域,其底层核心技术必须在避免成本同步大幅增长的同时提供更强的计算能力。招商银行通过统一 AI 训练与推理方案,清晰展示了由 CNCF 项目驱动、可组合且厂商中立的基础设施如何在大规模生产环境中带来可量化的效率提升。”
招商银行 AI 基础设施团队将 Kubernetes 与 Kueue、KEDA、Prometheus、HAMi 和 Fluid 相结合,构建统一控制平面,使模型训练、微调与在线推理能够共享近 10,000 张异构加速卡。
通过与数据中心及其他相关团队的紧密协作,招商银行目前已将 99% 的加速计算资源纳入这一统一框架。近 10,000 张加速卡的平均利用率由 35% 提升至 60% 以上;并在同等模型与服务条件下,将每处理 100 万个 Token(包含输入与输出)的成本降低超过 60%。
招商银行 AI 基础设施架构师 PeiXiang Tan 表示:“在招商银行,我们通过软件创新释放硬件的潜力。基于统一的云原生底座,我们的平台整合了异构计算资源池化、训练任务调度、推理弹性伸缩、数据与模型加速访问,以及端到端可观测能力。这让训练与推理可以根据各自不同的工作负载特征采用不同的运行路径,同时又能够紧密协同,从而让每一份计算资源都能够持续创造更高价值。”
随着 AI 在越来越多金融业务场景中落地,招商银行发现,训练、推理以及多租户微调对同一套硬件资源提出了截然不同的要求。
分布式训练需要稳定且可预测的计算容量。当部分 Worker 或加速卡尚未就绪时,已经分配的资源可能处于空闲状态;而在线推理面对不可预测的流量,则需要快速完成弹性扩缩容。
为应对这些相互竞争的资源需求,招商银行构建了一套共享基础设施、解耦运行时的可组合架构:
Kueue 负责训练任务的准入、队列和配额管理,避免任务在尚未具备实际执行条件时提前占用计算容量;
KEDA + Prometheus 根据实时业务负载信号,对在线推理服务进行弹性扩缩容;
HAMi 在训练和推理两类工作负载之间,以细粒度方式分配共享加速计算资源;
Fluid 加速数据集、模型权重和 Checkpoint 的访问,减少加速卡等待数据的时间。
招商银行自主研发的 Twinkle 训练框架进一步提升了多租户微调场景下的资源效率。该框架默认允许 5 个 LoRA 租户共享一个基础模型实例。通过将基础模型副本数量由 5 个减少至 1 个,这一配置可以减少 80% 的加速卡资源使用量,并将训练密度提升 5 倍。
此前,招商银行也曾发布多篇 CNCF 最终用户案例,分享其在 AI 基础设施领域的实践。其中一项案例介绍了基于 Kubernetes 和 HAMi 的调度平台,通过拓扑感知调度实现硬件资源池 100% 利用率,并使分布式训练工作负载的跨机器调度减少 30%。
未来,招商银行计划在现有成果基础上,重点推进以下四个关键领域:
动态调整多租户训练并发度;
将资源利用率、任务队列状态和延迟信号结合起来,建立基于单位成本的容量管理机制;
扩展 KEDA 能力,支持更加 Serverless 化的推理模式,使系统能够在需求峰值之间缩容至零;
扩展基于 HAMi 的异构加速器支持,并增加更多训练和推理后端。

评论
更多评论