智云时代 NVIDIA Partner

共享 GPU 集群怎么做多租户隔离?NVIDIA 介绍 KAI Scheduler 与 vCluster 方案

技术文章

素材来自 NVIDIA Developer Blog
NVIDIA Developer Blog 展示用 KAI Scheduler 和 vCluster 在共享 GPU 基础设施上为多个团队提供隔离 Kubernetes 集群体验。
共享 GPU 集群怎么做多租户隔离?NVIDIA 介绍 KAI Scheduler 与 vCluster 方案

很多企业和科研机构在建设 GPU 集群后,会遇到一个现实问题:多个团队都要使用 GPU,但每个团队又希望拥有自己的 Kubernetes 环境、权限边界和资源预算。

NVIDIA Developer Blog 给出了一种方案:底层保持一套共享 GPU 资源池,上层通过 KAI Scheduler 做拓扑感知和配额调度,再用 vCluster 为不同团队提供逻辑隔离的 Kubernetes 控制面。

为什么不一定要拆成多个物理集群

为每个团队单独建设 Kubernetes 集群虽然隔离清楚,但会造成 GPU 资源碎片化,管理成本也会快速上升。团队越多,CRD 版本、RBAC 权限、队列预算和调度策略越难协调。

NVIDIA 文章中的模式是在一套主集群里保留 GPU 池,每个团队通过 vCluster 获得独立 API server、控制器、数据存储、同步器和调度体验,从使用感受上接近专属集群。

KAI Scheduler 负责把 GPU 分得更公平

KAI Scheduler 面向 AI 工作负载设计,支持拓扑感知、层级队列、团队配额、动态分配和大规模 GPU 集群调度。它可以与默认 kube-scheduler 并行运行,指定 schedulerName 的 Pod 交给 KAI Scheduler 处理。

文章示例中,三个团队共享一块 NVIDIA L40S GPU,每个团队有自己的队列和资源份额,空闲资源还能被其他团队临时借用,提高整体利用率。

适合内部多团队 AI 平台

vCluster 让不同团队拥有独立 RBAC、命名空间和 CRD,不必共用同一个 kubectl 上下文,也减少了误操作影响其他团队环境的风险。

需要注意的是,GPU 共享并不等同于硬件级显存隔离。文章也提到,如果需要更强隔离,可以结合 NVIDIA MIG,在受支持硬件上做硬件分区,再交给调度系统管理。

对企业 AI 平台来说,这类方案的价值不在于“买更多 GPU”,而在于把现有 GPU 用得更满、更可控。智云时代在规划 GPU 集群时,也会把调度、隔离、配额和运维纳入整体方案,而不是只交付硬件。

原文参考:https://developer.nvidia.com/blog/how-to-run-isolated-tenant-kubernetes-clusters-on-shared-gpu-infrastructure/