GPU 调度——从”够不够”到”快不快”

K8s 默认调度器把 GPU 当成标量资源(nvidia.com/gpu: 1),对于单 GPU 作业够用,但对于 AI 集群的真实负载有三个盲区:GPU 碎片化、拓扑不感知、Gang Scheduling 缺失。

本目录从这三个盲区出发,逐层展开解决方案。

文档

# 文档 内容
01 GPU 调度问题总览 碎片化、拓扑不感知、Gang Scheduling 三个盲区的分析
02 Gang Scheduling Volcano Coscheduling vs K8s SchedulingGates,All-or-Nothing 调度
03 拓扑感知调度 NVLink/NUMA/跨节点三层拓扑感知 + NVIDIA Topology-Aware Scheduler
04 GPU 共享调度 MIG(硬切分)、MPS(计算共享)、Time-slicing(时分)在 K8s 中的表达

相关资源

概念层(本文)→ 实现层(进阶)