模块 4:Kubernetes 入门与 GPU 工作负载调度
| 120 分钟 |
52 页 PPT |
3 个 YAML 文件 |
2 个可视化 HTML |
从单机 GPU 操作走向集群级 GPU 编排。核心问题:「你有 100 台 GPU 服务器,怎么管理 1000 个 GPU 应用?」— K8s 入门 → Device Plugin → DRA → GPU 调度实战。
本章内容
| 部分 |
时长 |
PPT 页 |
重点内容 |
动手 |
| K8s 入门 |
35 min |
3–18 |
Pod/Deployment/Service、声明式、控制循环 |
第 16 页: 部署 Nginx |
| Device Plugin 机制 |
25 min |
19–28 |
ListAndWatch/Allocate、NVIDIA DP 时序、CDI 演进 |
— |
| DRA — 动态资源分配 |
30 min |
29–40 |
ResourceClaim/ResourceClass、拓扑感知、Kueue 队列 |
第 47 页: DRA Claim 概念演示 |
| GPU 调度策略与动手实践 |
30 min |
41–52 |
Filter/Score/Bind、GPU 拓扑调度、全链路回顾 |
第 45 页: GPU Pod + 第 46 页: 资源争抢 |
可视化 HTML
配套代码
详见 code/README.md。
课堂练习
详见 hands-on-exercise.md。
课后作业
详见 homework.md。实验环境搭建见 lab-environment.md。
参考资料