大模型推理并行策略
一个 70B 的 Dense 模型塞不进一张 80 GB 的 H100,一个 671B 的 MoE 模型 256 个专家更不可能——这是所有推理工程师都会遇到的第一道墙。解法不是换更大的 GPU,而是把模型拆开、把数据拆开、把计算拆开,让多张 GPU 协作完成推理。「拆」的方式有五种:DP(数据并行)、TP(张量并行)、PP(流水线并行)、EP(专家并行)、SP(序列并行)——它们切的维度完全不同,但真实部署中几乎总是组合使用。
本目录从「切的到底是什么」出发,用统一框架讲清楚五种策略的原理、通信模式和选型决策,并提供交互可视化辅助理解。
1. 内容索引
| 文件 | 类型 | 说明 |
|---|---|---|
| 并行策略总览 | 入门 | DP、TP、PP、EP、SP 五种策略的统一拆解:每种策略切的维度、每张 GPU 持有的内容、KV Cache 分布、通信量与典型场景。建议作为第一篇阅读。 |
| 专家并行(EP)深度解析 | 深度 | EP 的独立深度文章:为什么 DP/TP/PP 解决不了 MoE、All-to-All 通信模式、EP+DP 耦合关系、DeepEP 低延迟后端、EPLB 负载均衡、生产环境选型决策。已与 vLLM v0.25+ 和 SGLang 源码校对。 |
| 并行策略交互可视化 | 可视化 | 浏览器中交互式演示五种并行策略的张量切分与通信模式。 |
2. 建议阅读路径
- 先读 并行策略总览 — 建立五种策略的全局认知,理解 DP/TP/PP/EP/SP 各自的定位
- 再读 EP 深度解析 — 如果工作涉及 MoE 模型(DeepSeek-V3/V4、Mixtral 等),这篇是必读
- 搭配 并行策略可视化 — 浏览器打开,边读边对照
- 延伸 推理优化参考设计 中的并行策略选型章节,以及 DeepSeek-V3 MoE 部署方案 中的 EP=32 实战配置
3. 五种策略速查
| 策略 | 切的维度 | 每张 GPU 持有 | KV Cache | 通信量 | 典型场景 |
|---|---|---|---|---|---|
| DP | batch | 完整模型 | 独立 | 无(多实例)/ 低(引擎内) | 吞吐扩展 |
| TP | hidden | 1/N 权重 | 分片 | 极高(All-Reduce) | 大模型推理 |
| PP | layers | 1/N 层 | 独立 | 中(P2P) | 超大模型 |
| EP | experts | 1/N 专家 | 独立 | 低-中(All-to-All) | MoE 推理 |
| SP | seq_len | 完整模型 | 分片 | 中(Ring) | 长上下文 |
生产环境几乎从不使用单一策略。详见 并行策略总览 第七章「混合策略」。