大模型推理并行策略

一个 70B 的 Dense 模型塞不进一张 80 GB 的 H100,一个 671B 的 MoE 模型 256 个专家更不可能——这是所有推理工程师都会遇到的第一道墙。解法不是换更大的 GPU,而是把模型拆开、把数据拆开、把计算拆开,让多张 GPU 协作完成推理。「拆」的方式有五种:DP(数据并行)、TP(张量并行)、PP(流水线并行)、EP(专家并行)、SP(序列并行)——它们切的维度完全不同,但真实部署中几乎总是组合使用。

本目录从「切的到底是什么」出发,用统一框架讲清楚五种策略的原理、通信模式和选型决策,并提供交互可视化辅助理解。


1. 内容索引

文件 类型 说明
并行策略总览 入门 DP、TP、PP、EP、SP 五种策略的统一拆解:每种策略切的维度、每张 GPU 持有的内容、KV Cache 分布、通信量与典型场景。建议作为第一篇阅读。
专家并行(EP)深度解析 深度 EP 的独立深度文章:为什么 DP/TP/PP 解决不了 MoE、All-to-All 通信模式、EP+DP 耦合关系、DeepEP 低延迟后端、EPLB 负载均衡、生产环境选型决策。已与 vLLM v0.25+ 和 SGLang 源码校对。
并行策略交互可视化 可视化 浏览器中交互式演示五种并行策略的张量切分与通信模式。

2. 建议阅读路径

  1. 先读 并行策略总览 — 建立五种策略的全局认知,理解 DP/TP/PP/EP/SP 各自的定位
  2. 再读 EP 深度解析 — 如果工作涉及 MoE 模型(DeepSeek-V3/V4、Mixtral 等),这篇是必读
  3. 搭配 并行策略可视化 — 浏览器打开,边读边对照
  4. 延伸 推理优化参考设计 中的并行策略选型章节,以及 DeepSeek-V3 MoE 部署方案 中的 EP=32 实战配置

3. 五种策略速查

策略 切的维度 每张 GPU 持有 KV Cache 通信量 典型场景
DP batch 完整模型 独立 无(多实例)/ 低(引擎内) 吞吐扩展
TP hidden 1/N 权重 分片 极高(All-Reduce) 大模型推理
PP layers 1/N 层 独立 中(P2P) 超大模型
EP experts 1/N 专家 独立 低-中(All-to-All) MoE 推理
SP seq_len 完整模型 分片 中(Ring) 长上下文

生产环境几乎从不使用单一策略。详见 并行策略总览 第七章「混合策略」。