# Token Factory：AI 推理的成本革命 - PPT 大纲设计（2026 年 8 月）

## 总体设计说明

- **总页数**: 40页
- **演讲时长**: 85分钟 + 5分钟 Q&A = **90分钟**
- **平均每页时间**: ~2.1分钟
- **时间分配**: 一 12 + 二 17 + 三 22 + 四 22 + 五 12 + 六 5 = 90（含 Q&A 5 分钟，实际演讲 85）
- **核心主线**: 一切 AI 基础设施优化的最终目标，都是降低**每 token 成本**。讲座沿"模型架构 → 硬件 → 推理引擎 → 基础设施与生态"四层杠杆展开，每一层回答同一个问题：这层如何让 token 变便宜？
- **设计风格**: 现代科技风，深蓝+橙色主题（成本曲线用橙色强调）
- **目标听众**: 普通读者，不需要编程背景

---

## 第一部分：Token 工厂（第1-5页，10分钟）

## 第1页：封面页

**标题**: Token Factory：AI 推理的成本革命
**副标题**: 大模型如何从奢侈品变成水电

**内容**:

- 演讲者：Grissom
- 日期：2026年8月

**排版建议**:

- 大标题居中，粗体字
- 背景：token 流动的科技感视觉
- 底部添加机构Logo

---

## 第2页：议程概览

**标题**: Agenda：四层杠杆，一个目标
**内容**:

- **Token 工厂：AI 经济的基本单位** (12分钟)
- **第一层杠杆：模型架构——让效率成为架构设计** (17分钟)
- **第二层杠杆：硬件——GPU 的极限压榨** (22分钟)
- **第三层杠杆：推理引擎——软件定义的成本** (22分钟)
- **第四层杠杆：基础设施与生态——价格战与新形态** (12分钟)
- **总结：成本下降 100 倍意味着什么** (5分钟)

**排版建议**:

- 时间轴布局，显示四层杠杆的递进关系
- 每层用不同颜色，箭头指向"每 token 成本"

---

## 第3页：Token 是什么？

**标题**: 🪙 Token：AI 经济的基本单位
**内容**:

- **Token 的定义**
  - AI 处理文本的最小单位（约 0.7 个汉字 / 4 个英文字符，即 1 个汉字约 1-1.5 个 token）
  - 模型"思考"和"回答"都以 token 计量
  - 一次对话 = 输入 token + 输出 token
- **为什么 token 是经济单位**
  - 所有模型按 token 计费
  - 推理成本 ≈ 每 token 成本 × token 数量
  - **Token 工厂的比喻**：AI 服务商就是"token 工厂"，衡量工厂效率的唯一指标是每 token 成本
- **一个直观数字**
  - 读一本 10 万字的书 ≈ 15 万 token
  - 生成一篇 2000 字文章 ≈ 3000 token

**排版建议**:

- token 计费示意（输入+输出）
- 实物类比图（书、文章 ↔ token 数量）

---

## 第4页：token 的价格革命

**标题**: 📉 四年，token 价格下降 100 倍
**内容**:

- **价格曲线（每百万 token，输出）**
  - GPT-4 (2023)：$60
  - GPT-4o (2024)：$15
  - GPT-5.5 (2026)：$30（能力远强于 GPT-4）
  - Claude Fable 5 (2026)：$50（SWE-bench 95% 的顶级能力）
  - **DeepSeek-V4 Pro (2026.7)：$0.18——约为 GPT-5.6 Sol（$5）的 1/28**
- **同能力价格 vs 同价格能力**
  - 按"达到 GPT-4 水平"折算：2026 年价格是 2023 年的 **1/100 以下**
  - 按"1 美元能买到什么"：2023 年买 1.7 万 token → 2026 年买 550 万 token
- **核心问题：这 100 倍是怎么来的？**
  - 不是某一个突破，而是四层杠杆的叠加
  - 这就是今天讲座的主线

**排版建议**:

- 对数坐标价格曲线（必须用对数轴，线性轴看不出 100 倍）
- "1 美元能买多少 token"对比图
- 四层杠杆预告图

---

## 第5页：四层杠杆总览

**标题**: 🏗️ 降低 token 成本的四层杠杆
**内容**:

- **第一层：模型架构**——让模型用更少计算达到同等质量
  - MLA 压缩 KV Cache、MoE 稀疏激活、线性注意力
- **第二层：硬件**——让每块 GPU 产出更多 token
  - Blackwell FP4、HBM 带宽、NVLink
- **第三层：推理引擎**——让软件吃干榨净硬件
  - KV Cache 管理、连续批处理、投机解码
- **第四层：基础设施与生态**——让集群跑得更满、价格战更狠
  - PD 分离、GPU 共享、开源定价

**排版建议**:

- 四层叠层图，每层标注贡献
- 箭头指向"每 token 成本 ↓"

---

## 第二部分：第一层杠杆——模型架构（第6-11页，15分钟）

## 第6页：Transformer 工作原理（快速回顾）

**标题**: 🧠 大模型如何工作：90 秒版
**内容**:

- **Transformer 的核心**
  - 注意力机制：模型在看当前词时，知道该关注前面哪些词
  - Query/Key/Value 三元组
  - 自回归生成：每次预测下一个词（token）
- **推理的代价**
  - 每生成一个 token，都要重新计算一遍
  - 已生成的 token 的中间结果（KV Cache）可以复用
  - **KV Cache 越大，每 token 成本越高——这是第一层杠杆的突破口**

**排版建议**:

- 简化的注意力示意图
- KV Cache 复用示意

---

## 第7页：效率革命 1：MLA——把 KV Cache 压缩 93%

**标题**: 🪄 MLA（DeepSeek V2）：KV Cache 压缩 93.3%
**内容**:

- **问题**：标准注意力下，KV Cache 随序列长度线性增长
  - 长对话/长文档 → KV Cache 占满显存 → 成本飙升
- **MLA 的解法**：把高维 KV 投影到低维潜在空间
  - KV 维度：4096 → 512（压缩 8 倍）
  - KV Cache 减少 93.3%
  - 注意力质量几乎无损失
- **行业影响**：MLA 成为 2024-2026 年主流架构（DeepSeek、GLM 等）

**排版建议**:

- 压缩示意图（高维 → 低维潜空间）
- KV Cache 大小对比柱状图

---

## 第8页：效率革命 2：MoE——只激活 5.5% 的参数

**标题**: ⚡ MoE：257 个专家，只激活 6 个
**内容**:

- **问题**：模型参数越多能力越强，但每次推理都要算全部参数
- **MoE 的解法**：把模型拆成多个"专家"，每个 token 只路由到少数专家
  - DeepSeek-V3：每层 257 个专家，Top-6 激活
  - 激活参数仅占总参数的 5.5%
  - **推理成本 ≈ 同等参数量稠密模型的 1/18**
- **2026 新进展**
  - Kimi K3：896 专家激活 16（2.8T 总参数）
  - 专家路由 + 负载均衡成为标配

**排版建议**:

- MoE 路由示意图（token 流向少数专家）
- 激活参数 vs 总参数对比

---

## 第9页：效率革命 3：CSA/HCA——DeepSeek V4 的时域压缩

**标题**: 🔬 DeepSeek V4：推理计算量降至 V3.2 的 27%
**内容**:

- **DeepSeek 演进脉络**
  - V2 (2024)：MLA——压缩 KV Cache
  - V3 (2024)：MoE + FP8——激活参数 5.5%
  - R1 (2025)：强化学习推理
  - **V4 (2026)：CSA/HCA——时域压缩注意力**
- **V4 的架构创新**
  - CSA（压缩状态注意力）：把注意力历史压缩为固定大小状态
  - HCA（混合压缩注意力）：多流残差替代标准残差
  - MQA 替代 MLA，隐藏维度减半
- **成本结果**
  - 正式版推理计算量仅为 V3.2 的 27%
  - 显存占用降至前代 10%
  - API 价格：$0.18/M（约为 GPT-5.6 Sol 的 1/28）

**排版建议**:

- DeepSeek 五代演进时间轴
- CSA/HCA 注意力示意
- 成本下降曲线

---

## 第10页：效率革命 4：KDA——Kimi K3 的线性注意力

**标题**: 🧵 Kimi K3：2.8T 参数 + 1M 上下文的开源旗舰
**内容**:

- **问题**：1M 上下文的 KV Cache 高达数百 GB——标准注意力扛不住
- **KDA（Kimi Delta Attention）的解法**：用固定大小递推状态替代增长 KV Cache
  - 69 层 KDA（线性注意力，O(N) 复杂度）+ 24 层 Gated MLA（全局锚点，3:1 交替）
  - 状态大小固定，不随序列增长
  - 配合 AttnRes（深度注意力）：把注意力从序列轴扩展到模型深度轴
- **结果**
  - 2.8T 参数，全球最大开源权重模型
  - 1M 上下文原生支持
  - Frontend Code Arena 全球第一

**排版建议**:

- KDA + Gated MLA 混合布局图
- 线性 vs 二次复杂度曲线

---

## 第11页：模型层小结

**标题**: 🎯 第一层杠杆：架构效率的累计
**内容**:

- **四个革命的叠加**
  - MLA：KV Cache -93.3%
  - MoE：激活参数 5.5%
  - CSA/HCA：推理计算量 -73%
  - KDA：O(N²) → O(N)
- **关键认知**
  - 2023 年的"能力军备竞赛"（堆参数）已转向"效率军备竞赛"（省成本）
  - 模型架构是 token 成本的第一决定因素
  - **但架构再好，也需要硬件来执行——下一层杠杆**

**排版建议**:

- 四革命叠加图
- 过渡到硬件层

---

## 第三部分：第二层杠杆——硬件（第12-18页，20分钟）

## 第12页：GPU vs CPU

**标题**: 🏭 GPU：token 工厂的机器
**内容**:

- **为什么 AI 需要 GPU**
  - Transformer 的核心是矩阵乘法：成千上万个数字同时相乘相加
  - CPU：4-64 核，擅长串行逻辑
  - GPU：数千核并行，每秒做千万亿次矩阵运算
- **性能对比（2026：B200）**
  - CPU（Xeon）：~1 TFLOPS（FP32）
  - GPU（B200）：~80 TFLOPS（FP32）
  - 内存带宽：CPU ~400 GB/s vs GPU **8 TB/s**
- **结论**：token 工厂的产能由 GPU 决定

**排版建议**:

- CPU vs GPU 核心布局对比
- 性能柱状图

---

## 第13页：NVIDIA 架构演进

**标题**: 📈 NVIDIA GPU 演进：每代 token 成本减半
**内容**:

- **演进节点**
  - Tesla (2006)：首个 CUDA 架构
  - Volta (2017)：Tensor Core——AI 计算专用单元
  - Ampere (2020)：第三代 Tensor Core（Turing 2018 为第二代）
  - Hopper (2022)：Transformer 引擎、FP8
  - **Blackwell (2024-2025)：FP4、NVLink-C2C**
  - **Rubin (2026-2027)：下一代**
- **规律**：每代架构，同等质量 token 的成本大约减半
  - 计算密度提升 + 精度降低 + 带宽提升

**排版建议**:

- 架构演进时间轴
- 每代 token 成本估算曲线

---

## 第14页：Blackwell 深度解析

**标题**: 🔬 Blackwell：为什么它是转折点
**内容**:

- **三大创新**
  1. **FP4 精度**：显存减半、吞吐翻倍
     - NVFP4：4-bit 打包，Tensor Core 内即时反量化
     - MoE 模型标配（DeepSeek-V4、GLM-5.2 均支持）
  2. **NVLink-C2C**：CPU-GPU 一体化（GB200）
     - 1.8 TB/s 双向带宽
     - 让"权重卸载"成为现实（显存不够时从 CPU 内存异步加载）
  3. **HBM3e 8 TB/s**：带宽翻倍
- **实测收益（DeepSeek-V3 on GB200）**
  - 解码吞吐：H200 的 2.2K → 10.1K tok/s（**4.6 倍**）
  - 相同负载：Decode 从 32 卡 → 8 卡
  - **每 token 硬件成本：约降 4 倍**

**排版建议**:

- FP4 vs FP8 vs FP16 精度对比
- GB200 架构图
- 性能对比柱状图

---

## 第15页：CUDA 编程基础

**标题**: ⚡ CUDA：token 工厂的操作系统
**内容**:

- **CUDA 是什么**
  - NVIDIA 的编程平台：让开发者直接指挥 GPU 的数千个核心
  - 所有 AI 框架（PyTorch、vLLM、SGLang）底层都跑在 CUDA 上
- **编程模型**
  - Host-Device：CPU 指挥，GPU 计算
  - Kernel：一段在 GPU 上并行的函数
  - 线程层次：Grid → Block → Thread → Warp（32 线程）
- **内存层次**
  - 全局内存（大、慢）→ 共享内存（小、快）→ 寄存器（最快）

**排版建议**:

- Grid-Block-Thread 层次图
- 内存金字塔

---

## 第16页：CUDA 性能优化

**标题**: 🚀 让 GPU 满载：CUDA 优化的核心技巧
**内容**:

- **为什么优化重要**
  - GPU 很贵，满载率决定每 token 成本
  - 典型优化：利用率 30% → 80%
- **核心技巧**
  - 合并内存访问：连续线程访问连续内存
  - 共享内存：把频繁访问的数据放在片上
  - 避免分支发散：warp 内线程走同一条路
  - 混合精度：FP16 算，FP32 累加
- **目标**
  - 理论性能利用率 >80%
  - 内存带宽利用率 >70%

**排版建议**:

- 优化前后对比
- 性能仪表盘

---

## 第17页：GPU 虚拟化

**标题**: 🔄 让 token 工厂满负荷：GPU 共享的三种方式
**内容**:

- **问题**：GPU 太贵，独占浪费（平均利用率 30%）
- **三种共享方案**
  - **MIG（硬件切分）**：物理隔离，性能稳定，最多 1:7
    - 适用：金融/医疗等严格 SLA
  - **时间切片**：软件调度，1:48
    - 适用：开发测试
  - **用户态虚拟化（HAMi）**：显存+算力按需分配，1:100+
    - 适用：互联网企业，成本敏感
- **收益**
  - GPU 利用率 30% → 80%+
  - 成本节省 60-70%

**排版建议**:

- 三方案对比表格
- 利用率提升图

---

## 第18页：硬件层小结

**标题**: 🎯 第二层杠杆：硬件效率
**内容**:

- **关键认知**
  - 架构演进（FP4）+ 带宽提升（8 TB/s）+ 共享（利用率 3 倍）
  - 硬件层把每 token 成本压低了约 10 倍
- **但硬件再强，不会用也是浪费**
  - GPU 满载率、显存管理、调度策略——这些是软件的事
  - 下一层杠杆：推理引擎

**排版建议**:

- 硬件层贡献图
- 过渡到引擎层

---

## 第四部分：第三层杠杆——推理引擎（第19-25页，20分钟）

## 第19页：推理引擎：token 工厂的车间

**标题**: 🏗️ vLLM / SGLang / TensorRT-LLM：谁在管理 token 生产
**内容**:

- **推理引擎做什么**
  - 接收请求 → 管理 GPU 显存 → 调度计算 → 返回 token
  - 同样的模型 + 同样的 GPU，引擎不同，成本差 2-4 倍
- **主流引擎（2026）**
  - **vLLM**：PagedAttention，最广泛部署
  - **SGLang**：RadixAttention、DSpark 投机解码，迭代最快（月均 400+ PR，单版本 574 PR）
  - **TensorRT-LLM**：NVIDIA 官方，极致优化
  - **llama.cpp**：轻量级，CPU/边缘
- **关键指标**
  - TTFT（首 token 延迟）、TPOT（每 token 时间）、吞吐量

**排版建议**:

- 引擎对比表格
- 引擎选型决策图

---

## 第20页：KV Cache：token 工厂最大的成本项

**标题**: 🧠 KV Cache：推理成本的第一大头
**内容**:

- **为什么 KV Cache 是最大成本**
  - 每生成一个 token，都要保留所有历史 KV
  - 1M 上下文：KV Cache 数百 GB
  - 显存占用 = 成本（显存是 GPU 上最贵的资源）
- **2026 年的挑战**
  - 长上下文成为标配 → KV Cache 爆炸
- **四层解法**
  1. 架构层：MLA/KDA（模型层已讲）
  2. 量化：KV Cache FP8/FP4
  3. 分页：PagedAttention（vLLM）——像操作系统分页一样管理显存
  4. 多级缓存：GPU → CPU → SSD（L1/L2/L3）

**排版建议**:

- KV Cache 规模增长图（1K → 1M token）
- 四层解法叠层图

---

## 第21页：连续批处理

**标题**: 🔄 连续批处理：让 GPU 一分钟都不闲
**内容**:

- **问题**：传统批处理，一个慢请求拖住整个批次
- **连续批处理的解法**
  - 序列完成 → 立即腾出位置 → 新请求补上
  - GPU 永不空闲
- **收益**
  - GPU 利用率：50% → 90%+
  - 吞吐量提升 2-4 倍

**排版建议**:

- 传统 vs 连续批处理对比动画
- 利用率提升图

---

## 第22页：投机解码与 DSpark

**标题**: 🚀 投机解码：让小模型帮大模型"打草稿"
**内容**:

- **原理**
  - 小模型（快、便宜）先猜几个 token
  - 大模型（慢、贵）一次验证一整批
  - 猜对了：一次验证出多个 token
  - 收益：2-3 倍解码加速
- **2026 新进展：DSpark（SGLang 0.5.16）**
  - 传统投机解码固定验证窗口——所有请求一刀切
  - DSpark：由草稿模型置信度决定每个请求验证多长
    - 数学题（容易猜）：验证 5.24 个 token
    - 诗歌（难猜）：只验证 2.91 个
  - 高并发下吞吐提升显著

**排版建议**:

- 投机解码时序图
- DSpark 动态窗口示意（不同请求不同窗口）

---

## 第23页：量化：FP8 与 FP4

**标题**: 🔧 量化：把模型"瘦身"一半
**内容**:

- **原理**：模型权重从 FP16（2 字节）→ FP8（1 字节）→ FP4（0.5 字节）
  - 显存减半 → 能装更大的模型 / 更长的上下文
  - 计算更快（小精度在 Tensor Core 上更快）
- **2026 现状**
  - FP8：标准配置
  - **FP4（NVFP4）**：Blackwell 上 MoE 标配
    - DeepSeek-V4、GLM-5.2 均支持
    - 显存减半、吞吐翻倍
- **代价**：精度损失——但 2026 年的量化技术损失已可忽略

**排版建议**:

- FP16/FP8/FP4 精度对比
- 显存占用对比

---

## 第24页：推理优化全景

**标题**: 🗺️ 推理优化全景图：一切为了更便宜的 token
**内容**:

- **一次请求的完整优化链**
  1. 模型加载：量化（FP4）+ 权重卸载
  2. 调度：连续批处理 + 优先级
  3. 显存：KV Cache 分页 + 多级缓存
  4. 计算：投机解码 + 算子融合
  5. 路由：负载均衡 + 缓存感知
- **组合收益**
  - 单项 20-50% × 5 项叠加 = 一个数量级

**排版建议**:

- 请求生命周期优化链
- 每项优化贡献的瀑布图

---

## 第25页：引擎层小结

**标题**: 🎯 第三层杠杆：软件吃掉硬件
**内容**:

- **关键认知**
  - 同样的 GPU，软件优化可以让吞吐量差 2-4 倍
  - 推理引擎是 2025-2026 年竞争最激烈的软件层
  - 开源引擎（vLLM/SGLang）是主力——这也是开源的力量

**排版建议**:

- 过渡到第四层（生态）

---

## 第五部分：第四层杠杆——基础设施与生态（第26-34页，20分钟）

## 第26页：云原生架构

**标题**: ☁️ token 工厂的厂区规划：三层架构
**内容**:

- **硬件层**：GPU 集群、存储、网络
- **平台层**：Kubernetes 编排、GPU 调度、监控
- **应用层**：训练框架、推理引擎、模型管理
- **云原生的核心价值**
  - 弹性：按需扩缩容
  - 共享：GPU 池化，利用率提升
  - 自动化：故障自愈

**排版建议**:

- 三层架构图
- 云原生 vs 传统部署对比

---

## 第27页：PD 分离

**标题**: ⚖️ PD 分离：把 token 工厂分成两个车间
**内容**:

- **问题**：推理有两阶段，需求不同
  - Prefill（处理输入）：计算密集
  - Decode（生成输出）：内存/带宽密集
  - 混在一起：互相拖累
- **PD 分离的解法**
  - Prefill 集群：卡多、算力强
  - Decode 集群：卡少、带宽大
  - 各配独立扩缩容
- **收益**
  - 每阶段利用率提升
  - 吞吐量提升 30-50%
  - 2026 年成为大厂标配（vLLM Router PD 模式、SGLang PD 分离）

**排版建议**:

- 传统 vs PD 分离架构对比
- 两阶段资源需求差异图

---

## 第28页：开源价格战

**标题**: ⚔️ 2026：开源模型的"无限战争"
**内容**:

- **2026 年 7 月密集发布**
  - **Kimi K3**（7.16）：2.8T 参数，全球最大开源权重
  - **DeepSeek-V4**（7月底）：1.6T，成本仅 V3.2 的 27%
  - **GLM-5.2**（6.17）："Claude 级编程的开源平替"
  - **Qwen3.8**（7.19）：2.4T 参数
- **价格对比（每百万 token）**
  - DeepSeek V4 Pro：$0.18
  - GLM-5.2：$0.9
  - Qwen3.7 Max：$1.4
  - Kimi K3：$2.3
  - **GPT-5.6 Sol：$5 / Claude Fable 5：$50**
- **影响**
  - 开源与闭源差距缩至 3-5 个月
  - **28 倍价差**：企业自建 token 工厂成为可行选择

**排版建议**:

- 四家厂商发布卡片
- 价格对比柱状图（开源 vs 闭源）

---

## 第29页：成本下降的后果 1：AI 编程成为主流

**标题**: 💻 token 便宜了，AI 编程才付得起
**内容**:

- **为什么 AI 编程是成本敏感的**
  - 一次 Agentic 任务：需求理解 + 多文件修改 + 测试 + 迭代
  - 可能消耗 10 万-100 万 token
  - 2023 年（GPT-4 $60/M）：一次任务 $60——太贵
  - **2026 年（DeepSeek V4 $0.18/M）：一次任务 $0.2——随便跑**
- **Agentic 编程的三代演进**
  - 2021-2023：代码补全（Copilot）
  - 2024-2025：对话式编程（Cursor）
  - 2025-2026：**Agentic 编程**（Claude Code 等）
    - 需求理解 → 计划 → 实现 → 测试 → 提交，自主闭环
- **工具生态（2026）**
  - Claude Code、Cursor、Copilot、Windsurf、Qoder

**排版建议**:

- 一次 Agentic 任务的 token 成本变化
- 三代演进时间轴
- 工具对比卡片

---

## 第30页：成本下降的后果 2：长上下文应用

**标题**: 📏 token 便宜了，1M 上下文才用得起
**内容**:

- **上下文演进**
  - GPT-1（2018）：512 token
  - GPT-4（2023）：128K
  - **2026 旗舰标配：1M token**
- **1M token 意味着什么**
  - 一次读完整本《三体》三部曲
  - 处理整个代码仓库
- **背后的成本逻辑**
  - 1M 输入 token：2023 年 GPT-4 要 $60，2026 年 DeepSeek V4 只要 $0.18
  - **长上下文从"用不起"变成"随便用"——应用形态随之改变**
- **RAG 与长上下文的分工**
  - 部分场景 RAG（检索）被长上下文（全量注入）取代
  - 分工：精确检索 vs 全量理解

**排版建议**:

- 上下文长度对数曲线
- 1M token 成本对比（2023 vs 2026）

---

## 第31页：成本下降的后果 3：Agent 系统

**标题**: 🤖 token 便宜了，Agent 才跑得起来
**内容**:

- **Agent 的 token 消耗**
  - 一个多步骤任务：规划 + 多轮工具调用 + 反思 + 修正
  - 单任务可消耗 10 万+ token
  - 2023 年：不可接受；2026 年：成本可忽略
- **2026 的 Agent 形态**
  - 长上下文 Agent（1M token 记忆）
  - 模型原生工具调用（Kimi K3 可自主优化 GPU 算子）
  - 多 Agent 协作（规划/检索/推理/验证）
- **关键认知**：成本下降打开应用空间——AI 从"回答问题的工具"变成"执行任务的员工"

**排版建议**:

- Agent 任务 token 消耗分解
- 多 Agent 协作图

---

## 第32页：开源栈：可自建的 token 工厂

**标题**: 🏗️ 开源模型 + 开源引擎 + 开源平台 = 完整可自建栈
**内容**:

- **自建 token 工厂的全栈拼图**
  - 模型：DeepSeek-V4、Kimi K3、GLM-5.2
  - 引擎：vLLM、SGLang
  - 平台：Kubernetes + GPU Operator、AIBrix（LoRA 管理器、智能扩缩容）
- **收益**
  - 小团队也能建自己的 token 工厂
  - 成本只有 API 的零头
  - 基础设施的"民主化"

**排版建议**:

- 开源栈全景图（模型/引擎/平台三层）
- "自建 vs API"成本对比

---

## 第33页：监控与成本优化

**标题**: 📊 token 工厂的仪表盘
**内容**:

- **为什么必须监控**
  - token 工厂的每个环节都在花钱：GPU、显存、网络
  - 没有监控 = 盲目经营
- **关键指标（2026）**
  - 性能：TTFT、TPOT、吞吐量
  - **成本：每 token 成本、GPU 利用率、KV Cache 命中率**
  - 质量：幻觉率、评估分数
- **成本优化手段**
  - GPU 共享（利用率 30% → 80%）
  - Spot 实例、预留实例
  - 模型路由（简单请求走便宜模型）

**排版建议**:

- 监控仪表盘布局
- 成本分解饼图

---

## 第34页：生态层小结

**标题**: 🎯 第四层杠杆：生态的力量
**内容**:

- **关键认知**
  - 开源模型 + 开源引擎 + 开源平台 = 完整可自建栈
  - 价格战把成本压到接近"电费"水平
  - **成本下降打开应用空间**——AI 编程、长上下文、Agent 都是"便宜了才用得起"的产物

**排版建议**:

- 开源栈全景图（模型/引擎/平台）
- 过渡到总结

---

## 第六部分：总结（第35-40页，5分钟）

## 第35页：四层杠杆总图

**标题**: 🏗️ 100 倍成本下降是怎么来的
**内容**:

- **四层杠杆的累计贡献**
  - 模型架构：MLA/MoE/CSA/KDA——约 10 倍
  - 硬件：FP4/带宽/共享——约 3-4 倍
  - 引擎：批处理/KV 优化/投机解码——约 3 倍
  - 生态：开源价格战——约 3 倍（$5 → $0.18）
- **叠加效应**：不是加法，是乘法——约 10 × 3.5 × 3 × 3 ≈ 300 倍（考虑各层之间有重叠，保守说"100 倍以上"）
- **口径说明**：100 倍是"达到 GPT-4 水平"的折算价格差；实际绝对值差更大，但按能力折算更保守

**排版建议**:

- 四层杠杆瀑布图（对数轴）
- 2023 vs 2026 每 token 成本总对比

---

## 第36页：核心收获

**标题**: 🎯 三个关键认知
**内容**:

1. **AI 的成本革命是四层杠杆的叠加**——不是某一个突破，而是架构、硬件、软件、生态的合力
2. **每 token 成本是 AI 经济的核心指标**——它决定了什么应用形态跑得起来
3. **成本下降打开应用空间**——AI 编程、长上下文、Agent，都是"便宜了才用得起"的产物

**排版建议**:

- 三个认知卡片

---

## 第37页：后续学习路径

**标题**: 📚 想深入了解 token 工厂？
**内容**:

- **推理引擎源码**：vLLM、SGLang（RadixAttention、DSpark）
- **模型架构**：DeepSeek V4（CSA/HCA）、Kimi K3（KDA）
- **硬件**：Blackwell 白皮书、CUDA 编程
- **基础设施**：Kubernetes + GPU Operator、AIBrix
- **参与开源**：vLLM、SGLang、Ray、Kubeflow

**排版建议**:

- 学习路径图

---

## 第38页：职业机会

**标题**: 💼 token 工厂需要什么人（2026）
**内容**:

- **推理系统工程师**：vLLM/SGLang 源码、CUDA kernel、推理优化（缺口最大）
- **AI 基础设施工程师**：GPU 集群、Kubernetes、性能调优
- **AI 平台工程师**：模型部署、监控、成本优化
- **AI 系统架构师**：大规模系统设计、技术选型

**排版建议**:

- 职业路径图
- 技能矩阵

---

## 第39页：行业展望

**标题**: 🔭 2026-2030：token 会便宜到什么程度
**内容**:

- **趋势**
  - 架构：线性注意力、稀疏 MoE 继续进化
  - 硬件：Rubin、HBM4、国产芯片（昇腾、寒武纪）
  - 推理形态：Agentic 负载成为主流
- **预测**
  - 每 token 成本再降 10 倍（2026 → 2030）
  - 推理成本低到"按 token 计费"消失，改为订阅/打包
  - AI 从"使用成本"变成"基础设施"（像电力、网络一样）
- **终极命题**
  - 当 token 几乎免费，AI 应用的下一个瓶颈是什么？
  - 数据？电力？还是人类的想象力？

**排版建议**:

- 成本下降趋势外推曲线
- 激励性收尾

---

## 第40页：结束页

**标题**: 🙏 谢谢
**内容**:

- 主题回顾：Token Factory——AI 推理的成本革命
- Q&A（5 分钟）
- 联系方式

**排版建议**:

- 简洁收尾，大标题

---

## 设计建议总结

### 整体风格

- **配色方案**：深蓝主色 + 橙色强调（成本曲线）+ 白色背景
- **字体选择**：标题用粗体，正文用常规字体
- **图标风格**：扁平化设计，统一风格

### 叙事原则

- **每页回答一个问题**：这层杠杆如何降低每 token 成本？
- **数据驱动**：每个部分至少一个成本数字（$0.18 vs $5、4.6 倍、93.3%）
- **递进结构**：架构 → 硬件 → 引擎 → 生态，层层叠加

### 互动元素

- 第 4 页抛问题："猜猜 1 美元现在能买多少 token？"
- 第 14 页抛问题："同样的模型，为什么换个 GPU 便宜 4 倍？"
- 第 35 页总结时回顾：四层杠杆的贡献各自是多少

### 技术要求

- 支持16:9宽屏显示
- 成本曲线必须用对数坐标
- 备用页面应对提问
