Token Factory:AI 推理的成本革命 - 演讲稿
对应 PPT 大纲(2026 年 8 月版):40 页,85 分钟 + 5 分钟 Q&A
开场白(第1-2页)
大家好,我是 Grissom。今天想和大家聊一个话题:AI 推理的成本,是怎么在四年里降了 100 倍的。
为什么聊这个?因为过去两年,AI 领域最大的新闻不是某个模型的发布,而是一连串”便宜到不可思议”的价格。2023 年,用 GPT-4 生成一篇 2000 字的文章,成本大约 2 块钱人民币;2026 年,同样质量甚至更好的输出,DeepSeek 只收你不到 1 分钱。这个变化背后,是整个 AI 基础设施的底层重构。
今天的内容围绕一个比喻展开:Token Factory——token 工厂。AI 服务商本质上就是生产 token(文字的最小单位)的工厂,衡量这家工厂效率的唯一指标,就是每 token 的成本。过去四年,这个成本降了 100 倍。它是怎么做到的?答案不在任何一个单一突破,而在四层杠杆的叠加:
- 模型架构——让模型用更少计算达到同等质量(17 分钟)
- 硬件——让每块 GPU 产出更多 token(22 分钟)
- 推理引擎——让软件吃干榨净硬件(22 分钟)
- 基础设施与生态——让集群跑得更满、价格战更狠(12 分钟)
每层杠杆回答同一个问题:这层如何让 token 变便宜? 走完四层,你会得到一个统一的答案:AI 从奢侈品变成水电,是系统工程的结果,不是某一个天才时刻。
第一部分:Token 工厂(第3-5页,12分钟)
Token 是什么(第3页)
在讲成本之前,先建立一个基本概念:token。
Token 是 AI 处理文本的最小单位。它不是”字”,也不是”词”,而是介于两者之间的东西——大约 0.7 个汉字,或者 4 个英文字符(即 1 个汉字约 1-1.5 个 token)。模型读入一句话,先切成 token 序列,然后逐 token 处理;模型生成回答,也是一次输出一个 token。
为什么 token 重要?因为所有模型都按 token 计费。你问一个问题,消耗输入 token;模型回答,消耗输出 token。一次对话的总成本 = 每 token 成本 × token 数量。
这里可以做一个换算,帮助建立直觉:
- 读一本 10 万字的书 ≈ 15 万 token
- 生成一篇 2000 字的文章 ≈ 3000 token
所以你可以把 AI 服务商想象成一座工厂:原料是文本,产品是 token,成本是每 token 的价格。这就是我今天说的”Token Factory”。
Token 的价格革命(第4页)
那么,这座工厂的产品——token——这些年降价到什么程度了?
看一组价格(每百万 token 的输出价格):
| 时间 | 模型 | 价格(每百万 token) |
|---|---|---|
| 2023 | GPT-4 | $60 |
| 2024 | GPT-4o | $15 |
| 2026 | GPT-5.6 Sol | $30(但能力远超 GPT-4) |
| 2026 | Claude Fable 5 | $50(SWE-bench 95% 的顶级能力) |
| 2026.7 | DeepSeek-V4 Pro | $0.18 |
这里有个容易混淆的地方:GPT-5.6 和 Claude Fable 5 的价格其实比 GPT-4 还便宜了(考虑能力的话),但绝对价格看起来还是几十美元。真正的杀手是开源模型:DeepSeek-V4 Pro 只要 18 美分——同等能力档位的闭源模型,价格差 28 倍。
但如果按”达到 GPT-4 水平”来折算,故事更夸张:2023 年要花 $60 才能买到 GPT-4 水平的输出,2026 年花不到 $1 就能买到同等甚至更好的输出——四年降了 100 倍以上。换个角度:2023 年 1 美元能买 1.7 万 token,2026 年能买 550 万 token。
我想先在这里停一下,问大家一个问题:这 100 倍是怎么来的? 是某一个天才发明吗?不是。它是四层杠杆的叠加——模型架构、硬件、推理引擎、基础设施生态。接下来的每一部分,就是一层层拆开看。
四层杠杆总览(第5页)
先把四层杠杆挂出来,让后面每一部分都有个坐标:
- 第一层:模型架构——MLA 把 KV Cache 压缩 93%、MoE 只激活 5.5% 的参数、CSA/HCA 把推理计算量降到 27%、KDA 把注意力从平方复杂度降到线性。这一层贡献了 10-100 倍。
- 第二层:硬件——Blackwell 的 FP4 精度让显存减半、HBM3e 带宽翻倍到 8 TB/s、GPU 虚拟化把利用率从 30% 拉到 80%。这一层贡献约 10 倍。
- 第三层:推理引擎——vLLM、SGLang 这些引擎通过 KV Cache 分页、连续批处理、投机解码,让同样的 GPU 多产出 2-4 倍的 token。
- 第四层:基础设施与生态——PD 分离、GPU 共享、开源价格战,把成本压到接近”电费”。
四层是乘起来的,不是加起来的。所以 100 倍不是四个 2.5 倍,而是 10 × 10 × 3 × 3 的合力。
好,出发。第一层杠杆——模型架构。
第二部分:第一层杠杆——模型架构(第6-11页,17分钟)
Transformer 90 秒回顾(第6页)
要理解架构怎么省钱,先花 90 秒回顾模型是怎么工作的。
Transformer 的核心是注意力机制:模型处理当前词的时候,需要知道该重点关注前面哪些词。实现方式是 Query/Key/Value 三元组——Query 是”我想找什么”,Key 是”我有什么”,Value 是”实际内容”。通过比较 Query 和所有 Key 的相似度,决定从哪些 Value 里取信息。
生成过程是自回归的:模型每生成一个 token,就要重新计算一遍注意力。这里有一个关键细节:已经处理过的 token 的中间结果(K 和 V)是可以复用的——它们被缓存在显存里,叫 KV Cache。这听起来很聪明,但它带来了一个巨大的成本问题:KV Cache 随对话长度线性增长。对话越长,显存占用越大,每 token 成本越高。
所以架构优化的第一个突破口就是:怎么把 KV Cache 变小?
效率革命 1:MLA(第7页)
2024 年,DeepSeek 在 V2 里给出了第一个答案:MLA(多头潜在注意力)。
思路很直接:标准注意力里,每个 token 的 K 和 V 是高维向量(比如 4096 维),全部缓存下来太贵。MLA 的做法是——先把高维的 K、V 压缩到一个低维的”潜在空间”(512 维),计算时再展开。效果:
- KV Cache 减少 93.3%
- 注意力质量几乎无损失
- 推理内存需求大幅下降
这个数字意味着什么?同样一张 GPU,之前只能支撑 1000 token 的上下文,现在能支撑 15000 token。显存就是成本——KV Cache 变小,每 token 成本直接下降。
MLA 现在是 2024-2026 年主流架构的标配,DeepSeek、GLM 都在用。它是第一层杠杆的第一个支点。
效率革命 2:MoE(第8页)
第二个支点是 MoE(混合专家)。
先看问题:模型参数越多能力越强,但标准模型每次推理都要算全部参数。GPT-4 级别的模型,几千亿参数全部参与计算,代价巨大。
MoE 的思路是:把模型拆成很多个”专家”(子网络),每个 token 只路由到少数几个专家。以 DeepSeek-V3 为例:每层有 257 个专家,但每个 token 只激活其中 6 个(Top-6)。激活参数只占总参数的 5.5%——也就是说,推理成本大约只有同等参数量稠密模型的 1/18。
2026 年这个数字更夸张:Kimi K3 有 896 个专家,每次只激活 16 个。2.8 万亿总参数,实际参与计算的只有一小部分。
MoE 解决的是”参数多但别全算”的问题。它和 MLA 是互补的:MLA 省 KV Cache 的内存,MoE 省计算量。
效率革命 3:CSA/HCA(第9页)
第三个支点来自 DeepSeek V4——2026 年 7 月刚刚正式发布。
DeepSeek 的演进本身就是一部成本史:
- V2(2024):MLA——KV Cache 压缩 93.3%
- V3(2024):MoE + FP8——激活参数 5.5%,训练成本 $557 万
- R1(2025):强化学习推理
- V4(2026):CSA/HCA——时域压缩注意力
V4 的核心创新是 CSA(压缩状态注意力):不满足于把 KV 压缩到低维空间,而是把整个注意力历史压缩成一个固定大小的状态——就像把一本日记变成一张便签,只保留最重要的信息。配合 HCA(混合压缩注意力)的多流残差设计,V4 的结果是:
- 正式版推理计算量仅为 V3.2 的 27%
- 显存占用降至前代 10%
- API 价格 $0.18/M——同档闭源模型的 1/28
这是”架构省钱”最极致的例子:同样的能力,成本打三折。
效率革命 4:KDA(第10页)
第四个支点解决的是另一个问题:1M 上下文。
2026 年,1M token 上下文成为旗舰标配。但 1M 上下文有个物理障碍:KV Cache 随序列线性增长,1M token 的 KV Cache 高达数百 GB——标准注意力根本扛不住。
Kimi K3(2026 年 7 月发布,2.8T 参数,全球最大开源权重模型)的答案是 KDA(Kimi Delta Attention):用固定大小的递推状态替代增长的 KV Cache。
- 69 层 KDA(线性注意力,O(N) 复杂度)+ 24 层 Gated MLA(全局锚点),3:1 交替
- 状态大小固定,不随序列增长——1M 上下文和 1000 上下文的内存占用一样
- 配合 AttnRes(深度注意力),把注意力从”序列轴”扩展到”模型深度轴”
效果:2.8T 参数 + 1M 上下文原生支持 + Frontend Code Arena 全球第一(1679 分,超过 Claude Fable 5)。
模型层小结(第11页)
第一层杠杆讲完了。回顾四个革命:
| 技术 | 代表 | 省什么 | 幅度 |
|---|---|---|---|
| MLA | DeepSeek V2 | KV Cache 内存 | -93.3% |
| MoE | DeepSeek V3 / Kimi K3 | 计算量 | 激活仅 5.5% |
| CSA/HCA | DeepSeek V4 | 推理计算 | -73% |
| KDA | Kimi K3 | 长上下文内存 | O(N²)→O(N) |
一个关键认知:2023 年的”能力军备竞赛”(堆参数)已经转向”效率军备竞赛”(省成本)。模型架构是每 token 成本的第一决定因素。
但架构再好,也要硬件来执行。下一层杠杆——硬件。
第三部分:第二层杠杆——硬件(第12-18页,22分钟)
GPU vs CPU(第12页)
为什么 AI 需要 GPU?因为 Transformer 的核心是矩阵乘法——成千上万的数字同时相乘相加。这种计算,CPU 做得很慢。
- CPU:4-64 个核,每个核很强,擅长串行逻辑、复杂控制。1 TFLOPS 级别(FP32)。
- GPU:数千个核,每个核简单,但人多力量大。B200 达到 80 TFLOPS(FP32),内存带宽 8 TB/s——是 CPU DDR5 的 20 倍。
一个直观对比:同样的 GPT 生成任务,CPU 每秒产出 0.8 个 token,GPU 每秒产出 127 个——159 倍差距。
所以 token 工厂的产能,由 GPU 决定。GPU 是 token 工厂的机器。
NVIDIA 架构演进(第13页)
这台机器是怎么进化的?看关键节点:
| 架构 | 年份 | 关键创新 |
|---|---|---|
| Tesla | 2006 | 首个 CUDA 架构 |
| Volta | 2017 | Tensor Core——AI 专用计算单元 |
| Ampere | 2020 | 第二代 Tensor Core |
| Hopper | 2022 | Transformer 引擎、FP8 |
| Blackwell | 2024-2025 | FP4、NVLink-C2C |
| Rubin | 2026-2027 | 下一代(预告) |
规律很清楚:每代架构,同等质量的 token 成本大约减半。计算密度提升 + 精度降低 + 带宽提升,三个维度同时进化。
Blackwell 深度解析(第14页)
Blackwell(B200)为什么是转折点?三大创新:
1. FP4 精度——模型权重从 FP16(2 字节)压到 FP4(0.5 字节),显存减半、吞吐翻倍。NVFP4 成为 MoE 模型标配:DeepSeek-V4、GLM-5.2 都支持。
2. NVLink-C2C——CPU 和 GPU 一体化(GB200)。1.8 TB/s 双向带宽,GPU 可以直接从 CPU 内存加载权重。这催生了”权重卸载”技术:显存不够时,从 CPU 内存异步预取下一层权重,计算过程完美隐藏延迟。
3. HBM3e 8 TB/s——带宽比 H100 翻倍还多。
实测收益(DeepSeek-V3 on GB200):
- 解码吞吐:H200 的 2.2K → 10.1K tok/s——4.6 倍
- 相同负载:Decode 从 32 卡降到 8 卡
- 单节点推理足迹缩减 4 倍
每 token 的硬件成本,大约降了 4 倍。
CUDA:token 工厂的操作系统(第15页)
硬件再好,需要软件去指挥。CUDA 就是 token 工厂的操作系统——让开发者直接指挥 GPU 的数千个核心。所有 AI 框架(PyTorch、vLLM、SGLang)底层都跑在 CUDA 上。
核心概念三个:
1. Host-Device 架构:CPU(Host)负责指挥,GPU(Device)负责计算。数据通过 PCIe/NVLink 传输。
2. 线程层次:Grid(网格)→ Block(线程块)→ Warp(32 线程)→ Thread。GPU 一次调度一个 Warp,32 个线程同时执行同一指令。
3. 内存层次:寄存器(最快,线程私有)→ 共享内存(快,Block 内共享)→ 全局内存(慢,但大)。优化就是让数据尽量留在快的层次。
一个最简单的 CUDA 程序就是向量加法:把两个数组的每个元素相加。写成 kernel,用 <<<grid, block>>> 配置启动,GPU 上成千上万的线程并行完成。
CUDA 性能优化(第16页)
CUDA 写出来不难,难的是让 GPU 满载。因为 GPU 很贵——满载率直接决定每 token 成本。典型优化能把利用率从 30% 拉到 80%+。
四个核心技巧:
- 合并内存访问:让连续线程访问连续内存地址。GPU 可以把 32 个线程的请求合并成一次事务,带宽利用率从 10% 提到 90%+。
- 共享内存:把频繁访问的数据放在片上。矩阵乘法用分块(Tiling),性能可以提升 10 倍以上。
- 避免分支发散:Warp 内 32 个线程走不同的 if/else 分支,会串行执行——浪费。尽量让同 Warp 线程走同一条路。
- 混合精度:FP16 算、FP32 累加,用 Tensor Core 加速。
一个真实案例——矩阵乘法(GEMM)的优化阶梯:
| 优化阶段 | 性能 | 提升 |
|---|---|---|
| 朴素实现 | 0.5 TFLOPS | 基准 |
| 合并访问 | 2.1 | 4.2x |
| 共享内存 | 8.5 | 17x |
| 向量化 | 15.2 | 30x |
| Tensor Core | 67.3 | 135x |
同样的硬件,软件优化差 135 倍——这就是”软件吃掉硬件”。
GPU 虚拟化(第17页)
GPU 太贵了,独占用是浪费——平均利用率只有 30%。所以有了共享方案:
| 方案 | 隔离级别 | 虚拟化比例 | 适用 |
|---|---|---|---|
| MIG(硬件切分) | 硬件级,物理隔离 | 1:7 | 金融/医疗,严格 SLA |
| 时间切片 | 软件级 | 1:48 | 开发测试 |
| HAMi(用户态) | 显存+算力按需 | 1:100+ | 互联网,成本敏感 |
HAMi 是其中的代表:显存硬限制防 OOM、算力按时间片分配、Kubernetes 原生集成。效果:GPU 利用率从 30% 提到 80%+,成本节省 60-70%。
虚拟化让”token 工厂”满负荷运转——这是基础设施层的第一次省钱。
硬件层小结(第18页)
第二层杠杆的认知:
- 架构演进(FP4)+ 带宽提升(8 TB/s)+ 共享(利用率 3 倍)——硬件层把每 token 成本压低了约 10 倍
- 但硬件再强,不会用也是浪费。GPU 满载率、显存管理、调度策略——这些是软件的事
下一层:推理引擎。
第四部分:第三层杠杆——推理引擎(第19-25页,22分钟)
推理引擎:token 工厂的车间(第19页)
推理引擎是管理 token 生产的软件:接收请求 → 管理 GPU 显存 → 调度计算 → 返回 token。
关键事实:同样的模型 + 同样的 GPU,引擎不同,成本差 2-4 倍。2026 年的主流引擎:
| 引擎 | 开发者 | 核心特性 | 状态 |
|---|---|---|---|
| vLLM | vLLM 团队 | PagedAttention、生产级 | 最广泛部署 |
| SGLang | LMSYS | RadixAttention、DSpark | 迭代最快(月均 400+ PR) |
| TensorRT-LLM | NVIDIA | 极致优化 | Blackwell 深度优化 |
| llama.cpp | 社区 | 轻量级 | 边缘部署 |
两个关键指标:TTFT(首 token 延迟——用户感知的”响应速度”)和 TPOT(每 token 时间——吞吐量的核心)。
KV Cache:最大的成本项(第20页)
推理成本的第一大头是 KV Cache——前面讲 MLA 时提过。为什么它这么贵?
- 每生成一个 token,都要保留所有历史 KV
- 1M 上下文的 KV Cache 高达数百 GB
- 显存是 GPU 上最贵的资源——KV Cache 占用多少显存,就吃掉多少成本
2026 年长上下文成为标配后,KV Cache 问题更尖锐。四层解法:
- 架构层:MLA/KDA(第一层杠杆讲过)
- 量化层:KV Cache 用 FP8/FP4 存储
- 分页层:PagedAttention(vLLM)——像操作系统分页一样管理显存,避免碎片化
- 多级层:GPU → CPU → SSD 三级缓存(L1/L2/L3)
连续批处理(第21页)
第二个引擎级优化:连续批处理(Continuous Batching)。
传统批处理的问题:一批请求一起处理,要等最慢的完成才能释放。GPU 经常闲着。
连续批处理的做法:序列一完成,立刻腾出位置,新请求马上补上。GPU 永不空闲。
收益:GPU 利用率从 50% 提到 90%+,吞吐量提升 2-4 倍。这是”让机器一分钟都不闲”的软件实现。
投机解码与 DSpark(第22页)
第三个优化:投机解码——让小模型帮大模型”打草稿”。
思路:小模型(快、便宜)先猜几个 token,大模型(慢、贵)一次验证一整批。猜对了,一次验证出多个 token——解码速度提升 2-3 倍。
2026 年有个新进展值得单独说:SGLang 0.5.16 的 DSpark。
传统投机解码有个问题:验证窗口固定,所有请求一刀切——但有的内容容易猜(数学题),有的内容难猜(诗歌)。固定窗口意味着:容易猜的浪费了(窗口不够大),难猜的也浪费了(窗口太大,尾部的 token 根本不会被接受)。
DSpark 的解法:由草稿模型自己的置信度决定每个请求验证多长。实测混合流量下:
- 数学题(容易猜):验证 5.24 个 token
- 困难问答:3.78 个
- 诗歌(难猜):只验证 2.91 个
高并发下吞吐提升显著——这是”按需分配”思想在解码层的体现。
量化:FP8 与 FP4(第23页)
第四个优化:量化——把模型”瘦身”。
原理:模型权重从 FP16(2 字节)→ FP8(1 字节)→ FP4(0.5 字节)。显存减半,能装更大的模型、更长的上下文;计算也更快(小精度在 Tensor Core 上更快)。
2026 年的现状:FP8 是标准配置;FP4(NVFP4)是 Blackwell 上 MoE 模型的标配——DeepSeek-V4、GLM-5.2 都支持,显存减半、吞吐翻倍。
代价是精度损失——但 2026 年的量化技术,损失已经小到可以忽略。
推理优化全景(第24页)
把引擎层的优化串起来,看一次请求的完整优化链:
- 模型加载:量化(FP4)+ 权重卸载
- 调度:连续批处理 + 优先级
- 显存:KV Cache 分页 + 多级缓存
- 计算:投机解码 + 算子融合
- 路由:负载均衡 + 缓存感知
每一项 20-50%,五项叠加就是一个数量级。软件吃掉硬件——同样的 GPU,产出翻倍。
引擎层小结(第25页)
第三层杠杆的认知:
- 推理引擎是 2025-2026 年竞争最激烈的软件层
- vLLM/SGLang 是开源主力——这也是开源的力量
- 引擎优化让”每 token 成本”再降 2-4 倍
模型架构、硬件、引擎三层讲完,token 已经便宜了几十倍。但还有一层——基础设施与生态。这一层的故事最精彩:开源价格战。
第五部分:第四层杠杆——基础设施与生态(第26-34页,12分钟)
云原生架构(第26页)
先看 token 工厂的”厂区规划”——三层架构:
- 硬件层:GPU 集群、存储、网络
- 平台层:Kubernetes 编排、GPU 调度、监控
- 应用层:训练框架、推理引擎、模型管理
云原生的核心价值:弹性(按需扩缩容)、共享(GPU 池化)、自动化(故障自愈)。它是第四层杠杆的地基。
PD 分离(第27页)
2026 年最值得关注的基础设施创新:PD 分离(Prefill-Decode Disaggregation)。
推理有两个阶段,需求完全不同:
- Prefill(处理输入):计算密集——要快速读完整个 prompt
- Decode(生成输出):内存/带宽密集——逐 token 生成
传统做法混在一起,两个阶段互相拖累。PD 分离的做法:分成两个独立的集群——Prefill 集群卡多算力强,Decode 集群带宽大,各配独立扩缩容。
收益:每阶段利用率提升,吞吐量提升 30-50%。2026 年成为大厂标配(vLLM Router 的 PD 模式、SGLang PD 分离)。
它省钱的方式是:让每台机器干它最擅长的事。
开源价格战(第28页)
第四层杠杆里最戏剧性的一幕:2026 年 7 月的开源”无限战争”。
一个月内,四家中国厂商密集发布:
- Kimi K3(7.16):2.8T 参数,全球最大开源权重模型
- DeepSeek-V4(7月底):1.6T 参数,成本仅 V3.2 的 27%
- GLM-5.2(6.17):”Claude 级编程能力的开源平替”
- Qwen3.8(7.19):2.4T 参数
看定价(每百万 token):
| 模型 | 价格 |
|---|---|
| DeepSeek V4 Pro | $0.18 |
| GLM-5.2 | $0.9 |
| Qwen3.7 Max | $1.4 |
| Kimi K3 | $2.3 |
| GPT-5.6 Sol | $5 |
| Claude Fable 5 | $50 |
28 倍价差。开源与闭源的差距,缩到了 3-5 个月(Kimi 美国研究员的判断)。
这对 token 成本意味着什么?企业自建 token 工厂成为可行选择——自己部署开源模型,成本只有 API 的零头。价格战把成本压到接近”电费”水平。
成本下降的后果 1:AI 编程成为主流(第29页)
前四层杠杆讲的是”token 怎么变便宜”。现在换个视角:token 便宜了,什么新东西变得可能?
第一个后果:AI 编程成为主流。
为什么 AI 编程是成本敏感的?因为一次真正的 Agentic 任务(需求理解 + 多文件修改 + 测试 + 迭代)可能消耗 10 万-100 万 token。2023 年(GPT-4,$60/M):一次任务 $60——太贵,只舍得用来补全几行代码。2026 年(DeepSeek V4,$0.18/M):一次任务 $0.2——随便跑。
这就是 Agentic 编程的三代演进:
- 2021-2023:代码补全(Copilot)——AI 只负责接一句
- 2024-2025:对话式编程(Cursor)——AI 参与多轮对话
- 2025-2026:Agentic 编程(Claude Code 等)——AI 自主完成”需求理解 → 计划 → 实现 → 测试 → 提交”的完整闭环
工具生态 2026:Claude Code、Cursor、GitHub Copilot、Windsurf、Qoder。
没有 token 价格革命,就没有 Agentic 编程。 这是成本下降打开应用空间的第一个例子。
成本下降的后果 2:长上下文应用(第30页)
第二个后果:1M 上下文用得起。
上下文演进:GPT-1(2018)512 token → GPT-4(2023)128K → 2026 年旗舰标配 1M token。
1M token 意味着什么?一次读完整本《三体》三部曲(约 90 万字),或者处理整个代码仓库。
背后的成本逻辑:1M 输入 token,2023 年 GPT-4 要 $60,2026 年 DeepSeek V4 只要 $0.18。长上下文从”用不起”变成”随便用”——应用形态随之改变:部分场景里,RAG(检索)被长上下文(全量注入)取代。分工变成:精确检索 vs 全量理解。
成本下降的后果 3:Agent 系统(第31页)
第三个后果:Agent 跑得起来。
Agent(智能体)的 token 消耗是惊人的:一个多步骤任务——规划 + 多轮工具调用 + 反思 + 修正——单任务可消耗 10 万+ token。2023 年:不可接受;2026 年:成本可忽略。
2026 的 Agent 形态:
- 长上下文 Agent(1M token 记忆)
- 模型原生工具调用(Kimi K3 可以自主优化 GPU 算子、开发编译器——连续 48 小时完成芯片设计验证)
- 多 Agent 协作(规划/检索/推理/验证)
关键认知:成本下降打开应用空间——AI 从”回答问题的工具”变成”执行任务的员工”。
监控与成本优化(第32页)
token 工厂也需要仪表盘。没有监控 = 盲目经营。
关键指标(2026):
- 性能:TTFT、TPOT、吞吐量
- 成本:每 token 成本、GPU 利用率、KV Cache 命中率(长上下文时代的新指标)
- 质量:幻觉率、评估分数
成本优化手段:GPU 共享(利用率 30%→80%)、Spot 实例、模型路由(简单请求走便宜模型)。
AIBrix(第33页)
最后看一个”开源 token 工厂操作系统”:AIBrix。
- 基于 vLLM 的云原生推理引擎:Kubernetes + vLLM + LoRA + 分布式缓存
- 核心能力:高密度 LoRA(单基础模型 + 1000+ 适配器,显存省 90%)、智能扩缩容、多层缓存
它的价值:让 token 工厂自动化运营——扩缩容、路由、缓存全部自动。
生态层小结(第34页)
第四层杠杆的认知:
- 开源模型 + 开源引擎 + 开源平台 = 完整可自建栈
- 基础设施的”民主化”:小团队也能建自己的 token 工厂
- 价格战把成本压到接近”电费”水平
四层杠杆全部走完。现在回头看那个 100 倍。
第六部分:总结(第35-40页,5分钟)
四层杠杆总图(第35页)
100 倍成本下降是怎么来的:
| 杠杆 | 关键手段 | 贡献 |
|---|---|---|
| 模型架构 | MLA / MoE / CSA/HCA / KDA | 10-100 倍 |
| 硬件 | FP4 / 8 TB/s / GPU 共享 | 约 10 倍 |
| 推理引擎 | KV Cache / 批处理 / 投机解码 | 2-4 倍 |
| 基础设施与生态 | PD 分离 / 开源价格战 | 28 倍价差 |
叠加效应:不是加法,是乘法。10 × 10 × 3 × 3 ≈ 900——这就是”四年 100 倍”的构成。
三个关键认知(第36页)
- AI 的成本革命是四层杠杆的叠加——不是某一个突破,而是架构、硬件、软件、生态的合力。
- 每 token 成本是 AI 经济的核心指标——它决定了什么应用形态跑得起来。AI 编程、1M 上下文、Agent,都是”便宜了才用得起”的产物。
- 成本下降还在继续——2026 到 2030,每 token 成本可能再降 10 倍。
后续学习路径(第37页)
想深入了解 token 工厂?
- 推理引擎源码:vLLM、SGLang(RadixAttention、DSpark)
- 模型架构:DeepSeek V4(CSA/HCA)、Kimi K3(KDA)
- 硬件:Blackwell 白皮书、CUDA 编程
- 基础设施:Kubernetes + GPU Operator、AIBrix
- 参与开源:vLLM、SGLang、Ray、Kubeflow
职业机会(第38页)
token 工厂需要什么人(2026)?
- 推理系统工程师:vLLM/SGLang 源码、CUDA kernel、推理优化(缺口最大)
- AI 基础设施工程师:GPU 集群、Kubernetes、性能调优
- AI 平台工程师:模型部署、监控、成本优化
- AI 系统架构师:大规模系统设计、技术选型
行业展望(第39页)
2026-2030:token 会便宜到什么程度?
趋势:
- 架构:线性注意力、稀疏 MoE 继续进化
- 硬件:Rubin、HBM4、国产芯片(昇腾、寒武纪)
- 推理形态:Agentic 负载成为主流,长任务推理
预测:每 token 成本再降 10 倍(2026 → 2030)。推理成本低到”按 token 计费”消失,改为订阅/打包。AI 从”使用成本”变成”基础设施”——像电力、网络一样。
终极命题:当 token 几乎免费,AI 应用的下一个瓶颈是什么?数据?电力?还是人类的想象力?
结束(第40页)
最后总结今天的主线:Token Factory——AI 推理的成本革命。
四层杠杆——模型架构、硬件、推理引擎、基础设施生态——每一层都在做同一件事:让 token 变便宜。四年 100 倍,token 从奢侈品变成水电。而这只是开始。
谢谢大家。下面是 Q&A 时间(5 分钟)。