Token Factory:AI 推理的成本革命 - 演讲稿

对应 PPT 大纲(2026 年 8 月版):40 页,85 分钟 + 5 分钟 Q&A

开场白(第1-2页)

大家好,我是 Grissom。今天想和大家聊一个话题:AI 推理的成本,是怎么在四年里降了 100 倍的。

为什么聊这个?因为过去两年,AI 领域最大的新闻不是某个模型的发布,而是一连串”便宜到不可思议”的价格。2023 年,用 GPT-4 生成一篇 2000 字的文章,成本大约 2 块钱人民币;2026 年,同样质量甚至更好的输出,DeepSeek 只收你不到 1 分钱。这个变化背后,是整个 AI 基础设施的底层重构。

今天的内容围绕一个比喻展开:Token Factory——token 工厂。AI 服务商本质上就是生产 token(文字的最小单位)的工厂,衡量这家工厂效率的唯一指标,就是每 token 的成本。过去四年,这个成本降了 100 倍。它是怎么做到的?答案不在任何一个单一突破,而在四层杠杆的叠加:

  1. 模型架构——让模型用更少计算达到同等质量(17 分钟)
  2. 硬件——让每块 GPU 产出更多 token(22 分钟)
  3. 推理引擎——让软件吃干榨净硬件(22 分钟)
  4. 基础设施与生态——让集群跑得更满、价格战更狠(12 分钟)

每层杠杆回答同一个问题:这层如何让 token 变便宜? 走完四层,你会得到一个统一的答案:AI 从奢侈品变成水电,是系统工程的结果,不是某一个天才时刻。


第一部分:Token 工厂(第3-5页,12分钟)

Token 是什么(第3页)

在讲成本之前,先建立一个基本概念:token。

Token 是 AI 处理文本的最小单位。它不是”字”,也不是”词”,而是介于两者之间的东西——大约 0.7 个汉字,或者 4 个英文字符(即 1 个汉字约 1-1.5 个 token)。模型读入一句话,先切成 token 序列,然后逐 token 处理;模型生成回答,也是一次输出一个 token。

为什么 token 重要?因为所有模型都按 token 计费。你问一个问题,消耗输入 token;模型回答,消耗输出 token。一次对话的总成本 = 每 token 成本 × token 数量。

这里可以做一个换算,帮助建立直觉:

  • 读一本 10 万字的书 ≈ 15 万 token
  • 生成一篇 2000 字的文章 ≈ 3000 token

所以你可以把 AI 服务商想象成一座工厂:原料是文本,产品是 token,成本是每 token 的价格。这就是我今天说的”Token Factory”。

Token 的价格革命(第4页)

那么,这座工厂的产品——token——这些年降价到什么程度了?

看一组价格(每百万 token 的输出价格):

时间 模型 价格(每百万 token)
2023 GPT-4 $60
2024 GPT-4o $15
2026 GPT-5.6 Sol $30(但能力远超 GPT-4)
2026 Claude Fable 5 $50(SWE-bench 95% 的顶级能力)
2026.7 DeepSeek-V4 Pro $0.18

这里有个容易混淆的地方:GPT-5.6 和 Claude Fable 5 的价格其实比 GPT-4 还便宜了(考虑能力的话),但绝对价格看起来还是几十美元。真正的杀手是开源模型:DeepSeek-V4 Pro 只要 18 美分——同等能力档位的闭源模型,价格差 28 倍

但如果按”达到 GPT-4 水平”来折算,故事更夸张:2023 年要花 $60 才能买到 GPT-4 水平的输出,2026 年花不到 $1 就能买到同等甚至更好的输出——四年降了 100 倍以上。换个角度:2023 年 1 美元能买 1.7 万 token,2026 年能买 550 万 token。

我想先在这里停一下,问大家一个问题:这 100 倍是怎么来的? 是某一个天才发明吗?不是。它是四层杠杆的叠加——模型架构、硬件、推理引擎、基础设施生态。接下来的每一部分,就是一层层拆开看。

四层杠杆总览(第5页)

先把四层杠杆挂出来,让后面每一部分都有个坐标:

  • 第一层:模型架构——MLA 把 KV Cache 压缩 93%、MoE 只激活 5.5% 的参数、CSA/HCA 把推理计算量降到 27%、KDA 把注意力从平方复杂度降到线性。这一层贡献了 10-100 倍。
  • 第二层:硬件——Blackwell 的 FP4 精度让显存减半、HBM3e 带宽翻倍到 8 TB/s、GPU 虚拟化把利用率从 30% 拉到 80%。这一层贡献约 10 倍。
  • 第三层:推理引擎——vLLM、SGLang 这些引擎通过 KV Cache 分页、连续批处理、投机解码,让同样的 GPU 多产出 2-4 倍的 token。
  • 第四层:基础设施与生态——PD 分离、GPU 共享、开源价格战,把成本压到接近”电费”。

四层是乘起来的,不是加起来的。所以 100 倍不是四个 2.5 倍,而是 10 × 10 × 3 × 3 的合力。

好,出发。第一层杠杆——模型架构。


第二部分:第一层杠杆——模型架构(第6-11页,17分钟)

Transformer 90 秒回顾(第6页)

要理解架构怎么省钱,先花 90 秒回顾模型是怎么工作的。

Transformer 的核心是注意力机制:模型处理当前词的时候,需要知道该重点关注前面哪些词。实现方式是 Query/Key/Value 三元组——Query 是”我想找什么”,Key 是”我有什么”,Value 是”实际内容”。通过比较 Query 和所有 Key 的相似度,决定从哪些 Value 里取信息。

生成过程是自回归的:模型每生成一个 token,就要重新计算一遍注意力。这里有一个关键细节:已经处理过的 token 的中间结果(K 和 V)是可以复用的——它们被缓存在显存里,叫 KV Cache。这听起来很聪明,但它带来了一个巨大的成本问题:KV Cache 随对话长度线性增长。对话越长,显存占用越大,每 token 成本越高。

所以架构优化的第一个突破口就是:怎么把 KV Cache 变小?

效率革命 1:MLA(第7页)

2024 年,DeepSeek 在 V2 里给出了第一个答案:MLA(多头潜在注意力)

思路很直接:标准注意力里,每个 token 的 K 和 V 是高维向量(比如 4096 维),全部缓存下来太贵。MLA 的做法是——先把高维的 K、V 压缩到一个低维的”潜在空间”(512 维),计算时再展开。效果:

  • KV Cache 减少 93.3%
  • 注意力质量几乎无损失
  • 推理内存需求大幅下降

这个数字意味着什么?同样一张 GPU,之前只能支撑 1000 token 的上下文,现在能支撑 15000 token。显存就是成本——KV Cache 变小,每 token 成本直接下降。

MLA 现在是 2024-2026 年主流架构的标配,DeepSeek、GLM 都在用。它是第一层杠杆的第一个支点。

效率革命 2:MoE(第8页)

第二个支点是 MoE(混合专家)

先看问题:模型参数越多能力越强,但标准模型每次推理都要算全部参数。GPT-4 级别的模型,几千亿参数全部参与计算,代价巨大。

MoE 的思路是:把模型拆成很多个”专家”(子网络),每个 token 只路由到少数几个专家。以 DeepSeek-V3 为例:每层有 257 个专家,但每个 token 只激活其中 6 个(Top-6)。激活参数只占总参数的 5.5%——也就是说,推理成本大约只有同等参数量稠密模型的 1/18。

2026 年这个数字更夸张:Kimi K3 有 896 个专家,每次只激活 16 个。2.8 万亿总参数,实际参与计算的只有一小部分。

MoE 解决的是”参数多但别全算”的问题。它和 MLA 是互补的:MLA 省 KV Cache 的内存,MoE 省计算量。

效率革命 3:CSA/HCA(第9页)

第三个支点来自 DeepSeek V4——2026 年 7 月刚刚正式发布。

DeepSeek 的演进本身就是一部成本史:

  • V2(2024):MLA——KV Cache 压缩 93.3%
  • V3(2024):MoE + FP8——激活参数 5.5%,训练成本 $557 万
  • R1(2025):强化学习推理
  • V4(2026)CSA/HCA——时域压缩注意力

V4 的核心创新是 CSA(压缩状态注意力):不满足于把 KV 压缩到低维空间,而是把整个注意力历史压缩成一个固定大小的状态——就像把一本日记变成一张便签,只保留最重要的信息。配合 HCA(混合压缩注意力)的多流残差设计,V4 的结果是:

  • 正式版推理计算量仅为 V3.2 的 27%
  • 显存占用降至前代 10%
  • API 价格 $0.18/M——同档闭源模型的 1/28

这是”架构省钱”最极致的例子:同样的能力,成本打三折。

效率革命 4:KDA(第10页)

第四个支点解决的是另一个问题:1M 上下文

2026 年,1M token 上下文成为旗舰标配。但 1M 上下文有个物理障碍:KV Cache 随序列线性增长,1M token 的 KV Cache 高达数百 GB——标准注意力根本扛不住。

Kimi K3(2026 年 7 月发布,2.8T 参数,全球最大开源权重模型)的答案是 KDA(Kimi Delta Attention):用固定大小的递推状态替代增长的 KV Cache。

  • 69 层 KDA(线性注意力,O(N) 复杂度)+ 24 层 Gated MLA(全局锚点),3:1 交替
  • 状态大小固定,不随序列增长——1M 上下文和 1000 上下文的内存占用一样
  • 配合 AttnRes(深度注意力),把注意力从”序列轴”扩展到”模型深度轴”

效果:2.8T 参数 + 1M 上下文原生支持 + Frontend Code Arena 全球第一(1679 分,超过 Claude Fable 5)。

模型层小结(第11页)

第一层杠杆讲完了。回顾四个革命:

技术 代表 省什么 幅度
MLA DeepSeek V2 KV Cache 内存 -93.3%
MoE DeepSeek V3 / Kimi K3 计算量 激活仅 5.5%
CSA/HCA DeepSeek V4 推理计算 -73%
KDA Kimi K3 长上下文内存 O(N²)→O(N)

一个关键认知:2023 年的”能力军备竞赛”(堆参数)已经转向”效率军备竞赛”(省成本)。模型架构是每 token 成本的第一决定因素。

但架构再好,也要硬件来执行。下一层杠杆——硬件。


第三部分:第二层杠杆——硬件(第12-18页,22分钟)

GPU vs CPU(第12页)

为什么 AI 需要 GPU?因为 Transformer 的核心是矩阵乘法——成千上万的数字同时相乘相加。这种计算,CPU 做得很慢。

  • CPU:4-64 个核,每个核很强,擅长串行逻辑、复杂控制。1 TFLOPS 级别(FP32)。
  • GPU:数千个核,每个核简单,但人多力量大。B200 达到 80 TFLOPS(FP32),内存带宽 8 TB/s——是 CPU DDR5 的 20 倍。

一个直观对比:同样的 GPT 生成任务,CPU 每秒产出 0.8 个 token,GPU 每秒产出 127 个——159 倍差距

所以 token 工厂的产能,由 GPU 决定。GPU 是 token 工厂的机器。

NVIDIA 架构演进(第13页)

这台机器是怎么进化的?看关键节点:

架构 年份 关键创新
Tesla 2006 首个 CUDA 架构
Volta 2017 Tensor Core——AI 专用计算单元
Ampere 2020 第二代 Tensor Core
Hopper 2022 Transformer 引擎、FP8
Blackwell 2024-2025 FP4、NVLink-C2C
Rubin 2026-2027 下一代(预告)

规律很清楚:每代架构,同等质量的 token 成本大约减半。计算密度提升 + 精度降低 + 带宽提升,三个维度同时进化。

Blackwell 深度解析(第14页)

Blackwell(B200)为什么是转折点?三大创新:

1. FP4 精度——模型权重从 FP16(2 字节)压到 FP4(0.5 字节),显存减半、吞吐翻倍。NVFP4 成为 MoE 模型标配:DeepSeek-V4、GLM-5.2 都支持。

2. NVLink-C2C——CPU 和 GPU 一体化(GB200)。1.8 TB/s 双向带宽,GPU 可以直接从 CPU 内存加载权重。这催生了”权重卸载”技术:显存不够时,从 CPU 内存异步预取下一层权重,计算过程完美隐藏延迟。

3. HBM3e 8 TB/s——带宽比 H100 翻倍还多。

实测收益(DeepSeek-V3 on GB200):

  • 解码吞吐:H200 的 2.2K → 10.1K tok/s——4.6 倍
  • 相同负载:Decode 从 32 卡降到 8 卡
  • 单节点推理足迹缩减 4 倍

每 token 的硬件成本,大约降了 4 倍。

CUDA:token 工厂的操作系统(第15页)

硬件再好,需要软件去指挥。CUDA 就是 token 工厂的操作系统——让开发者直接指挥 GPU 的数千个核心。所有 AI 框架(PyTorch、vLLM、SGLang)底层都跑在 CUDA 上。

核心概念三个:

1. Host-Device 架构:CPU(Host)负责指挥,GPU(Device)负责计算。数据通过 PCIe/NVLink 传输。

2. 线程层次:Grid(网格)→ Block(线程块)→ Warp(32 线程)→ Thread。GPU 一次调度一个 Warp,32 个线程同时执行同一指令。

3. 内存层次:寄存器(最快,线程私有)→ 共享内存(快,Block 内共享)→ 全局内存(慢,但大)。优化就是让数据尽量留在快的层次。

一个最简单的 CUDA 程序就是向量加法:把两个数组的每个元素相加。写成 kernel,用 <<<grid, block>>> 配置启动,GPU 上成千上万的线程并行完成。

CUDA 性能优化(第16页)

CUDA 写出来不难,难的是让 GPU 满载。因为 GPU 很贵——满载率直接决定每 token 成本。典型优化能把利用率从 30% 拉到 80%+。

四个核心技巧:

  1. 合并内存访问:让连续线程访问连续内存地址。GPU 可以把 32 个线程的请求合并成一次事务,带宽利用率从 10% 提到 90%+。
  2. 共享内存:把频繁访问的数据放在片上。矩阵乘法用分块(Tiling),性能可以提升 10 倍以上。
  3. 避免分支发散:Warp 内 32 个线程走不同的 if/else 分支,会串行执行——浪费。尽量让同 Warp 线程走同一条路。
  4. 混合精度:FP16 算、FP32 累加,用 Tensor Core 加速。

一个真实案例——矩阵乘法(GEMM)的优化阶梯:

优化阶段 性能 提升
朴素实现 0.5 TFLOPS 基准
合并访问 2.1 4.2x
共享内存 8.5 17x
向量化 15.2 30x
Tensor Core 67.3 135x

同样的硬件,软件优化差 135 倍——这就是”软件吃掉硬件”。

GPU 虚拟化(第17页)

GPU 太贵了,独占用是浪费——平均利用率只有 30%。所以有了共享方案:

方案 隔离级别 虚拟化比例 适用
MIG(硬件切分) 硬件级,物理隔离 1:7 金融/医疗,严格 SLA
时间切片 软件级 1:48 开发测试
HAMi(用户态) 显存+算力按需 1:100+ 互联网,成本敏感

HAMi 是其中的代表:显存硬限制防 OOM、算力按时间片分配、Kubernetes 原生集成。效果:GPU 利用率从 30% 提到 80%+,成本节省 60-70%。

虚拟化让”token 工厂”满负荷运转——这是基础设施层的第一次省钱。

硬件层小结(第18页)

第二层杠杆的认知:

  • 架构演进(FP4)+ 带宽提升(8 TB/s)+ 共享(利用率 3 倍)——硬件层把每 token 成本压低了约 10 倍
  • 但硬件再强,不会用也是浪费。GPU 满载率、显存管理、调度策略——这些是软件的事

下一层:推理引擎。


第四部分:第三层杠杆——推理引擎(第19-25页,22分钟)

推理引擎:token 工厂的车间(第19页)

推理引擎是管理 token 生产的软件:接收请求 → 管理 GPU 显存 → 调度计算 → 返回 token。

关键事实:同样的模型 + 同样的 GPU,引擎不同,成本差 2-4 倍。2026 年的主流引擎:

引擎 开发者 核心特性 状态
vLLM vLLM 团队 PagedAttention、生产级 最广泛部署
SGLang LMSYS RadixAttention、DSpark 迭代最快(月均 400+ PR)
TensorRT-LLM NVIDIA 极致优化 Blackwell 深度优化
llama.cpp 社区 轻量级 边缘部署

两个关键指标:TTFT(首 token 延迟——用户感知的”响应速度”)和 TPOT(每 token 时间——吞吐量的核心)。

KV Cache:最大的成本项(第20页)

推理成本的第一大头是 KV Cache——前面讲 MLA 时提过。为什么它这么贵?

  • 每生成一个 token,都要保留所有历史 KV
  • 1M 上下文的 KV Cache 高达数百 GB
  • 显存是 GPU 上最贵的资源——KV Cache 占用多少显存,就吃掉多少成本

2026 年长上下文成为标配后,KV Cache 问题更尖锐。四层解法:

  1. 架构层:MLA/KDA(第一层杠杆讲过)
  2. 量化层:KV Cache 用 FP8/FP4 存储
  3. 分页层:PagedAttention(vLLM)——像操作系统分页一样管理显存,避免碎片化
  4. 多级层:GPU → CPU → SSD 三级缓存(L1/L2/L3)

连续批处理(第21页)

第二个引擎级优化:连续批处理(Continuous Batching)

传统批处理的问题:一批请求一起处理,要等最慢的完成才能释放。GPU 经常闲着。

连续批处理的做法:序列一完成,立刻腾出位置,新请求马上补上。GPU 永不空闲。

收益:GPU 利用率从 50% 提到 90%+,吞吐量提升 2-4 倍。这是”让机器一分钟都不闲”的软件实现。

投机解码与 DSpark(第22页)

第三个优化:投机解码——让小模型帮大模型”打草稿”。

思路:小模型(快、便宜)先猜几个 token,大模型(慢、贵)一次验证一整批。猜对了,一次验证出多个 token——解码速度提升 2-3 倍。

2026 年有个新进展值得单独说:SGLang 0.5.16 的 DSpark

传统投机解码有个问题:验证窗口固定,所有请求一刀切——但有的内容容易猜(数学题),有的内容难猜(诗歌)。固定窗口意味着:容易猜的浪费了(窗口不够大),难猜的也浪费了(窗口太大,尾部的 token 根本不会被接受)。

DSpark 的解法:由草稿模型自己的置信度决定每个请求验证多长。实测混合流量下:

  • 数学题(容易猜):验证 5.24 个 token
  • 困难问答:3.78 个
  • 诗歌(难猜):只验证 2.91 个

高并发下吞吐提升显著——这是”按需分配”思想在解码层的体现。

量化:FP8 与 FP4(第23页)

第四个优化:量化——把模型”瘦身”。

原理:模型权重从 FP16(2 字节)→ FP8(1 字节)→ FP4(0.5 字节)。显存减半,能装更大的模型、更长的上下文;计算也更快(小精度在 Tensor Core 上更快)。

2026 年的现状:FP8 是标准配置;FP4(NVFP4)是 Blackwell 上 MoE 模型的标配——DeepSeek-V4、GLM-5.2 都支持,显存减半、吞吐翻倍。

代价是精度损失——但 2026 年的量化技术,损失已经小到可以忽略。

推理优化全景(第24页)

把引擎层的优化串起来,看一次请求的完整优化链:

  1. 模型加载:量化(FP4)+ 权重卸载
  2. 调度:连续批处理 + 优先级
  3. 显存:KV Cache 分页 + 多级缓存
  4. 计算:投机解码 + 算子融合
  5. 路由:负载均衡 + 缓存感知

每一项 20-50%,五项叠加就是一个数量级。软件吃掉硬件——同样的 GPU,产出翻倍。

引擎层小结(第25页)

第三层杠杆的认知:

  • 推理引擎是 2025-2026 年竞争最激烈的软件层
  • vLLM/SGLang 是开源主力——这也是开源的力量
  • 引擎优化让”每 token 成本”再降 2-4 倍

模型架构、硬件、引擎三层讲完,token 已经便宜了几十倍。但还有一层——基础设施与生态。这一层的故事最精彩:开源价格战。


第五部分:第四层杠杆——基础设施与生态(第26-34页,12分钟)

云原生架构(第26页)

先看 token 工厂的”厂区规划”——三层架构:

  • 硬件层:GPU 集群、存储、网络
  • 平台层:Kubernetes 编排、GPU 调度、监控
  • 应用层:训练框架、推理引擎、模型管理

云原生的核心价值:弹性(按需扩缩容)、共享(GPU 池化)、自动化(故障自愈)。它是第四层杠杆的地基。

PD 分离(第27页)

2026 年最值得关注的基础设施创新:PD 分离(Prefill-Decode Disaggregation)

推理有两个阶段,需求完全不同:

  • Prefill(处理输入):计算密集——要快速读完整个 prompt
  • Decode(生成输出):内存/带宽密集——逐 token 生成

传统做法混在一起,两个阶段互相拖累。PD 分离的做法:分成两个独立的集群——Prefill 集群卡多算力强,Decode 集群带宽大,各配独立扩缩容。

收益:每阶段利用率提升,吞吐量提升 30-50%。2026 年成为大厂标配(vLLM Router 的 PD 模式、SGLang PD 分离)。

它省钱的方式是:让每台机器干它最擅长的事。

开源价格战(第28页)

第四层杠杆里最戏剧性的一幕:2026 年 7 月的开源”无限战争”

一个月内,四家中国厂商密集发布:

  • Kimi K3(7.16):2.8T 参数,全球最大开源权重模型
  • DeepSeek-V4(7月底):1.6T 参数,成本仅 V3.2 的 27%
  • GLM-5.2(6.17):”Claude 级编程能力的开源平替”
  • Qwen3.8(7.19):2.4T 参数

看定价(每百万 token):

模型 价格
DeepSeek V4 Pro $0.18
GLM-5.2 $0.9
Qwen3.7 Max $1.4
Kimi K3 $2.3
GPT-5.6 Sol $5
Claude Fable 5 $50

28 倍价差。开源与闭源的差距,缩到了 3-5 个月(Kimi 美国研究员的判断)。

这对 token 成本意味着什么?企业自建 token 工厂成为可行选择——自己部署开源模型,成本只有 API 的零头。价格战把成本压到接近”电费”水平。

成本下降的后果 1:AI 编程成为主流(第29页)

前四层杠杆讲的是”token 怎么变便宜”。现在换个视角:token 便宜了,什么新东西变得可能?

第一个后果:AI 编程成为主流

为什么 AI 编程是成本敏感的?因为一次真正的 Agentic 任务(需求理解 + 多文件修改 + 测试 + 迭代)可能消耗 10 万-100 万 token。2023 年(GPT-4,$60/M):一次任务 $60——太贵,只舍得用来补全几行代码。2026 年(DeepSeek V4,$0.18/M):一次任务 $0.2——随便跑。

这就是 Agentic 编程的三代演进:

  1. 2021-2023:代码补全(Copilot)——AI 只负责接一句
  2. 2024-2025:对话式编程(Cursor)——AI 参与多轮对话
  3. 2025-2026Agentic 编程(Claude Code 等)——AI 自主完成”需求理解 → 计划 → 实现 → 测试 → 提交”的完整闭环

工具生态 2026:Claude Code、Cursor、GitHub Copilot、Windsurf、Qoder。

没有 token 价格革命,就没有 Agentic 编程。 这是成本下降打开应用空间的第一个例子。

成本下降的后果 2:长上下文应用(第30页)

第二个后果:1M 上下文用得起

上下文演进:GPT-1(2018)512 token → GPT-4(2023)128K → 2026 年旗舰标配 1M token

1M token 意味着什么?一次读完整本《三体》三部曲(约 90 万字),或者处理整个代码仓库。

背后的成本逻辑:1M 输入 token,2023 年 GPT-4 要 $60,2026 年 DeepSeek V4 只要 $0.18。长上下文从”用不起”变成”随便用”——应用形态随之改变:部分场景里,RAG(检索)被长上下文(全量注入)取代。分工变成:精确检索 vs 全量理解。

成本下降的后果 3:Agent 系统(第31页)

第三个后果:Agent 跑得起来

Agent(智能体)的 token 消耗是惊人的:一个多步骤任务——规划 + 多轮工具调用 + 反思 + 修正——单任务可消耗 10 万+ token。2023 年:不可接受;2026 年:成本可忽略。

2026 的 Agent 形态:

  • 长上下文 Agent(1M token 记忆)
  • 模型原生工具调用(Kimi K3 可以自主优化 GPU 算子、开发编译器——连续 48 小时完成芯片设计验证)
  • 多 Agent 协作(规划/检索/推理/验证)

关键认知:成本下降打开应用空间——AI 从”回答问题的工具”变成”执行任务的员工”。

监控与成本优化(第32页)

token 工厂也需要仪表盘。没有监控 = 盲目经营。

关键指标(2026):

  • 性能:TTFT、TPOT、吞吐量
  • 成本:每 token 成本、GPU 利用率、KV Cache 命中率(长上下文时代的新指标)
  • 质量:幻觉率、评估分数

成本优化手段:GPU 共享(利用率 30%→80%)、Spot 实例、模型路由(简单请求走便宜模型)。

AIBrix(第33页)

最后看一个”开源 token 工厂操作系统”:AIBrix

  • 基于 vLLM 的云原生推理引擎:Kubernetes + vLLM + LoRA + 分布式缓存
  • 核心能力:高密度 LoRA(单基础模型 + 1000+ 适配器,显存省 90%)、智能扩缩容、多层缓存

它的价值:让 token 工厂自动化运营——扩缩容、路由、缓存全部自动。

生态层小结(第34页)

第四层杠杆的认知:

  • 开源模型 + 开源引擎 + 开源平台 = 完整可自建栈
  • 基础设施的”民主化”:小团队也能建自己的 token 工厂
  • 价格战把成本压到接近”电费”水平

四层杠杆全部走完。现在回头看那个 100 倍。


第六部分:总结(第35-40页,5分钟)

四层杠杆总图(第35页)

100 倍成本下降是怎么来的

杠杆 关键手段 贡献
模型架构 MLA / MoE / CSA/HCA / KDA 10-100 倍
硬件 FP4 / 8 TB/s / GPU 共享 约 10 倍
推理引擎 KV Cache / 批处理 / 投机解码 2-4 倍
基础设施与生态 PD 分离 / 开源价格战 28 倍价差

叠加效应:不是加法,是乘法。10 × 10 × 3 × 3 ≈ 900——这就是”四年 100 倍”的构成。

三个关键认知(第36页)

  1. AI 的成本革命是四层杠杆的叠加——不是某一个突破,而是架构、硬件、软件、生态的合力。
  2. 每 token 成本是 AI 经济的核心指标——它决定了什么应用形态跑得起来。AI 编程、1M 上下文、Agent,都是”便宜了才用得起”的产物。
  3. 成本下降还在继续——2026 到 2030,每 token 成本可能再降 10 倍。

后续学习路径(第37页)

想深入了解 token 工厂?

  • 推理引擎源码:vLLM、SGLang(RadixAttention、DSpark)
  • 模型架构:DeepSeek V4(CSA/HCA)、Kimi K3(KDA)
  • 硬件:Blackwell 白皮书、CUDA 编程
  • 基础设施:Kubernetes + GPU Operator、AIBrix
  • 参与开源:vLLM、SGLang、Ray、Kubeflow

职业机会(第38页)

token 工厂需要什么人(2026)?

  • 推理系统工程师:vLLM/SGLang 源码、CUDA kernel、推理优化(缺口最大)
  • AI 基础设施工程师:GPU 集群、Kubernetes、性能调优
  • AI 平台工程师:模型部署、监控、成本优化
  • AI 系统架构师:大规模系统设计、技术选型

行业展望(第39页)

2026-2030:token 会便宜到什么程度?

趋势:

  • 架构:线性注意力、稀疏 MoE 继续进化
  • 硬件:Rubin、HBM4、国产芯片(昇腾、寒武纪)
  • 推理形态:Agentic 负载成为主流,长任务推理

预测:每 token 成本再降 10 倍(2026 → 2030)。推理成本低到”按 token 计费”消失,改为订阅/打包。AI 从”使用成本”变成”基础设施”——像电力、网络一样。

终极命题:当 token 几乎免费,AI 应用的下一个瓶颈是什么?数据?电力?还是人类的想象力?

结束(第40页)

最后总结今天的主线:Token Factory——AI 推理的成本革命

四层杠杆——模型架构、硬件、推理引擎、基础设施生态——每一层都在做同一件事:让 token 变便宜。四年 100 倍,token 从奢侈品变成水电。而这只是开始。

谢谢大家。下面是 Q&A 时间(5 分钟)。