《Token Factory: AI 推理的成本革命》演讲提纲(可排练版)
面向南京大学校友(本科及以上,非全技术背景)。演讲约 39.5 分钟 + Q&A 约 5.5 分钟(总 ≤45 分钟),对应 24 页幻灯片(封面 + 页码 01–23)。素材与数据来源见同目录
references/(01 微信原文,02 产业生态,03 商业模式与财务,04 成本技术,05 杰文斯悖论,06 财报证据,07 白皮书,08 HF 开源模型报告,09 模型性价比,10 产能评估框架,11 模型选型对产能的影响,12 Silicon Data Token 指数)。文中【素材 N §x】标注对应引用位置。
一、演讲信息卡
| 项 | 内容 |
|---|---|
| 标题 | Token Factory: AI 推理的成本革命 |
| 观众 | 南大校友,本科+,混合技术背景(部分听众无技术基础) |
| 时长 | 演讲 39.5 分钟 + Q&A 约 5.5 分钟(总 ≤45 分钟);建议 24 页幻灯片(含封面与结尾,每页约 1.6 分钟) |
| 主旨 | Token 工厂是把「资本(GPU)→ 电力 → Token」的转化机器;AI 推理的成本革命,本质是这台机器的转化效率以摩尔定律数倍的速度提升,它开启的不是”便宜”的时代,是”更大”的时代 |
| 主线(封面三问) | ① Token Factory 是不是一个好生意?② 怎么才能赚钱?③ AI Infra 有哪些事情要做?——三问分别由 ② 财务模型(07–09)、③ 成本革命(10–18)、④ 革命之后(19–22)回答,结尾(23)收束 |
| 主线公式 | 利润 = 年产出 × 单价 − 成本;年产出 = 卡数 × 单卡吞吐 × 时间 × 利用率。四部分分别深化:为什么有这台机器 → 账怎么算(产能与承诺)→ 成本如何被革命 → 革命之后去哪 |
| 三个反直觉点 | ① 成本大头不是电费,是折旧(60% vs 8%)——命脉是吞吐利用率和单价两个数;② 推理降价的本质是三维稀疏化——能不算的不算、能不存的不存、能不传的不传,而能量不可稀疏化;③ 单价三年跌 140 倍、真实玩家还在亏,产业总盘子反而涨——机会不在更便宜的 token,在更值钱的 token |
叙事弧线:悬念(Token 是什么?)→ 拆解(账本、产能与市场)→ 技术(成本怎么被革命)→ 转折(价格跌了钱反而更多)→ 收束(让 token 更值钱的两条路)。
页面节奏(39.5 分钟 / 24 页 ≈ 1.6 分钟/页,故事节奏而非赶场节奏):
| 部分 | 时长 | 页数 | 合并策略 |
|---|---|---|---|
| 封面 + 开场 | 4 分钟 | 3 页 | 封面三问 → 有用性前提(页 01)→ 剪刀差 + 电力类比(页 02) |
| ① 什么是 Token 工厂 | 7 分钟 | 4 页 | 03 黄仁勋叙事 → 04 Token 货币化 → 05 三把尺子表格 → 06 智算中心对照 |
| ② 财务模型 | 6 分钟 | 3 页 | 07 账本结构(公式 + 成本构成)→ 08 产能与承诺(SLO 表)→ 09 市场现实(价格战 + 真实玩家财报) |
| ③ 成本革命 | 13 分钟 | 9 页 | 10 推理骨架 → 11 技术地图 → 12 计算 → 13 存储架构 → 14 存储系统 → 15 通信时间 → 16 能量 → 17 价格瀑布 → 18 市场旁证 |
| ④ 革命之后 | 8 分钟 | 4 页 | 19 杰文斯提问 → 20 趋势改变 → 21 竞争迁移 → 22 机会(更值钱的 token) |
| 结尾 | 1.5 分钟 | 1 页 | 回扣封面三问(页 23) |
| 合计 | 39.5 分钟 | 24 页 | Q&A 余约 5.5 分钟 |
每部分一个记忆点(观众能带走的一句话——全篇只记 5 个数:140× / 60% vs 8% / 3% / +34% / −119% vs +82.5%):
| 部分 | 一句话记忆点 |
|---|---|
| 开场 | “Token 就是 AI 的’度’——单价三年跌 140 倍,用量两年涨 1400 倍。” |
| ① 什么是 Token 工厂 | “Token 工厂不卖时间、卖产出:利用率 80% 对 30%,回本 2 年对 5 年。” |
| ② 财务模型 | “AI 不吃电、吃折旧——折旧占成本 60%、电费 8%;命脉只有两个数:吞吐利用率和 token 单价。”(记忆数:60% vs 8%) |
| ③ 成本革命 | “能不算的不算、能不存的不存、能不传的不传——每 token 只唤醒 3% 的’脑细胞’。”(记忆数:3%) |
| ④ 革命之后 | “单价跌 140 倍,产业盘子反而涨(降价 80% 收入 +34%);机会不在更便宜的 token,在更值钱的 token。”(记忆数:+34%、+82.5%) |
| 结尾 | “问题从来不是 token 贵不贵,而是你的 token 值不值钱。” |
逐页重点地图(24 页,每页一个鲜明重点——页面主标题本身就是重点句,页内只放支撑它的 2–3 个数据):
| 页 | 标题(页面原文) | 一句话重点(口播观点) |
|---|---|---|
| — 封面 | 《Token Factory: AI 推理的成本革命》 | 封面三问:是不是一个好生意?怎么才能赚钱?AI Infra 有哪些事情要做? |
| 01 | 模型能力足够强、种类足够丰富 - “有没有用”已不是问题 | 规模(754B–2.78T)· 授权(MIT 开源 700B–1.65T)· 生态(296 万个模型)· 实证(开源 GLM-5.2 干闭源不敢干的活) |
| 02 | 价格往下、用量往上 - AI 正在经历”电力革命” | 输出单价三年约 140×↓(400 元 → 3 元);中国日均用量两年约 1400×↑(每天 1.37 亿本《红楼梦》)——像极了 140 年前的电力 |
| 03 | 数据中心不再是一台计算机,它是工厂 - 产出 Token | 黄仁勋三步叙事:2022 数据进智能出 → 2025 注入能量产出 Token → 2026 推理经济;新 KPI = Tokens/Watt(每瓦 token 产出,决定工厂成本) |
| 04 | Token 是 AI 的”度”——可计量、可定价、可交易 | 先有计量单位,后有产业;Token = 信息单位 + 算力消耗单位 + 计费单位三重身份;官方定名「词元」(2026.03)——「智力服务的千瓦时时刻」 |
| 05 | 看 Token 工厂的三把尺子:规模、模式、产业链 | 规模尺(多大?)· 模式尺(靠什么赚钱:聚合平台 vs 垂类 Token)· 产业链尺(站在哪一段:算力运营 60–70%)——利润重心离”电与卡”越近分成越高 |
| 06 | 从卖时间到卖产出:利用率 80% 对 30%,回本 2 年对 5 年 | 算力房东 vs 产品制造商:客户买的是产出,不再是 GPU 小时——商业模式一变,账本全变 |
| 07 | Token 工厂的账:收入靠吞吐 × 单价,成本大头是折旧 | 年收入 = 年产出 × 单价;成本构成(128 节点 H20):折旧 60% / 电费 8% / 网络 10% / 人力带宽 10% / 软件 10%——命脉只有两个数:吞吐利用率、token 单价 |
| 08 | (可售卖)产能不是机器极限能力,是符合 SLO 的产量 | Goodput 才是可售卖产能:承诺表(TTFT 分档 / ITL <100ms / 成功率 ≥99.95% / 达标率 ≥99%)——对外卖承诺(P99)、对内考核数字 |
| 09 | 价格战打到现在:真实玩家还在亏 | 市场价:输入 1 元 / 输出 3 元(Qwen3.8-Flash),GLM 输出 2.8 元更低;真实玩家:硅基流动 −24%、CoreWeave 66% 毛利仍净亏——凭什么还有人建、还有人投? |
| 10 | 一次生成 = 读题存档 + 逐字读算;token 成本 = 算 + 存 + 传 | 读题(prefill)把理解存成 KV Cache,逐字(decode)重读存档与权重;三维都能”少做”,最终都以能量计价——Tokens/W 把三维压缩成一维 |
| 11 | 推理优化技术地图:每一类都在”少做” | 省算(MoE/DSA/Engram/MTP)· 省存(MLA/量化/PagedAttention/前缀缓存/Offloading)· 省传(专家本地化/PD 分离/拓扑感知)· 省时(批处理/投机解码)——没有一招鲜,合起来才是跌 140 倍的原因 |
| 12 | DeepSeek V4-Pro:每 token 只唤醒 3% 的”脑细胞” | 1.6 万亿参数只激活 490 亿 = 3.06%(1600 位医生只叫醒 49 位);DSA 128K 上下文只选 2048 个细读——模型变大与变贵第一次脱钩 |
| 13 | 记忆压成摘要存档:KV 省 93%,1M 上下文 250GB → 5GB | MLA:KV 压进 512 维潜空间(250GB→5GB,≈2%);4-bit 量化:激活权重读取量 ÷4(26GB→6.5GB)——记忆不必完整,也不必全部看 |
| 14 | 显存版虚拟内存 + 命中缓存边际成本趋零——降价 99% 仍收支平衡 | PagedAttention:显存利用率 20–40% → 90%+;前缀缓存命中 93%+(命中 = 免 prefill 重算)——小米”省记忆”直接变成”敢降价” |
| 15 | 模型拆到几个办公室,跨办公室沟通慢且贵:同样的卡,调度不同产出差几倍 | 通信税:模型越大税率越高(NVLink ≈ HBM 1/9 可隐藏 vs 跨节点 IB ≈1/160 拖死);对策:专家本地化 / PD 分离(腾讯太极 +30–40%)/ 拓扑感知;时间维:批处理把利用率 30% → 70–80% |
| 16 | 1GW 的工厂永远不会变成 2GW:只有提升 Tokens/Watt 一条路 | 功率是物理上限;折旧可摊薄、电力摊不薄;同一 1GW 中心两年 token 生成速率 350×(厂商口径,SemiAnalysis 实测约 50×)vs 摩尔定律同期 1.5× |
| 17 | 单价跌 140 倍 - 输出 / 输入价差 1:8 | $60(GPT-4, 2023-03)→ $0.43(Qwen3.8-Flash, 2026-08);输出串行自回归、输入可并行 → 价差 1:1 → 1:8;模型变聪明、真实花费降得更多 |
| 18 | 价格还在跌:全市场平均支付价跌破 1 美元 | Silicon Data LLM Token 支出指数:$0.97/百万——发布以来新低、较夏季峰值腰斩、近 7 天再跌 8.6%(所有人付给所有模型的平均成交价) |
| 19 | (无标题,大字提问)单价跌了 140 倍——这个行业的总盘子,是涨了还是跌了? | 标题即提问,停顿 3–5 秒,制造全篇最大悬念,再翻页揭晓 |
| 20 | 降价 80% → 调用量 ×14、收入 +34%;消耗主力正从人变成 Agent | OpenAI 案例 + Google ×134 + 中国 ×1400;驱动力 = Agent(干一件事调用 10–20 次、token 耗用 5–30×)——可怕的信号不是价格归零,是”价格跌但用量停滞” |
| 21 | 从”谁的 GPU 多”到”谁的 token 值钱”:$0 / $3–6 / $45 / $150 | 三层竞争:效率(每瓦 token)→ 价值分层($0/$3–6/$45/$150)→ 生态卡位(聚合平台、Token 运营商、行业方案)——价值正从 token 上移到 Agent 与方案 |
| 22 | 机会不在更便宜的 token,在更值钱的 token | 同一家公司两个数字:卖通用 token −119%(硅基流动公有云)vs 卖行业方案 +82.5%(本地部署)——让 token 更值钱的两条路:① 生产垂类 token ② 在应用层消耗 |
| 23 | 问题从来不是 token 贵不贵,而是你的 token 产出效率高不高,你的 token 值不值钱! | 收束三问:价格终将趋近于零,总产值可能超过今天所有软件产业的总和——AI 从奢侈品变成基础设施 |
使用方式:每页主标题直接采用页面原文(一页一观点),口播围绕上表”一句话重点”展开,页内数字只挑 2–3 个讲——不逐条念页面。
二、开场(4 分钟,3 页)
目标:让全场在 60 秒内意识到”AI 的定价体系正在发生工业革命级的变化”,并亮出封面三问的”问题底色”。
封面三问的引入(30–40 秒,封面页):
今年 3 月,黄仁勋在 GTC 大会上说了一句:”数据中心不再是一台计算机,它是一个工厂——给工厂注入能量,产出的产品叫 Token。”今天我想用大约 40 分钟,把这个”工厂”讲透。全程只回答三个问题:Token Factory 是不是一个好生意?怎么才能赚钱?AI Infra 有哪些事情要做?
叙事草稿:
先看两个数字。第一个:2023 年 3 月,GPT-4 的定价是每百万 token 输出 60 美元;2026 年 8 月,Qwen3.8-Flash 的同口径价格是 3 元人民币(约 43 美分)——单价三年跌了 140 倍。给个体积锚:100 万 token 大约是一部 75 万字小说的体量。上面报的都是输出价——让模型”写”出这么多字,三年前要 400 多块人民币,现在 3 块钱。这就是 140 倍的实感。而模型还越来越聪明:一次就做对、token 用得越来越少——真实场景的花费,降得比单价还要狠【素材 08 §1】。
第二个数字:2024 年初,中国每天消耗 1000 亿个 token;2026 年 3 月,140 万亿——两年,涨了约 1400 倍。这是国家数据局今年 3 月发布的官方数字【素材 05 §1.3】。给个直觉:这相当于每天写 1.37 亿本《红楼梦》(每本 73 万字),摊到 14 亿人头上,每人每天约 10 万 token、50 篇千字文【素材 07 注】。
价格往下、用量往上,这两个方向放在一起,像极了 140 多年前的电力革命:1882 年,爱迪生的珍珠街电站送出的第一度电,定价 24 美分——按通胀折算,相当于今天的 8 美元一度;而今天,美国一度电只要 20 美分左右。实际电价降了几十倍,电力产业的总产值却比蒸汽时代大了几个数量级。工业时代用”度”度量电,数字时代用 GB 度量流量,智能时代用 token 度量智能——Token 就是 AI 的”度”。
有用性前提(页面 01,1 分钟——先回答”有没有用”,再亮两个数字):模型能力足够强、种类足够丰富——”有没有用”已经回答完了。页面四个事实【素材 08 §1/§2/§5】:
- 规模:每月最大开源发布 754B–2.78T 参数;小米、蚂蚁、美团相继跨过 1T 线(美国同期 5/7 个月低于 130B)
- 授权:700B–1.65T 大模型以最宽松的 MIT 协议开源;中国 178 个超 20B 开源发布中,59% 采用 Apache 2.0、22% 采用 MIT
- 生态:HF Hub 上托管 296 万个模型;Qwen 衍生模型共 151,448 个,是 Meta 的 2.6 倍、Llama 系的 4.7 倍,每天新增约 200 个;参数横跨 27B 至 2.4T
- 实证:前沿闭源模型拒绝分析的攻击代码,由量化开源 GLM-5.2 完成——开源连”闭源不敢干的活”都能干
落点:“有没有用”不再是问题,问题是”怎么用”——接下来的故事:token 越来越便宜,用量越来越大。(转场句不变,衔接”什么叫 Token 工厂”)
转场句:”在回答’成本为什么能革命’之前,先回答一个更基本的问题:什么叫 Token 工厂?它和我们熟悉的数据中心有什么不同?”
三、第一部分:什么是 Token 工厂(7 分钟,4 页:03–06)
目标:建立”从卖算力到卖智能”的产业认知;给观众三把分类尺子;用”卖时间 vs 卖产出”把财务模型的引入架好。
2.1 黄仁勋的三步叙事 + 一张图(页面 03,1.5 分钟)
- 2022 提出”AI 工厂”:数据进、智能出;2025 升级:”注入能量,产出 Token”;2026 GTC 宣布”推理经济”,新 KPI = Tokens/Watt(每瓦 token 产出),目标”Token 之王”【素材 02 §1】
- 页面的”注入”要素三件:资本 / GPU、电力、数据 / 算法——工厂的输入;标准化产出只有一样:Token
- 关键画面:老黄的”一张图”——横轴 token 速率(聪明程度),纵轴每瓦吞吐(产能);模型越聪明,速率越低,但 token 越值钱【素材 02 §2】
- 页面落点条:新 KPI = Tokens/Watt——每瓦 token 产出,决定工厂成本(全篇的”主度量衡”,后面 05/10/16 页反复回扣)
- 观众 takeaway:Token 不是同质商品,是分层定价的
2.2 Token 为什么能成为”货币”(页面 04,1.5 分钟)
- 三个经济特征(页面左侧编号小卡 ①②③):可计量(token 数精确可数)、可定价(按能力分层价格表)、可交易(按量计费、套餐化)
- 类比:token 之于 AI,如”度”之于电力、”字节”之于流量——先有计量单位,后有产业;业界称之「智力服务的千瓦时时刻」(中国经济时报)【素材 02 §5】
- 页面脚注一句话:Token 同时具备信息单位、算力消耗单位、商业计费单位三重身份——从技术单位变成了经济单位
- 国家级背书(页面下方注,口播 10 秒):2026 年 3 月,全国科学技术名词审定委员会与国家数据局正式将 Token 的中文标准命名确立为「词元」【素材 05 §1.3】——一个国家开始统计它的”度”了
- 观众 takeaway:先有计量单位,后有产业
2.3 三把分类尺子(页面 05 表格,2 分钟——每行 = 尺子 / 量什么 / 刻度)
- 规模尺(这家厂多大?):个人 / 工作室 → 企业 / 主权级 → Gigascale(1GW、数百亿美元)【素材 02 §3.1】
- 模式尺(它靠什么赚钱?):聚合平台(”大模型界的 App Store”,整合各家 API 分销赚渠道费)vs 垂类 Token(把行业 Know-how 封装进 token 卖溢价)【素材 02 §3.2】——先种概念,页 22 的两条路从这里长出
- 产业链尺(它站在价值链哪一段?):算力运营方分成约 60–70% / 模型方约 20–30% / 应用方约 10–20%——利润重心在算力运营【素材 02 §3.3】
- 页面落点条:利润重心在算力运营:离”电与卡”越近,分成越高——这句同时预告了页 22 为什么说”机会在更值钱的 token”(价值链会重组)
2.4 一个关键区分:Token 工厂 vs 智算中心(页面 06,1.5 分钟)
- 页面左右对照三行:
- 传统智算中心 = “算力房东”:利用率 30–50%、毛利率 20–30%、回本 3–5 年
- Token 工厂 = “产品制造商”:利用率 80%+、毛利率 40–50%(净利率可达 30%+)、回本约 2 年【素材 03 §1】
- 页面落点条:客户买的是产出,不再是 GPU 小时——一句话:从”卖时间”到”卖产出”,商业模式一变,账本全变
- 转场句:”‘回本 2 年、毛利率 40–50%’听起来很美——但这是别人算好的结果。我们自己把账本打开,看看钱到底花在哪、赚在哪。顺带回答封面第二问:怎么才能赚钱?”
四、第二部分:财务模型(6 分钟,3 页:07–09)
目标:三页讲完”账怎么算 → 产能边界 → 市场现状”,建立成本结构直觉,把悬念抛给第三部分。不再代入民间算例的具体金额——页面上只放公式结构、成本构成、市场真实财报三类可验证事实【素材 01/03 的 Excel 测算仅作方法参考,不入页面、不口播具体数字】。
3.1 账怎么算:收入公式 + 成本构成(页面 07,2 分钟)
- 收入侧(页面公式):
年收入 = 年产出(Tokens) × 单价(元/每百万 tokens) 年产出 = 卡数 × 单卡吞吐 × 时间 × 利用率讲解口径:四个乘数 = 买多少卡(资本)× 每张卡多快(技术)× 跑多久(运营)× 卖多少钱(市场)——卡数和时间是钱能解决的,吞吐和单价是本事
- 成本侧(页面构成条,128 节点 H20 集群,TokenFactory 白皮书口径):折旧 60% / 电费 8% / 网络 10% / 人力带宽 10% / 软件 10%【素材 07】——注意刻度:折旧是大头,电费是个零头(页面原句,反直觉①)
- 页面底部结论条(本页灵魂,停 2 秒再念):这门生意的命脉只有两个数:① 提升单卡吞吐和利用率;② 提升 Token 单价(页面画了 ☹️——因为单价最不好提,价格战里人人想砍它)——① 是第三部分的技术革命,② 是第四部分的商业出路
- 口径备料(口播 20 秒,防现场追问):为什么”电费是大头”的说法满天飞?——两种口径都对:折旧期内的新集群,折旧是大头;折旧摊完的老集群,电费才显形。类比:问”买房月供占收入多少”——刚买房的人说房贷是大头,住了 20 年的人说水电物业是大头,折旧期不同、口径就不同。问一句”这房子买了几年”,口径就通了【素材 03 §5】;”电费摊不薄、折旧可摊薄”的推论放在页面 16 能量维呼应
- “利用率”歧义辨析(30 秒口播,防现场追问):行业里”利用率”有两种含义——① 设备利用率(并发度高不高、算力满不满,由 batch 驱动)② 时间占用率(一天多少小时有活干,由需求驱动)。页面 07 公式里”时间 × 利用率”是时间口径;”单卡吞吐”已隐含设备口径——两个参数正交:一个管”有没有活”,一个管”有活时多快”
- 观众 takeaway:降本的主战场是”把折旧摊薄”(吞吐 × 利用率),不是省电
3.2 产能与承诺:一天最多卖多少 token(页面 08,1.5 分钟)
- Goodput(合规吞吐):只有「成功 且 体验达标」的请求产出的 token 才有人付钱——原始吞吐是假产能(页面原句:不顾体验硬灌负载,刷出的是流失中的用户);可售卖产能 = 品质承诺刚被守住的极限工作点(λ_slo_max)【素材 10】
-
承诺表(页面表格,5 个指标全部对应”用户体感”):
用户体感 指标 承诺量级(示例,按业务调整) 点下发送后多久开始出字 TTFT(首字延迟) 按请求长度分档承诺(排队已含在内) 打字机流顺不顺滑 ITL(字间隔) P99 < 100ms 出字速度 TPOT 跟踪项,不参与合规判定 服务能不能用 成功率 ≥ 99.95% 整体兑现度 达标率(Attainment) ≥ 99%,逐档分别承诺 - 生产实测口径(页面脚注,口播一句):input 处理量中缓存命中的部分近乎免费——prefix 缓存命中后 prefill 不用重算(量级见素材 10:生产实测命中 ~96%,口播说”绝大部分”即可)
- 延伸备料(不进页面):λ_slo_max 的工程读取与三阶段压测——① 粗扫:到达率几何递增(×2:0.5 → 1 → 2 → 4 → 8),每档判定 PASS/FAIL(四项:TTFT P99 / ITL P99 / 请求延迟 P99 / 成功率)② 二分:在最后一个 PASS 与第一个 FAIL 之间逼近 ③ 长稳:临界档跑 30–60 分钟无退化——对外承诺必须是长稳验证过的档位;工具 AIPerf(一条命令拿全套 P99 指标)——完整方法见对外文档《Token 工厂的产能怎么算?》cluster-capacity-measurement.md,供 Q&A 引用;每个产能数字必须绑定模型声明(模型 + 配置 + 拓扑,同模型才可比),通信税详见页面 15【素材 11】
- 观众 takeaway:对外卖的是承诺——”你的每个请求都快而稳”;对内考核一个数字——每张卡每天产出多少合格 token。两数必须一起报(只有前者是赔本买卖,只有后者是自欺欺人)
3.3 市场现实:价格战打到现在,真实玩家还在亏(页面 09,2 分钟——本部分悬念最高点)
- ① 市场价(官方目录价):输入 1 元 / 输出 3 元(每百万 token,Qwen3.8-Flash)——注意输入/输出分开计价;同日双发的 GLM-5.3-Flash 输出 2.8 元,更低【素材 09】
- ② 真实玩家(财报)——左右两卡:
- 硅基流动(港股递表 IPO):2025 年毛利率 −24%——卖 token 的,卖 1 元亏 0.24 元
- CoreWeave(纳斯达克):毛利率 66% 仍净亏 6.26 亿$——折旧 + 利息吃光毛利【素材 06】
- 讲解口径:卖”按量计费的通用 token”的,亏在成本没革命;卖”算力租赁”的,亏在折旧与利息——两种主流卖法都在亏,页 22 会揭晓第三种卖法
- ③ 页面底部悬念条(停 2 秒,环视全场再念):价格这么低、玩家还在亏——凭什么还有人建、还有人投?(答案预告:第三部分——不是市场疯了,是有人把成本革命到了市场价以下)
- 观众 takeaway:市场价 + 玩家财报都指向同一件事:按旧成本结构卖 token 是亏的——一定有更深层的成本革命发生
- 转场句:”我们把账本翻完了。结论是:命脉是两个数——成本压到多低、token 卖得多值钱。接下来 13 分钟讲第一个数:成本,是怎么被技术革命掉的。”
五、第三部分:成本革命——在计算/存储/通信三维上的稀疏化(13 分钟,9 页:10–18,全篇技术核心)
目标:给出统一物理框架——token 的成本 = 计算 + 存储 + 通信,全部以能量计价;技术革命 = 在三维上做稀疏化;而能量不可稀疏化 → 产业终局是”每瓦 token”的竞赛。非技术观众带走直觉,技术观众带走框架。
讲解策略:每一维 = 一个压力 + 一个对策 + 一组数字,不展开机制细节。三个压力(参数越来越多 / 上下文越来越长 / 模型大到必须拆卡)与三维一一对应,结构天然自洽。
4.1 推理的本质与物理框架:一次生成在干什么(页面 10,1.5 分钟)
- 两张画面(先给骨架,后讲优化——后面每个技术点观众都能对号入座”它在省什么”):
- 读题(prefill):把整个提问一次性读完、算完一遍,产出的”理解”存进显存——这份存档叫 KV Cache,随长度线性增长
- 逐字(decode):每生成一个字,都要把全部存档和全部权重重新读一遍,基于它们为下一个字做一次新计算——每步都是一次”读 + 算”(这正是 KV Cache 的意义:避免每步全量重算,只算增量)
- 页面三维图(对应三个成本压力):
- 参数越来越多 → 算:能不算的不算
- 上下文越来越长 → 存:能不存的不存
- 模型大到拆卡 → 传:能不传的不传
- 页面底部能量条:三维都能”少做”,最终都以能量计价——Tokens/W 是把三维压缩成一维的工厂 KPI(回扣页面 03 的新 KPI)
- 桥接句:成本不是一个数,是一个随卡型、代际、优化水平移动的区间——技术革命正在把整个区间往下压
- 观众 takeaway:先有推理的骨架,再看优化——每个技术点都是对号入座:省算、省存,还是省传
4.2 推理优化技术地图:每一类都在”少做”(页面 11,1 分钟)
- 全景页:把后续逐维技术先摆上桌——观众对号入座,知道每类技术在省什么
- 四组(页面四象限:对应三维 + 引擎层):
- 省算(模型架构):MoE 稀疏激活(每 token 只唤醒 3%”脑细胞”)· DSA 稀疏注意力(只读值得读的)· Engram 条件记忆(查表替代理解)· MTP(一次前向多想几步)
- 省存(记忆压缩):MLA(KV 压进潜空间,省 93%)· 4-bit 量化(权重读取量减 3/4)· PagedAttention(显存按格出租)· 前缀缓存(命中即免 prefill 重算)· KV Offloading(HBM 放不下,分层放内存/盘)
- 省传(拓扑与分离):专家本地化(把专家放回常客身边)· PD 分离(读题吃算力、生成吃带宽,拆开跑互不拖累,KV 跟着搬)· 拓扑感知调度(通信路由避开慢链路)
- 省时(引擎调度):连续批处理(利用率 30% → 80%)· 投机解码(小模型打草稿、大模型验证)· 动态批处理(闲时凑单、忙时拆单)
- 观众 takeaway:没有一招鲜——每代技术各压一维,合起来才是”单价跌 140 倍”的原因(深度源码拆解见本仓库
09_inference_system/:vllm · sglang · model_optimization · prefill_decode;MTP 彩蛋若有技术观众追问,见model_optimization/mtp-multi-token-prediction.md——训练时学会”一次想好几步”,V4-Flash 实测输出提速近 3 倍)
4.3 计算维:参数越来越多怎么办 → MoE + DSA + Engram(页面 12,1.5 分钟)
- 压力:模型从 7B → 671B → 1.6 万亿参数;若每个 token 都过全部参数,成本线性爆炸
- MoE(参数稀疏):页面大字 3.06%——V4-Pro 1.6 万亿参数只激活 490 亿【素材 04 §0.1】;术语类比(页面原句):专家会诊:1600 位医生,每次只叫醒 49 位
- DSA(注意力稀疏):只让值得的 token 参与注意力——128K 上下文只选 2048 个细读
- Engram(条件记忆):”多少 token 不需要被理解?”——查表替代深层重建(业界有层深度路由 MoD 思路,DeepMind 2024;DeepSeek 官方路线是 DSA + Engram,不用 MoD【素材 04 §0.1】——这句作口播备料,页面不展开)
- 一句话:智能不需要全部参数、也不需要全部深度——把算力花在最值得的 token 上
- 页面落点:模型变大与变贵第一次脱钩(记忆数:3%)
- 观众 takeaway:模型”变大”和”变贵”脱钩了——省算的第一招不是砍模型,是让模型自己少干活
4.4 存储维 · 架构:上下文越来越长怎么办 → MLA + 量化(页面 13,1.5 分钟)
- 承接页面 10 的 KV 定义:KV 大小 ≈ 层数 × 头数 × 维度 × token 数(× K/V 两份 × 精度)——上下文 4K → 128K → 1M,KV 按长度线性增长【素材 04 §1】
- 格式压缩 MLA(页面主对照):同一 1M 上下文,标准 BF16 GQA8 要 250GB 显存;DeepSeek V4-Flash(MLA 把 KV 压进 512 维潜空间)只要 约 5GB(≈2%)——省 93%(记忆压成摘要存档,用的时候再展开)
- 量化(精度压缩,页面副数字):把每步要读的激活专家权重压成 4-bit——读取量 26GB → 6.5GB(÷4)(口径:V4-Flash 激活 13B,混合精度部署)——decode 是”读权重”的带宽游戏,读得越少跑得越快
- 页面落点:记忆不必完整(压缩后仍可恢复),也不必全部看(只读相关的)——推理降本的本质是”省记忆”,不是”省电”
- 观众 takeaway:同一个 1M 上下文,存档从 250GB 瘦身到 5GB——”记性好”第一次不靠”仓库大”
4.5 存储维 · 系统:显存不够用怎么办 → PagedAttention + 前缀缓存(页面 14,1 分钟)
- PagedAttention(显存版的操作系统虚拟内存):KV 切块、按需放格、块表索引——显存利用率从 20–40% 提到 90%+(页面画面:快递柜——装几格算几格,不为最长包裹包下整面墙)
- 前缀缓存:命中 93%+ = 跳过 prefill 重算、边际成本趋零——多轮对话、Agent 多步、系统提示词全命中
- 小米实证(页面落点):全链路优化后 API 最高降价 99%,仍维持收支平衡——”省记忆”直接变成”敢降价”【素材 04 §1.3】;白皮书旁证:AI 质检动态批处理降本 55%、生物制药 PagedAttention 利用率提升 4 倍【素材 07 §四】
- 观众 takeaway:2026 年”降价 99% 仍收支平衡”不是口号,是账本事实
4.6 通信与时间维:模型拆开的代价与利用率杠杆(页面 15,1.5 分钟)
- 压力(页面办公室画面):模型大到必须拆卡——MoE 的 all-to-all(每个 token 跨卡找专家)、TP 的 all-reduce、PD 分离的 KV 搬运;类比:把团队拆到几个办公室(专家 / 层 / KV 各据一方),跨办公室的每次沟通都慢且贵;通信成为新瓶颈【素材 04 §0.3】
- 通信税(页面底部注,模型越大税率越高):单节点 NVLink(≈HBM 带宽的 1/9)通信大部分可隐藏、接近理论;跨节点 IB(≈1/160)完全无法隐藏、产能拖死(AWS 实测 30×)【素材 11】——拓扑是产能数字的一部分
- 对策:专家本地化(把专家放在常来的 token 旁边)、PD 分离(读题吃算力、生成吃带宽,KV 从 prefill 池搬到 decode 池)、拓扑感知调度——腾讯太极 16×H20 实测 15,800 tok/s,端到端 +30–40%
- 时间维(运营,页面右注):连续批处理把利用率 30% → 70–80%——同样的三维消耗下产出翻倍;补上因果链:延迟要求越苛刻 → batch 越小 → 利用率越低 → 单位成本越高——把”延迟约束”接到第二部分”利用率是命脉之一”上
- 页面落点:通信是三维中最难稀疏化的一维——这也是”技术派”玩家的生存空间
- 观众 takeaway:同样的卡,调度与拓扑不同,产出差几倍
4.7 能量的角色:三维共同的物理地板(页面 16,1.5 分钟)
- 计算/存储/通信都能”少做”,但供电是物理硬约束:页面标题即论点——1GW 的工厂永远不会变成 2GW:只有提升 Tokens/Watt 一条路;黄仁勋的原话是”值钱的不是算力,是‘每度电的智商’“【素材 02 §5】
- 页面左注两句:功率是物理上限;折旧可摊薄、电力摊不薄(回扣第二部分口径之争——资本成本与电力成本同源,都由”每瓦 token 产出”决定)
- 硬件代际 = 物理地板的抬升(页面数字):同一 1GW 数据中心两年 token 生成速率 350×(厂商口径)vs 摩尔定律同期 1.5×;GB300/Blackwell 每瓦 token 比 Hopper 高 35–50 倍;Vera Rubin 官方口径:成本降至 Blackwell 的 1/10【素材 04 §0.4】
- 诚实声明(页面脚注原文,把诚实转化为论证资产):350× 为英伟达口径,SemiAnalysis 独立实测约 50×——方向一致;即便打一折,也快过摩尔定律同期 20 倍
- 趋势印证(口播一句):白皮书四大趋势之首是”算电深度绑定”——工厂选址优先风光/核电资源、自建微电网离网供电【素材 07 §六】
- 观众 takeaway:三维稀疏化 × 每瓦产出——技术革命是乘法不是加法(记忆数:350× 记得带”厂商口径”)
4.8 价格瀑布:技术革命在账本上的结果(页面 17,1.5 分钟)
- 时间线(页面四个锚点):GPT-4($60 输出,2023-03)→ GPT-4o mini($0.6,2024-07)→ DeepSeek R1($2.19,2025-01)→ Qwen3.8-Flash($0.43,2026-08)——单价跌 140 倍;而模型变聪明、token 用得少,真实任务花费降得更多(页面右注)
- 输出/输入价差(页面标题级事实):输入可并行、输出串行自回归——GPT-3.5 时代价差 1:1,GPT-5 已达 1:8——技术革命不只降价,还改写了价格结构(回扣开场:报的都是输出价)
- 页面脚注(同日双发,2026-08-26,厂商口径):智谱与阿里同一天发布 Flash 模型——GLM-5.3-Flash 同级智力 1/40 价、Qwen3.8-Flash 输入 1 元/百万(= V4-Flash 忙时输入价的 1/3)【素材 09 §三】——价格瀑布延伸到了”昨天”;彩蛋(口播 10 秒,不进锚点):GLM 限时两周 5 折,输出 1.4 元/百万 ≈ GPT-4 输出价的 1/300——前沿智力第一次按”分”卖
- 点题:第二部分问”价格这么低为什么还有人建”,第三部分给答案:不是市场疯了,是成本真的被革命了——革命后的单位成本已低于市场价(成本是一个区间,技术革命把整个区间往下压)
4.9 市场旁证:价格还在跌(页面 18,1 分钟)
- Silicon Data LLM Token 支出指数(Bloomberg: SDLLMTK,全市场按用量加权的平均支付价):跌至 $0.97/百万——发布以来历史新低、较夏季峰值腰斩、近 7 天再跌 8.6%(页面配图:指数走势)
- 口径警示(口播一句):这是”所有人付给所有模型的平均价”(含输入+输出、动态定价),与主线目录价锚点口径不同——只做”价格仍在下跌”的旁证,不进倍数
- 驱动(页面脚注):中国低价开源模型、OpenAI 降价、动态定价、token 生成成本下降(呼应第三部分)
- 供应商影响(口播一句):价格通缩压缩收入、算力承诺固定——OpenAI/Anthropic 已提交 IPO 保密文件,定价权承压(呼应页面 21/22 价值上移)
- 观众 takeaway:单价端:平均支付价跌破 1 美元还在跌;用量端:两年 1400 倍——杰文斯的两端都在加速【素材 12】
- 转场句:”价格跌了、用量反而暴涨——这两个反方向的力量是巧合吗?经济学 150 年前就预言了这件事:杰文斯悖论。下一页我不给答案,先问你们一个问题。”
六、第四部分:革命之后发生什么(8 分钟,4 页:19–22)
目标:给出全篇的”反直觉高潮”(价格跌、盘子涨),把竞争主线从”更便宜”翻转到”更值钱”,落到页 22 的两条路。
5.1 杰文斯悖论:为什么价格跌、用量反而暴涨(页面 19 提问 + 页面 20 揭晓,2.5 分钟)
- 经济学经典(150 年前的预言):煤便宜了,用量多了,总开支反而涨【素材 05 §1】
- 互动设计(页面 19 无标题、只有大字,全篇最大悬念):”单价跌了 140 倍——你们猜,这个行业的总盘子是涨了还是跌了?”停顿 3–5 秒,环视全场,再翻页给数据(问题与数据对齐:用量 ×14 / Google ×134 / 中国 ×1400)
- AI 实锤数据(页面 20 三卡)【素材 05 §1.3】:
- OpenAI Luna 降价 80% → 两周调用量 ×14、收入 +34%(TD Cowen / OpenRouter 数据)
- Google 月 token 处理量:9.7 万亿 → 1300 万亿(约 134 倍)
- 中国日均:1000 亿 → 140 万亿(两年约 1400 倍)
- (备用数据,口播可略:Terra 降价 20% → 用量 ×5、收入 +45%;IDC 五年 3 亿倍口径互斥见素材 05;微软 Q1 FY2026 处理超 100 万亿 token、同比 5 倍)
- 机制(页面 20 下半区):消耗主体从”人”变”机器”——Agent:干一件事调用模型 10–20 次、token 耗用是普通对话的 5–30×(Gartner);J 型爆发:2026–2028 大规模部署关键拐点(HF Hub agent 流量实测备料:2026 年 4 月 Claude Code 一家占 67.8%,7 月降至 44.4%、Codex 升至 20.8%——份额此消彼长不是 Agent 退潮,是十多个新客户端涌现、生态分化【素材 08 §4】)
- 飞轮回扣(20 秒):”还记得第二部分 07 页的命脉两数吗?① 吞吐利用率靠技术革命撬动(第三部分),② 需求靠降价撬动(刚才这些数字)——技术降本 → 降价 → 需求涨 → 时间占用率升 → 再降本。它正在转。”
- 深刻点(页面底注原句):真正可怕的信号不是”单 token 价格归零”,而是”价格跌但用量停滞”——目前没发生
- 观众 takeaway:成本革命的最大受益者不是消费者,是整个产业盘子
5.2 竞争维度的迁移:从”谁的 GPU 多”到”谁的 token 值钱”(页面 21,1.5 分钟)
- 第一层:效率竞争——比每瓦 token(成本端):固定功率下,每瓦产出越高,成本越低;黄仁勋”1GW 工厂 15 年摊销 400 亿美元,必须放最强机器”【素材 02 §2】
- 第二层:价值分层——token 分层定价(页面价格阶梯:$0 免费客户 / $3–6 普通用户 / $45 深度推理用户 / $150 关键场景用户)【素材 02 §2】
- 第三层:生态卡位——聚合平台、Token 运营商(中国电信 9.9 元套餐、算力网入”六张网”、首个百亿级 Token 工厂集采 164 亿【素材 05 §4】)、行业方案——类比:电力产业最终不是卖电赚钱,是卖电器、电网、电网服务
- 页面落点条:价值正在从 token 本身,上移到 Agent、工作流与行业方案——竞争的主战场换了
- 观众 takeaway:竞争的胜负手从”算力”转移到”效率 × 生态”
5.3 机会:让 token 更值钱(页面 22,2 分钟——全篇落点页)
- 页面标题即论点:机会不在更便宜的 token,在更值钱的 token(回扣开场三问之②”怎么才能赚钱”)
- 对照卡(同一家公司、同一个 2026,两种卖法):
- 卖”便宜的 token”(通用 token 走量):硅基流动 · 公有云服务毛利率 −119%——代金券补贴换增长,卖 1 元亏 1.19 元——价格战里没有赢家
- 卖”值钱的 token”(行业 Know-how 封装):硅基流动 · 本地部署行业方案毛利率 +82.5%——金融/能源/政务客户为方案付费——同样的卡,卖法不同
- 讲解口径:这不是两家公司,是同一家公司内部的两条产品线——证明”值钱”不是运气,是选择
- 两条路卡(页面底部,本页第二个观点)——让 token 更值钱的两条路:
- 生产垂类 token:把行业 Know-how 封装进 token 与方案——卖溢价,不卷价格(回扣 05 页模式尺的”垂类 Token”)
- 在应用层消耗:Agent、工作流、行业方案——价值在结果,不在 token 本身(回扣 20 页的 Agent 驱动)
- 冷静注脚(口播,防”那就都去做垂类”的误读):两条路都吃”效率底座”——页 22 之前的三维稀疏化与每瓦产出,是你能在这两条路上活下来的前提;重资产玩家也别急着退场——轻资产路径(不买卡只租卡、聚合平台)与长周期玩家(政府/电信集采摊薄折旧)同样成立【素材 03 §4】
- 观众 takeaway:怎么赚钱?不是把 token 卖得更便宜,是把同样的卡,卖到更值钱的场景里
七、结尾:回扣三问(页面 23,1.5 分钟)
叙事草稿:
回到开场那张图。珍珠街电站送出的第一度电,点亮了几条街;140 多年后,电已经成为文明本身的基础设施,实际电价在通胀调整后降了几十倍——而电力产业的总产值,远超所有人的想象。
Token 正在走同样的路:单价三年跌了 140 倍,用量两年涨了 1400 倍。Token 工厂的成本革命,把 AI 从”奢侈品”变成”基础设施”。价格终将趋近于零,而总产值可能超过今天所有软件产业的总和。
回到开头那三个问题:Token Factory 是不是一个好生意?——产能与承诺、市场现实给了账本答案(页面 07–09)。怎么才能赚钱?——把成本革命到市场价以下,再把 token 卖到更值钱的场景(页面 10–18、22)。AI Infra 有哪些事情要做?——能不算的不算、能不存的不存、能不传的不传,还有把每瓦产出磨上去(页面 10–16)。
所以问题从来不是”token 贵不贵”,而是——你的转化效率高不高,你的 token 值不值钱。谢谢大家。
Q&A 预判(准备 3–5 个方向):
| 可能的问题 | 回答要点 |
|---|---|
| 中国 vs 美国的 Token 工厂竞赛谁会赢? | 美国赢在芯片供给与需求规模,中国赢在工程降本与需求增速(140 万亿/日);国产芯片市占 41%(2025)、Token 价格仅海外 1/6–1/10【素材 07 §五】;格局未定,看”每瓦 token”而非卡数 |
| 那电力到底占成本多少? | 页面 07 白皮书口径:折旧 60%、电费 8%(新集群、折旧期内);老集群折旧摊完电费占比会高——口径不同,先问”这房子买了几年”【素材 03 §5】;两者都由”每瓦 token 产出”统一(页面 16) |
| 成本构成是白皮书口径,别人也这样吗? | 比例因集群代际/利用率浮动,但结构稳定:折旧永远是最大项;电费在东部/西部绿电间有差异(0.36–0.6 元/kWh 量级)——页面只承诺结构,不承诺具体金额(民间 Excel 算例的精确数字已不入页) |
| 6000 亿美元资本开支是不是泡沫? | 用杰文斯接:价格跌 → 用量涨 1400 倍 → 总盘子反而涨(OpenAI 降价收入 +34%);风险信号不是价格跌,而是”价格跌但用量停滞”——目前没发生【素材 05】。备料数字:高盛估计 AI 基础设施年支出 2026 年 7650 亿美元 → 2031 年 1.6 万亿美元 |
| 全市场平均 token 价格多少了? | Silicon Data LLM Token 支出指数(Bloomberg:SDLLMTK)跌至 0.97 美元/百万,历史新低、较峰值腰斩、近 7 天再跌 8.6%【素材 12】 |
| 价格战什么时候见底? | 不会单调下降:模型能力代际跃升时价格会回升(V3 比 V2 涨价、Claude Opus 26 个月未变);”每美元智能”始终在改善【素材 04 §4.2】 |
| 模型到底有没有用? | 已经不用再问:能力足够强(开源最大发布 2.78T 参数)、种类足够丰富(HF Hub 296 万个模型、Qwen 衍生模型每天新增近 200 个)【素材 08 §1/§5】。剩下的问题是”怎么用”——这正是 token 经济(价格 × 用量)成立的前提 |
| Token 会免费吗? | 单 token 趋零,但分层定价 + 总量爆炸:总收入反而涨(OpenAI +34% 案例);免费层是获客手段不是终局【素材 05】 |
| 现在入场建 Token 工厂还来得及吗? | 命脉两数先想清楚:吞吐利用率能否守住承诺(Goodput)、token 能否卖出价(页 22 两条路);警示:折旧 + 利息吃毛利(CoreWeave 例子在页面 09);或选轻资产路径:聚合平台/垂类/应用层【页面 22】 |
| 普通工程师/非技术人员的机会在哪? | 页面 22 两条路:① 帮行业做垂类 token(Know-how 封装)② 在应用层消耗 token(Agent、工作流);加一条工程师专属:把每瓦产出磨上去(三维稀疏化技术)【§4.2–4.7】 |
| 产能承诺表里的数字是你们自己的吗? | 页面 08 标注”示例,按业务调整”——TTFT/ITL/成功率/达标率的量级来自公开方法论【素材 10】,每家按其业务重定;对外承诺必须长稳验证(λ_slo_max 压测),工具见对外文档 cluster-capacity-measurement.md |
| 硅基流动为什么 -119% 还活着? | 页面 22 口径:那是”公有云服务”一个产品线的毛利率——公司用代金券补贴换增长(毛利用补贴买回来了);同一份招股书里本地部署行业方案 +82.5%——这正是”值钱 token”的证据【素材 06】 |
| 你引用的数字是 2026 年 8 月的,现在变了吗? | 坦诚:数据时效性——见”数据核查清单”,演讲前 3 天复核一遍 |
| Token 能像货币一样囤积吗? | 不能——人民日报客户端:”世上有油,但没有’升’;有电,但没有’度’“。token 只是计量单位,可囤的是算力和数据,不是 token【素材 02 §5】 |
八、数据核查清单(演讲前 3 天执行)
| 数据 | 当前值(本稿) | 复核方式 |
|---|---|---|
| 单价 140× 锚点($60 → $0.43/3 元) | 页面 02/17:GPT-4 $60(2023-03)→ Qwen3.8-Flash 输出 3 元 ≈ $0.43(2026-08) | 重跑 fetch_pricing.py;锚点按素材 09 重锚(Qwen3.8-Flash 输出 3 元) |
| 中国日均 token 调用量(140 万亿/×1400) | 素材 05 §1.3(国家数据局 2026.03) | 搜索”日均 Token 调用量”最新报道 |
| 成本构成 60/8/10/10/10 | 页面 07:TokenFactory 白皮书 128 节点 H20 集群【素材 07】——口径只承诺结构 | 对照白皮书原文复核占比之和 |
| 承诺表量级(TTFT 分档/ITL<100ms/成功率 ≥99.95%/达标率 ≥99%) | 页面 08(标注”示例,按业务调整”)【素材 10】 | 演讲前与内部 SLO 口径核对一遍 |
| 市场价(输入 1 元/输出 3 元;GLM 2.8 元) | 页面 09/17 脚注:Qwen3.8-Flash / GLM-5.3-Flash 官方目录价(2026-08-26 同日双发)【素材 09】 | 重查两家官网目录价 |
| 硅基流动 −24% / −119% / +82.5% | 页面 09/22:2025 年整体毛利率 −24%;公有云服务 −119%、本地部署行业方案 +82.5%(招股书 2026.06)【素材 06】 | 对照招股书分产品线毛利率口径 |
| CoreWeave 66% 毛利 / 净亏 6.26 亿$ | 页面 09:2026 Q2 季报 | 搜索最新季报(如 Q3 已出,更新数字) |
| V4-Pro 3.06%(1600B/49B)、DSA 2048 细读 | 页面 12:DeepSeek V4 技术报告【素材 04】 | 对照技术报告原文 |
| MLA 250GB→5GB(≈2%)/ 量化 26GB→6.5GB | 页面 13:DeepSeek-V2/V4 技术报告 + 公开部署实测(口径:1M 上下文、混合精度、V4-Flash 激活 13B)【素材 04】 | 复核”250GB 是 BF16 GQA8 口径”注记 |
| PagedAttention 90%+ / 前缀命中 93%+ / 小米降价 99% | 页面 14:vLLM 开源实现;新京报(小米 MiMo 全链路优化) | 复核小米降价公告与时间 |
| 腾讯太极 15,800 tok/s / +30–40% | 页面 15:16×H20 公开实测【素材 04 §2】 | 本仓库部署文章(已验证) |
| 350×(厂商口径)/ SemiAnalysis 50× | 页面 16:NVIDIA GTC 2026;SemiAnalysis 独立测试——口播必须带”厂商口径” | 如临近 GTC 2027,重抓 Keynote 要点 |
| GB300 每瓦 35–50× / Vera Rubin 1/10 | 页面 16 | 同上 |
| 输出/输入价差 1:1 → 1:8 | 页面 17:GPT-3.5 → GPT-5 定价结构【素材 04】 | 复核 GPT-5 目录价输入/输出比 |
| Silicon Data 指数 $0.97/百万 | 页面 18:Bloomberg SDLLMTK(2026-09-01:发布以来新低、较峰值腰斩、近 7 天 −8.6%)【素材 12】 | 演讲前 1 天再查一次该指数最新值 |
| OpenAI 降价效应 ×14 / +34% | 页面 20:TD Cowen / OpenRouter 追踪 | 核对 TD Cowen/OpenRouter 最新追踪数据 |
| Google 月 token 处理量 ×134 | 页面 20:9.7 → 1300 万亿(Google I/O 2026) | 最新口径已达 3200 万亿/月(Google I/O 2026),优先用新值 |
| Agent 驱动力(10–20 次 / 5–30× / J 型 2026–28) | 页面 20:Gartner | 引用时带”Gartner 预测”前缀 |
| 口径自检(每稿必查) | 币种统一($ vs ¥);单位(亿/万亿);倍数一律以可验证的单价 140 倍为基准(GPT-4 $60 → Qwen3.8-Flash 输出 3 元;原 214 倍/$0.28 锚点已失效,见素材 09 口径注;弃用”任务成本 1000 倍”复合口径);350× 等厂商口径标注”厂商口径”;页面不再口播民间 Excel 算例的具体金额(收入/折旧/电费绝对值),只讲公式结构与白皮书构成 | 参照本文件修复记录与 references/04 各口径注 |
九、材料索引(references 映射)
| 演讲章节 | 素材文件 |
|---|---|
| 开场(页 01/02:140 倍 × 1400 倍 + 有用性前提) | 04 §4(单价 140 倍)、09(重锚快照)、05 §1.3(用量 1400 倍)、08 §1/§2/§5(有用性四事实) |
| 第一部分(什么是 Token 工厂,页 03–06) | 02 全部 |
| 第二部分(财务模型,页 07–09) | 07(白皮书成本构成)、10(产能承诺)、06(财报)、09(市场价) |
| 第三部分(三维稀疏化,页 10–18) | 04 全部(§0 框架、§1–3 各维、§4 价格)、07 §四(白皮书实证)、09(同日双发脚注) |
| 第四部分(杰文斯/未来,页 19–22) | 05 全部、03 §4、08 §4(Agent 流量) |
| 结尾(页 23:电力类比) | 无(叙事素材) |
| 财报证据(页 09 真实玩家 / 页 22 机会对照) | 06 全部(硅基流动招股书 / CoreWeave 季报) |
| 页 11 技术地图源码延伸(省算/省存/省传/省时) | 本仓库 09_inference_system/(vllm · sglang · model_optimization · prefill_decode) |
| 页 12 模型选型 / 页 15 通信税 | 11(模型选型对产能的影响:V4 Pro/Flash、通信税) |
| 页 08 产能度量延伸(λ_slo_max / AIPerf,口播备料) | 对外文档 cluster-capacity-measurement.md |
| 页 18 市场旁证 / Q&A | 12(Silicon Data Token 支出指数) |
| 页 13/14 量化与缓存数字 | 04 §0.2/§1.3 + 本仓库 09_inference_system 量化/缓存文章 |