素材:Token 工厂的商业模式与财务数据

用途:支撑演讲第二部分「财务模型」。注意本文件第 5 节专门整理了”电力成本占比”的口径矛盾——这是演讲的深刻点之一。

一、商业模式变革:从”卖时间”到”卖产出”

  • 计费方式从按 GPU 小时(裸金属租赁)转为按每百万 Token 计费——客户买单的不再是时间,而是产出。
  • 关键指标对比(Token 工厂专家交流、TokenFactory 白皮书):

    指标 裸金属租赁 Token 工厂
    使用率 30–50% 80%+(极限;H100 从日均 8 小时到 12 小时,个别场景 16–18 小时)
    毛利率 20–30%(中金 2026-05 研报 + 润建股份官方测算) 40–50%(理想 50%+;满负荷单台服务器 70%+;自建算力场景 60%+;利用率 100% 时 70–80%)
    回本期 3–5 年 不到 2 年
  • 核心营收公式(TokenFactory 白皮书):收入 = Tokens/W × 可用千兆瓦数——产业竞争从比拼峰值算力转向每瓦 Token 产出的能效竞赛。
  • 来源:https://caifuhao.eastmoney.com/news/20260816073817987968060(专家交流)、https://m.sohu.com/a/1049457224_468661/(白皮书)。

二、财务测算模型(两年砍柴,8 张 Sheet 逻辑)

完整原文见 01-wechat-token-factory-model.md。此处为模型逻辑速查,供演讲引用。

逻辑链:硬件投资明细 → 参数假设 → 财务测算 → 仪表盘 → 单卡单位经济 → 5 年现金流 → 情景对比 → 敏感性分析。

底层公式

年产出 = 单卡吞吐 × 3600 秒 × (8760 小时 × 利用率) × 卡数
收入   = 年产出(百万 tokens) × token 售价
电力   = 综合功耗 × PUE × 8760 × 利用率 × 卡数 × 电价
固定成本 = 折旧 + 人工 + 租金 + 带宽 + 维护 + 其他
净利润 = (收入 − 总成本) × (1 − 所得税率)
净现金流 = 净利润 + 折旧
静态回收期 = 初始投资 ÷ 年净现金流
ROI   = 年净利润 ÷ 初始投资
盈亏平衡利用率 = 固定成本 ÷ (每单位利用率带来的收入 − 电力)

默认参数(64 卡基准):64 张 GPU × 2000 tok/s × 利用率 70% × 电价 0.75 元/kWh × 售价 5 元/百万 tokens × 折旧 4 年残值 10% × PUE 1.4 × 综合功耗 (1+0.2) kW/卡。

口径注:模型中的”利用率 70%”严格说是满载等效时数占比(时间 × 平均负载率的复合,电费按满载功耗 × 利用率计算);”单卡吞吐 2000 tok/s”隐含设备利用率(batch 足够大时才可达)。演讲中把前者表述为”时间占用率”、后者隐含”设备利用率”,是准确且通俗的简化——详见 outline 3.6 双口径辨析。

测算结果

指标
年产出 2825.6 亿 tokens(2.83 万亿 = 282.56 万百万 tokens)(注:微信原文”28.26 亿”为单位换算笔误,少 1000 倍;收入与单卡口径均以 282.56 万百万为准)
年收入 1412.8 万元
年电费 49.45 万元(硬件投资 1918.4 万的 2.6%)
年折旧 431.64 万元(1918.4 万 × 90% ÷ 4 年)
年固定成本合计 787.56 万元
年净利润 431.85 万元
年经营净现金流 863.49 万元
静态回收期 2.22 年
ROI(现金流口径) 45%
盈亏平衡利用率 40.4%

单卡单位经济:年收入 22.08 万 / 年总成本 13.08 万 / 年净收益 9 万;每百万 token 成本 2.96 元、毛利 2.04 元售价跌破 3 元/百万 token,单卡开始亏损

情景对比

指标 保守(55%/3.5元/1500 tok/s) 中性(70%/5元/2000) 乐观(85%/7元/2800)
年净利润 −248.8 万(复算约 −182~−244 万,差异推测为 Excel 未披露假设) 431.9 万 1892.2 万
回收期 10.49 年 2.22 年 0.83 年

敏感性结论(作者原话要点):”每卡每秒 Token 产出”和”Token 售价”对 ROI 弹性最大——任一指标恶化 50%,项目都可能从盈利变亏损。这就是运营方使尽浑身解数做 Token 产出优化的深层原因。

作者对生意本质的总结:重资产、长周期、靠规模效应的生意;前期投入巨大,但只要利用率够高、定价合理,现金流不错;最大风险是技术迭代太快——”你可能刚买完 GPU,下一代更便宜的算力就出来了”。

三、白皮书口径的成本结构(128 节点 H20 集群)

成本项 占比
GPU 设备折旧 60%(最大固定成本)
网络设备折旧 10%
机柜用电 8%
带宽人力 10%
软件平台 10%
其他杂项 2%
  • 折旧合计占 70%;电力仅约 8%,但被定位为”核心变动降本抓手”:西部绿电、全液冷(PUE 降至 1.1 以内)、错峰调度。
  • 毛利率 20–30% → 40–50%(自建场景 60%+),回收期 3–5 年 → 约 2 年(白皮书引中金 2026-05 研报 + 润建股份官方测算)。
  • 来源:https://m.sohu.com/a/1049457224_468661/

四、市场定价与套餐(2026 现状)

  • 英伟达分层定价(GTC 2026):免费层 / $3–6(普通)/ $45(深度推理)/ ~$150(关键路径超高速)。来源:投资界。
  • 中国电信 Token 套餐(2026-05):个人及家庭 9.9 元/1000 万 tokens 起;开发者及中小微企业 39.9 元/1500 万 tokens 起。来源:南方财经网。
  • 降价计划:范式 × 曦望 2026-01 宣布”百万 Token 一分钱”(0.01 元/百万)推理成本计划,原定两年实现,因算力供给不足预计延迟至三年左右(戴文渊:价格一定要下降,Token 像手机流量套餐时 AI 才真正普惠)。来源:中新经纬 WAIC 对话。
  • 2026 价格环境:上半年算力需求激增,H200/H100 租金环比涨 15–30%(H200 月租 6.0–6.6 万元);腾讯云、阿里云、百度云、智谱相继涨价 20–34%(GLM-5-Turbo 年内第二次涨价 20%)。Token 工厂模式不签长约、客户分散,抗价格波动能力较强。来源:Token 工厂专家交流。
  • 成本端参考:H100 GPU 月租 27,000–62,000 元/卡,H20 15,000–22,000 元,华为 910B 20,000–30,000 元(本仓库 09_inference_system/cost_analysis/llm_api_pricing_analysis.md §3.1)。

五、口径矛盾:电力成本到底占多少?

演讲第二部分的关键”深刻点”——不同来源的电力占比说法矛盾,必须统一口径:

口径 电力占比 场景
两年砍柴模型(新购 64 卡,折旧期内) ~6%(49.5 万 vs 总成本 787.6 万) 新集群,全成本口径
TokenFactory 白皮书(128 节点 H20) 8% 新集群,全成本口径
券商/专家”电力占 50–70%” 50–70% 老集群已折旧完(只剩电费+运营);或边际口径

统一视角:资本成本与电力成本同源——都由”每瓦 token 产出”决定。功率是物理上限(1GW 的工厂不会变 2GW),每瓦产出越高,单位 token 的折旧与电费同时下降。黄仁勋的 Tokens/W 正是把两个口径合并成一个数。

旁证(规模越大电力占比越高):本仓库 09_inference_system/reference_design/05-性能评估指标体系.md §5.2.4——TCO 结构中硬件成本占比 60–70%(小型)→ 40–50%(大型),电力占比 5–10% → 10–15%。规模越大,硬件占比越低、电力占比越高(折旧摊薄 + 电力绝对量上升)。

六、仓库补充数据(成本锚点)

  • H100 硬件边际成本09_inference_system/cost_analysis/llm_api_pricing_analysis.md §3.2–3.3):输入(Prefill)约 7.89 元/百万,输出(Decode)约 12.63 元/百万(45,000 元/卡/月折旧、55% 综合利用率、4000/2500 tok/s);实际生产是理论下限的 2–3 倍(8K 上下文 Prefill 吞吐可跌至 1500 tok/s 以下);全 TCO 修正系数 1.3–2.0,取 1.5 时输出成本约 18.95 元/百万
  • 零售价差谱(同文件表 1,¥/百万 token):最贵输出 Claude Opus 4.6 = 172.5 元 vs 最便宜 GLM-4-32B = 0.69 元,约 250 倍价差;DeepSeek Chat v3.1 输出 5.175 元——低于 H100 硬件成本基线(靠 MoE 稀疏激活 + FP8 实现)。
  • 集群规模与单 token 成本量级09_inference_system/reference_design/):小型 1–64 卡(0.001–0.01 $/token)→ 中型 64–400 卡(0.0005–0.005)→ 大型 400+ 卡(0.0001–0.001)——规模效应两个数量级。
  • 推理成本占比:推理成本在大型 AI 服务商总运营成本中通常占 80–90%(09_inference_system/cost_analysis/README.md 开篇)。

七、来源链接

  • https://caifuhao.eastmoney.com/news/20260816073817987968060(Token 工厂专家小范围交流)
  • https://m.sohu.com/a/1049457224_468661/(TokenFactory 白皮书 2026)
  • https://m.jwview.com/jingwei/html/m/07-19/679986.shtml(范式戴文渊:百万 Token 一分钱)
  • https://m.sfccn.com/2026/5-17/wMMDE1MjBfMjE0NDkwMw.html(南方财经:中国电信 Token 套餐)
  • https://m.pedaily.cn/news/561782(投资界:分层定价)
  • https://stock.finance.sina.com.cn/stock/view/paper.php?symbol=sh000001&reportid=836190944103(软件与服务:TOKEN工厂产业趋势)