大模型推理物理学与 Token 非对称定价内核拆解模型

从第一性原理(Prefill 算力受限 vs Decoding 带宽受限)实时推导输入/输出 Token 的真实物理成本与暴利红线

一、大模型推理两阶段核心物理引擎与时间平摊公式

GPU 硬件成本的本质是“显卡时间霸占率 (Time Occupancy)”。下方公式动态代入当前参数,实时解密两阶段的流速差异:

阶段一:输入处理 (Prefill)

Compute-Bound (算力受限)

矩阵全并行计算,不等待显存搬运
未缓存输入吞吐流速:
  0 Tokens / 秒 / 卡
Prompt Cache 命中率: 0%
(命中部分物理计算时间为 0)
平均每百万输入霸占: 0 显卡·秒
阶段二:逐字输出 (Decoding)

Memory-Bound (显存带宽受限)

自回归串行,每吐一字模型权重整体搬运一次
当前激活模型大小: 0 GB
服务器物理显存带宽: 2,000 GB/s
当前并发批处理 (Batch): 0
平均每百万输出霸占: 0 显卡·秒
物理效率精算结论

Token 工厂时间占用不对称性

在您设定的输入输出比例下:
单次交互总耗时: 0
输入占用时间比: 0%
输出占用时间比: 0%
输出/输入真实成本比: 0
百万输入实际物理成本
¥0.00
设定售价:¥0
百万输出实际物理成本
¥0.00
设定售价:¥0
Token 工厂混合总毛利率
0.0%
财务稳态评估
Decoding阶段算力闲置率
0.0%
硬件等待显存搬运的时间占比

⚙️ 物理与商业双端参数调校

交互流中输入 Token 数量占比 85%
Agent、长上下文检索(RAG)场景下,输入占比通常高达 80% - 95%。
Prompt Caching 缓存命中率 60%
多轮对话中复用背景资料的比例。命中后该输入的 Prefill 算力直接归零。
Decoding 阶段并发批处理大小 (Batch) 32
核心算子。Batch越大,单次读取模型权重吐出的字越多,越能压榨显存带宽。
推理激活模型参数量 (量化后显存占用) 160 GB
MoE架构推理时仅算激活专家大小。越大则 Decoding 搬运越慢。
输入 Token 销售定价 (元/百万) 0.15
输出 Token 销售定价 (元/百万) 1.50

📊 解密非对称性:Token 生产数量 vs 显卡时间霸占率

对比左柱(用户消耗的 Token 数量占比)与右柱(GPU 工厂实际上为之付出的时间折旧成本占比)。

📈 工程优化核心:Prompt Cache 命中率对总毛利率的暴击曲线

横轴为缓存命中率,观察在输入占比极高的稳态下,极致的工程魔改如何让混合毛利率瞬间抬升。