Token 推理物理学与定价交互模型

从第一性原理(Prefill 算力受限 vs Decoding 带宽受限)实时推导输入/输出 Token 的真实物理成本 · 滑块模拟输入输出占比、Prompt Cache 命中率、并发 Batch Size、模型显存占用对混合毛利率的暴击曲线

推理物理学非对称定价交互模型Gemini 生成

💡 使用说明:左侧滑块调整 输入/输出 Token 占比、Prompt Cache 命中率、并发 Batch Size、激活模型显存占用, 右侧实时显示 Prefill/Decoding 两阶段的物理成本、显卡时间霸占率比例、混合毛利率、Decoding 阶段算力闲置率。核心洞见:输入 Token 数量多但物理便宜,输出 Token 数量少但显存带宽吃满——这是厂商敢对输入打 0.15 元骨折价、但对输出收 1.5 元 10 倍溢价的数学根据。

AI助手