Neil Movva (Sail Founder) — Token Factory、推理优先的算力范式转移、 scavenger 策略与全栈成本最优
Sail 不是又一个通用 API 提供商,而是为"长时间运行 agent"这一特定推理形态做极致成本优化的基础设施层。
"最好的延迟就是零延迟"——当你醒来时,工作已经 Overnight 完成了。
Sail 的方法是"speed of light"方法论——不关心相对竞争对手的数字,只关心在芯片上能达到的绝对效率极限。
互联网的高质量文本数据是一次性补贴——模型已经看了整个互联网许多遍。
Movva 的许多观点与行业共识存在显著分歧。
Sail 的 scavenger 策略揭示了 AI 基础设施投资中一系列被市场忽视的效率缺口。
核心假设:AI 推理正从"实时低延迟"向"后台高吞吐、长时间运行"范式转移,且推理支出单调递增、不存在投机性泡沫。
若核心假设错误:实时交互仍是主流用法 + 推理支出出现周期性波动 + 前端模型架构突变使现有软件栈失效 → Sail 的成本优势被压缩 → 转向通用推理或训练市场。
关键验证信号:
1. 后台 agent 推理 token 消耗占比(当前估计年底 50-50,目标 90-10)
2. KV cache 压缩技术的实际工程进展(DeepSeek 等开源社区的年度改进速率)
3. AMD / 新兴芯片在主流推理平台的实际部署规模
4. 1MW 级分布式数据中心的建设速度和租金水平
5. NVIDIA Blackwell / Rubin 的每瓦性能实际提升幅度
投资映射:推理基础设施 / 分布式数据中心 / 可间歇性电力 / 开源芯片生态 / KV cache 优化软件
阶段判断:范式转移早期(推理从训练附属转向独立增长极)
市场定价偏差:市场过度聚焦训练支出和 NVIDIA 龙头地位,系统性低估推理支出的确定性和"差的芯片+好的软件"的套利空间。
催化事件:NVIDIA 下一代芯片每瓦提升低于预期 / 主流企业大规模部署长时间 agent / HBM 供应持续紧张加剧 / 开源模型蒸馏速度超预期
负责研究员:[填写]
日期:2026-09-30
下次复查:2026-12-30
Neil Movva 的整个思想体系可以用一句话概括:"最便宜的 token 不会来自最贵的芯片,而来自对每一层效率缺口的系统性 exploitation。"
从他"NVIDIA 老将 + Sail 创始人"的双重视角出发,Movva 构建了一个从 GPU kernel 到晶圆制造、从 rack-scale 编排到风电场的完整效率框架。他的"scavenger 策略"不是被动的捡漏,而是主动地——在大厂不屑或不擅长的每一个 supply chain 缝隙中寻找效率缺口:接受差的芯片、接受不稳定的电力、接受 95% 的 uptime、接受没有冗余的数据中心,然后用软件 engineering 将这些"次优"组合成经济上无法被挑战的推理工厂。从投资角度看,Movva 的分析指向一个清晰的结论:推理基础设施是 AI 资本开支中最确定、最非投机的子集,"差的芯片 + 极致软件"构建了真正的 Alpha 来源,而分布式小数据中心与可间歇性电力的组合则是当前市场系统性忽视的最大 supply curve 机会。同时,NVIDIA 短期依然不可替代,但 HBM 瓶颈和每瓦提升的边际递减正在为绕开 NVIDIA 架构的替代方案打开结构性窗口。