ILTB
InvestBest

Invest Like The Best · 核心结论

Neil Movva (Sail Founder) — Token Factory、推理优先的算力范式转移、 scavenger 策略与全栈成本最优

日期 2026-09-30节目 Invest Like the Best with Patrick O'ShaughnessyInfrastructureAI ComputeOpen SourceInference
★ THESIS · 核心判断
Neil Movva 是 NVIDIA 老将、Sail Research 创始人。Sail 自称为"token factory"(token 工厂)——一家面向长时间运行 AI agent推理的最低成本提供商。核心论点:AI 使用正从"实时聊天机器人"向"后台长时间运行的 agent"范式转移,在这个新范式下延迟变得次要、成本成为决定性因素。围绕这一判断,Movva 构建了一套从软件 kernel 到芯片采购、从数据中心设计到电力获取的"scavenger 策略"——不与大厂抢最前沿的 Blackwell 算力,而是通过软件榨取每一颗芯片的峰值利用率,用小型分布式数据中心和可间歇性电力(风电、光伏)构建一个经济上无法被挑战的推理工厂。他同时对 NVIDIA 短期看好、认为 TSMC 制程差距被夸大、KV cache 压缩是未来最大效率缺口,并判断推理支出单调递增、不存在投机性。

🏭 Sail 的产品愿景——从 token 工厂到"推理公司"

Sail 不是又一个通用 API 提供商,而是为"长时间运行 agent"这一特定推理形态做极致成本优化的基础设施层。

⏱ 范式转移——从实时聊天到后台长时间运行 agent

"最好的延迟就是零延迟"——当你醒来时,工作已经 Overnight 完成了。

🔧 AI 基础设施全栈——软件、硬件、电力的效率之链

Sail 的方法是"speed of light"方法论——不关心相对竞争对手的数字,只关心在芯片上能达到的绝对效率极限。

📊 数据与模型——自互联网补贴结束后的下一阶段

互联网的高质量文本数据是一次性补贴——模型已经看了整个互联网许多遍。

🎯 contrarian 观点与战略判断

Movva 的许多观点与行业共识存在显著分歧。

💡 投资启示——从全栈效率中识别结构性机会

Sail 的 scavenger 策略揭示了 AI 基础设施投资中一系列被市场忽视的效率缺口。

综合判断 · 5 条结论
① 推理是 AI 支出中唯一的"非投机性"子集——token 即时消耗、不会囤积,推理支出单调递增,确定性远超训练支出。
② "Scavenger 策略"构建了无法被追赶的成本曲线——不买最前沿芯片、不抢最可靠电力、不追求最高 uptime,通过软件效率和分布式小数据中心组合出经济上不可挑战的推理工厂。
③ KV cache 压缩是未来 3-5 年最大的效率杠杆——当前 KV cache 熵值远高于必要水平,每年一个数量级的改进空间直接对应 token 成本 1-2 个数量级的下降。
④ 分布式 1MW 数据中心 + 间歇性电力 = 被市场系统性忽视的 supply 曲线——推理对 uptime 的宽容度打开了传统数据中心不涉足的廉价电力和场地资源。
⑤ NVIDIA 短期依然核心,但 HBM 瓶颈催生替代架构的窗口期——每瓦提升边际递减 + HBM 供应紧张 → 绕过 HBM 的架构(大 SRAM、flash offload、混合芯片)将获得结构性机会。

投研跟踪表

核心假设:AI 推理正从"实时低延迟"向"后台高吞吐、长时间运行"范式转移,且推理支出单调递增、不存在投机性泡沫。

若核心假设错误:实时交互仍是主流用法 + 推理支出出现周期性波动 + 前端模型架构突变使现有软件栈失效 → Sail 的成本优势被压缩 → 转向通用推理或训练市场。

关键验证信号:
1. 后台 agent 推理 token 消耗占比(当前估计年底 50-50,目标 90-10)
2. KV cache 压缩技术的实际工程进展(DeepSeek 等开源社区的年度改进速率)
3. AMD / 新兴芯片在主流推理平台的实际部署规模
4. 1MW 级分布式数据中心的建设速度和租金水平
5. NVIDIA Blackwell / Rubin 的每瓦性能实际提升幅度

投资映射:推理基础设施 / 分布式数据中心 / 可间歇性电力 / 开源芯片生态 / KV cache 优化软件

阶段判断:范式转移早期(推理从训练附属转向独立增长极)

市场定价偏差:市场过度聚焦训练支出和 NVIDIA 龙头地位,系统性低估推理支出的确定性和"差的芯片+好的软件"的套利空间。

催化事件:NVIDIA 下一代芯片每瓦提升低于预期 / 主流企业大规模部署长时间 agent / HBM 供应持续紧张加剧 / 开源模型蒸馏速度超预期

负责研究员:[填写]

日期:2026-09-30

下次复查:2026-12-30

最终结论

Neil Movva 的整个思想体系可以用一句话概括:"最便宜的 token 不会来自最贵的芯片,而来自对每一层效率缺口的系统性 exploitation。"

从他"NVIDIA 老将 + Sail 创始人"的双重视角出发,Movva 构建了一个从 GPU kernel 到晶圆制造、从 rack-scale 编排到风电场的完整效率框架。他的"scavenger 策略"不是被动的捡漏,而是主动地——在大厂不屑或不擅长的每一个 supply chain 缝隙中寻找效率缺口:接受差的芯片、接受不稳定的电力、接受 95% 的 uptime、接受没有冗余的数据中心,然后用软件 engineering 将这些"次优"组合成经济上无法被挑战的推理工厂。从投资角度看,Movva 的分析指向一个清晰的结论:推理基础设施是 AI 资本开支中最确定、最非投机的子集,"差的芯片 + 极致软件"构建了真正的 Alpha 来源,而分布式小数据中心与可间歇性电力的组合则是当前市场系统性忽视的最大 supply curve 机会。同时,NVIDIA 短期依然不可替代,但 HBM 瓶颈和每瓦提升的边际递减正在为绕开 NVIDIA 架构的替代方案打开结构性窗口。