a16z 播客 · 2026-10-08 · ~56 分钟
核心洞察:Matt Garman 清晰地划出了旧云(为调用 API 的人类开发者构建)与新云(为以机器速度自主遍历服务的 Agent 构建)之间的界限。"我们越来越看到,团队希望拥有与 Agent 协作同样出色的云,而不仅仅是与人协作"——这是整个对话的决定性主题。
面向 Agent 的新基建模块:AWS 并非简单复用现有服务。Garman 明确指出,计算沙箱、网关、Agent 与人类的权限区分都是全新的基建模块,"你显然需要为 Agent 设置不同的权限"。你不能把与人类操作员相同的权限直接授予 Agent。这需要从根本上重新设计 IAM 模型:基于时间限定、短期、细粒度、以具体任务为范围的权限,而非基于角色的权限。
性能是 Agent 的核心需求:Agent 无法容忍人类可以接受的延迟。AWS 大力投入的能力包括"如何在三秒内启动一个数据库"——这是一个为 Agent 工作流设计的目标:以机器速度启动资源、执行任务、然后销毁。这与人类开发者所需的 SLO 有质的区别。
投资启示:原生解决 Agent-权限-性能-沙箱三角关系的云提供商,将创造一个粘性极强的新工作负载类别。在 AWS 上构建 Agent 基础设施的公司不仅被数据引力锁定,更因为 AWS 提供了 Agent 专属的原生能力,而其他平台无法复制。
Agent 带来的问题:人类开发者通常通过与其应用上下文绑定的明确接口访问数据。而 Agent 则"乐于跨越大量不同的数据源"——它们需要同时发现并交叉引用存储在各 S3 存储桶、Aurora 数据库和其他服务中的数据。
AWS Context(测试中):AWS 正在构建一个名为 AWS Context 的专用"上下文层",允许 Agent 在整个组织 AWS 数据格局中发现和遍历数据。这在概念上类似于 RAG(检索增强生成)基础设施,但定位在云提供商层级——不是应用层工具,而是平台级服务。
战略意义:通过提供云原生上下文层,AWS 成为多 Agent 系统的默认数据编排者。每个需要从 S3 读取、查询 Aurora 或访问 Lambda 输出的 Agent 都将经过 AWS 的上下文层,在现有的存储护城河之上创建一个新的数据路由护城河。
Agent Core 与 Bedrock:除数据层外,AWS 还提供明确面向 Agent 的服务——Agent Core 和 Bedrock。Bedrock 提供模型访问层(集成 Anthropic、OpenAI 等前沿模型),而 Agent Core 提供编排层。二者共同形成"在 AWS 上构建 Agent"的垂直整合技术栈。
前所未有的投入规模:AWS 2026 年 2200 亿美元的 CapEx 被 Garman 称为"可能是任何公司在单一年度中最大的一笔支出"。200 万颗新 Discover GPU 已下单。这不是一时的 AI 热潮——Garman 表示"我们预计不会很快减速,因为需求实在太庞大了。"
分配的难题:AWS 面临一个根本性张力:"前沿实验室消耗了所有可用的 GPU。同时,你又需要扶持那些将成为明日企业的新一代公司。"AWS 的应对方案是明确的配额制:为初创企业保留专用容量,同时服务前沿实验室(Anthropic、OpenAI、Meta)和大企业(Salesforce、JPMorgan)。
瓶颈的动态转移:约束层是动态变化的。在不同的时间点,电力、数据中心建设、资本部署、内存、芯片、建筑工人都是瓶颈。Garman 指出"建筑工人是我们当前的稀缺资源"——劳动力而非硅片,是目前最紧的约束。
投资启示:CapEx 军备竞赛使 NVIDIA(GPU 供应商)、建筑公司(数据中心建设者)和电力/公用事业公司(能源供应)受益。AWS 多元化的客户基础降低了集中度风险,但如此庞大的承诺意味着执行风险和需求的实现仍是需要持续监控的关键变量。
权限模型的问题:Garman 明确表示:"你不需要给它 [Agent] 无所不能的全局权限。让它去做你能做的,但不要给它所有权限。"Agent 需要一个质变的安全模型:时间限定、短期、以任务为范围、细粒度控制的权限。这不是渐进式改进——这是一个全新的权限范式。
Firecracker 微虚拟机作为基础:AWS 约十年前发明的 Firecracker,在 Agent 时代意外变得具有战略意义。Garman 指出,"很多沙箱公司初创企业使用 Firecracker","它对 Agent 非常好,因为你可以极其快速地启动它",同时具备"出色的安全边界",相比传统虚拟机几乎没有虚拟化开销。
沙箱架构:理想的 Agent 沙箱需要(1)以机器速度快速启动/销毁,(2)强隔离边界,(3)最小化开销。Firecracker 同时满足这三点。这给 AWS 带来了结构性优势:Agent 所需的沙箱原语正是 AWS 发明并持续掌控的。
扩展风险与供应链攻击:播客将这些框架为 AI 基础设施的关键安全关切。随着 Agent 获得更高的自主性和系统访问权限,攻击面急剧扩大。AWS 的应对方案是将安全嵌入 Agent 原语中,而非事后打补丁。
Graviton —— 现象级成功:AWS 的 ARM 架构 Graviton 芯片现在是每年出货量最大的实例类型。"我们 Top 100 客户中超过 90% 都以某种形式使用 Graviton。"Garman 称迁移到 Graviton 是"客户降低账单的最简单方式"。这是云领域最成功的自研芯片故事。
Tranium —— AI 推理芯片:AWS 的第一代推理芯片,现已发展到第三代(Tranium 3),正在运行"Bedrock 上大部分流量"。与 Anthropic 和 OpenAI 的突破性合作使 AWS 在 Bedrock 推理上"构建于 Tranium 之上"。Garman 确认,"今天大部分 Bedrock 推理"运行在 Tranium 上。
战略逻辑:自研芯片服务于两个目的:(1)为客户创造成本优势(Graviton 降低账单,Tranium 降低推理成本),(2)摆脱对 NVIDIA 的供应链依赖。在 GPU 持续短缺的背景下,Tranium 为 AWS 提供了不受 NVIDIA 生产计划约束的增量推理能力。
投资启示:AWS 的自研芯片战略压缩了云计算和推理的成本曲线,创造出自我强化的竞争优势:更低的价格吸引更多工作负载,更多工作负载 justified 更多芯片投资,更多芯片进一步降低成本。
Bedrock 的结构优势:Garman 解释了核心设计原则:"如果你运行在 Bedrock 内部,你的数据不会回流到模型提供商。"这一数据驻留保障对企业客户乃至前沿实验室自身都至关重要。OpenAI 的工作负载正迁移到 Bedrock,正是出于这一架构原因。
多模型市场:Bedrock 提供了一个统一的接口来访问 Anthropic、OpenAI 等模型。大部分 Bedrock 流量运行在 Tranium 芯片上,使 AWS 能够控制推理层的成本。这形成了一个飞轮:更多模型吸引更多客户,更多客户 justify 更多 Tranium 投资,更多 Tranium 降低推理成本,更低成本吸引更多模型。
"构建于……之上"的协议:AWS 已与 Anthropic 和 OpenAI 达成了在 Bedrock 内部的 Tranium 上运行其模型的具体协议。这不仅仅是转售关系——而是深度的基础设施整合,前沿实验室在推理经济性上依赖 AWS 的芯片。
投资启示:Bedrock 是 AWS 对"模型层"问题的答案。AWS 不与前沿竞争构建最佳模型,而是定位为托管所有前沿模型的中立基础设施层。这避免了厂商-客户之间的冲突,使 AWS 无论哪个模型胜出都不可或缺。
集中度风险论点:NeoCloud 提供商(及部分其他 AI 原生基础设施公司)表现出"30%、40%、50%、60% 的产能集中在一个或两个客户身上"的风险。AWS 对单一客户的敞口是"个位数百分比——不算最高,通常还低于此数"。这种多元化是优势而非缺陷:企业客户希望其提供商的生存不依赖于某一个 AI 实验室的成功。
"不存在泡沫"论点:Garman emphatic 地否认 AI 支出存在泡沫。企业"正在获得正向投资回报",直接询问时,"几乎所有人都会说是的"。驱动 AI 支出的工作负载——核心计算、存储和推理作为真实应用的一部分——"都不会消失。"
上云迁移红利:尽管有 AI 叙事,"仍有海量工作负载今天运行在本地。"更广泛的上云迁移——与 AI 分开——继续提供结构性增长。AI 是在一个已经增长的上云采用曲线上的叠加。
风投类比:Garman 将当前 AI 初创企业环境与经典风险投资相类比:"每一个十亿级初创企业都会成功吗?不会。但这就是风投的玩法。五十年都是如此。"AWS 押注 10 家初创企业,其中一家成功就覆盖了其他 10 家的成本。这就是 AWS 既能保留初创企业容量、又能服务前沿实验室的原因。
内部变革:Garman 分享称,在 AWS 内部,范式已经翻转:"它真的是 Agent 优先——Agent 编写所有代码。人类管理 Agent。"这正是 AWS 向客户出售的同一种变革,发生在全球最大的工程组织之一内部。
工程师的新角色:工程师不再逐行编写代码。他们管理着编写代码、调试系统、管理基础设施的 Agent 团队。这是对"AWS 工程师"职责的根本性重新定义——同时也是 Agent 优先云本身的试验场。
AWS 自身实践的意义:当 AWS 自身的工程组织运行在 Agent 优先原则之上时,它获得了基础设施痛点(延迟、权限、沙箱管理、上下文层)的第一手经验——而这些痛点是每个客户最终都会面临的。这创造了一个产品开发飞轮:AWS 体验问题、构建解决方案、然后将这些方案出售给将面临相同问题的客户。
新初创企业范式:Garman 指出,初创企业现在从"首日估值十亿美元"起步,拥有"2 亿美元资金"——与早期 AWS 时代"1000 万资金加一个 App 想法"相比,这是巨大的变化。AI 模型训练从一开始就需要更多资本。但基本原则不变:"你押注 10 家,一家成功就覆盖了其他 10 家的成本。"
AWS 不是在现有服务上迭代——它正在为 Agent(而非人类)作为主要计算参与者的范式,构建全新的原语(Agent Core、AWS Context、任务级权限、微虚拟机沙箱)。这是自 EC2 以来最重大的云架构变革。拥有这些原语的公司将定义 Agent 时代。
2026 年 2200 亿美元的 CapEx 被描述为可能是企业历史上单笔年度资本支出规模最大的项目。200 万颗 GPU 已下单,且未见减速迹象,AI 基建扩建仍处在早中期阶段。约束正从硅片转向建筑劳动力和电力——但方向毫无疑问是向上的。
Graviton 已在 AWS Top 100 客户 90% 以上的集群中运行。Tranium 3 powering 大部分 Bedrock 推理。这些芯片共同使 AWS 获得了对 NVIDIA 的供应链独立性,以及自我强化的成本优势:更低的价格吸引更多工作负载,更多工作负载 justify 更多芯片投资,进一步降低成本。
通过在自有 Tranium 芯片上托管前沿模型(Anthropic、OpenAI)并提供数据驻留保障,AWS 成为整个 AI 生态系统的中立基础设施层。前沿实验室需要AWS 来获得推理经济性;企业客户需要AWS 来获取模型访问权而无需数据泄露。这种中立性创造了单一模型竞争者无法逾越的护城河。
Garman 的"不存在泡沫"论点基于一个简单事实:在 AWS 上部署 AI 的企业正在获得正向回报,且"几乎所有人"在被询问时都确认了这一点。加上本地到云迁移的持续红利,需求基础是真实的经济价值创造,而非投机性 FOMO。风投类比依然成立:大多数初创企业会失败,但托管所有初创企业的平台方 Regardless 胜出。
| 跟踪维度 | 当前状态 | 关键指标 | 信号 | 下次检查 |
|---|---|---|---|---|
| AWS CapEx 趋势 | 26 年 2200 亿,已订购 200 万 GPU | 季度 CapEx、GPU 交付时间表、数据中心完工率 | 看多 | 下次财报电话会 |
| GPU 分配策略 | 明确为初创企业保留配额 + 前沿实验室 + 企业 | 初创企业 GPU 利用率、前沿实验室合约续约 | 看多 | 2027 上半年 |
| Agent 基建采用率 | AWS Context(测试中)、Agent Core、Bedrock Agent | 每个 AWS 账号的 Agent 数量、Agent Core 采用率 | 关注 | 2027 上半年 |
| Graviton 渗透率 | Top 100 客户中 90% 以上 | Graviton 实例出货量 vs x86、客户成本节约 | 看多 | 持续跟踪 |
| Tranium / Bedrock 推理 | Tranium 3,运行 Bedrock 大部分流量 | Tranium 上的 Bedrock 推理量 vs GPU、新模型合作 | 看多 | 下次财报电话会 |
| NeoCloud 集中度风险 | 30-60% 单一客户集中度 vs AWS <10% | NeoCloud 客户集中度、提供商存活率 | 看多(对 AWS) | 2027 |
| 企业 AI ROI | "几乎所有人"报告正向 ROI | 客户 AI 支出留存率、工作负载留在 AWS 的比例 | 看多 | 持续跟踪 |
| 上云迁移 | "海量"工作负载仍在本地 | 云迁移率、AWS 新客户获取 | 看多 | 季度 |
| 内部 Agent 优先采用 | "Agent 编写所有代码,人类管理 Agent" | Agent 内部代码生成量、工程生产力指标 | 关注 | 2027 上半年 |
| 建设与电力约束 | 建筑工人 = 当前瓶颈 | 数据中心开工/完工量、电力并网进度 | 选择性 | 2027 上半年 |
~56 分钟 · 全文翻译 · a16z 播客 · 2026-10-08