Night Office

CABINET  / The Physical Stack of AI / Neocloud

传统云玩家横扫

9.9k 字


一句话定位

传统云巨头(Hyperscaler,超大规模云服务商)和 Meta 既是 Neocloud 的上游客户、融资担保方,又是它最危险的竞争对手——理解这种复杂关系,才能判断 Neocloud 的生存窗口有多宽。


一、为什么要把传统云和 Neocloud 放在同一个框架里看?

前六篇(参见 01-Neocloud作为新资产类别 和 02-AI算力商品化路径)把 Neocloud 当作一个独立赛道来研究。但有一个视角始终缺失:Neocloud 的客户、Neocloud 的资金来源、Neocloud 的最终威胁,统统来自同一批传统云玩家。

具体来说:

  • CoreWeave 62% 的收入来自 Microsoft(Azure)。如果 Microsoft 明天削减采购,CoreWeave 会立刻陷入财务危机。(参见 04-公司画像-CoreWeave)
  • Google 和 Amazon 都投资了 Anthropic,Anthropic 是 CoreWeave 和 Nebius 的重要潜在客户。
  • Microsoft 投资了 CoreWeave,同时又是 CoreWeave 最大的直接竞争对手(Azure GPU 实例)。

这不是普通的竞争关系,而是一种”我养你、我用你、我也可以取代你”的不对称结构。研究 Neocloud 而不把这个结构讲清楚,分析就是不完整的。

本篇补齐这块拼图。


二、四大玩家逐一拆解

2.1 AWS:自研芯片的最认真执行者

基本盘

AWS 是全球最大的云服务商,2025 年云收入约 $1100 亿,占亚马逊总收入的 17%,但贡献了 60% 以上的营业利润。AI 是 AWS 当前的第一增长叙事。

芯片策略:Trainium + Inferentia

AWS 的自研 AI 芯片分两条线:

Trainium(训练加速芯片):专门用于 AI 模型训练(Training),是 NVIDIA H100/H200 的直接竞争者。AWS 希望客户用 Trainium 跑训练,而不是用昂贵的 NVIDIA GPU。

  • Trainium 1:2020 年发布,初代产品,生态不成熟
  • Trainium 2:2023 年 re:Invent 发布,2024 年全面上线,单实例最多 16 颗 Trainium 2,与 H100 竞争
  • Trainium 3:2024 年 re:Invent 发布,采用 3nm 制程(比 Trainium 2 更先进的芯片制造工艺),计算能力翻倍,能耗效率提升 40%,预计 2025 年底量产

Inferentia(推理加速芯片):专门用于 AI 模型推理(Inference),即让训练好的模型对外提供服务。推理比训练更高频、成本更敏感,Inferentia 的定价比 NVIDIA 便宜。

两条线形成”训练用 Trainium,推理用 Inferentia”的组合,理论上一个 AI 应用的全生命周期都可以在 AWS 自研芯片上完成。

但生态是短板:NVIDIA 的 CUDA(一种让开发者写 GPU 程序的软件框架,类似 iPhone 的 App Store 对开发者的吸引力)经过十多年积累,拥有海量代码库和工具链。Trainium 需要用户重新适配代码,切换成本高。

与 NVIDIA 的关系:边用边防

AWS 仍然是 NVIDIA GPU 的大客户,EC2 P 系列实例(P4、P5)配备 H100/H200,供给无法或不愿迁移到 Trainium 的客户使用。

这是一种”双轨并行”战略:给客户选择权(NVIDIA GPU 或 Trainium),同时逐步压缩对 NVIDIA 的依赖。

与 Neocloud 的关系

AWS 与 Neocloud 是直接竞争关系,没有 Microsoft 那样的投资纠缠。AWS 的反击手段是:

  1. 让 Trainium 成本更低,吸引价格敏感的 AI 客户
  2. 用 Bedrock(AWS 的 AI 模型托管平台,客户可以直接调用 Anthropic Claude、Meta Llama 等主流大模型的 API)做生态锁定——你用了 Bedrock 的模型 API,就很难迁移到 CoreWeave

对 Neocloud 的威胁程度:中等。AWS 体量大、决策慢,短期内不会大幅降价;但 Trainium 一旦生态成熟,会削弱 Neocloud 的”NVIDIA 专用算力”差异化卖点。


2.2 Azure:与 Neocloud 关系最复杂的玩家

OpenAI 绑定:最强的 AI 生态护城河

Microsoft 累计投资 OpenAI 超过 $130 亿,Azure OpenAI Service 让 Azure 客户直接使用 GPT-4o、o3 等模型。OpenAI 的主要算力跑在 Azure 上——这意味着 Azure 的 GPU 采购量直接受 OpenAI 的训练需求驱动。

这是一把双刃剑:

  • 优势:只要 OpenAI 继续做最强的模型,Azure 就是 AI 工作负载最密集的云平台,客户自然跟随
  • 风险:如果 OpenAI 推进”去 Azure 化”(就像 2025 年 CoreWeave 大单所暗示的),Azure 的 AI 护城河会出现裂缝

Maia 100:自研芯片的追随者

Maia 100 是 Microsoft 的自研 AI 训练芯片,2023 年 Ignite 大会发布。比 AWS Trainium 晚几年,目前主要在 Microsoft 内部(Azure 数据中心)使用,尚未全面对外开放。Maia 100 的定位与 Trainium 类似,但商业化进度更慢。

投资 CoreWeave:竞争对手还是战略外包?

Microsoft 是 CoreWeave 的股东之一。从表面上看很矛盾——为什么要投资一个直接竞争对手?

逻辑如下:Azure 的数据中心建设需要 2-3 年周期。当 OpenAI 的训练需求爆发式增长时,Azure 自己的 GPU 产能跟不上,短期内需要外包给 CoreWeave。CoreWeave 等于是 Azure 的”弹性算力外包商”。

但这个关系有一个隐含风险:CoreWeave 对 Microsoft 的依赖远大于 Microsoft 对 CoreWeave 的依赖。Microsoft 随时可以减少采购(转而自建或转向其他 Neocloud),CoreWeave 却无法在短期内替代 Microsoft 62% 的收入来源。

Oracle Database@Azure:算力弹性的另一条线

2023 年 Microsoft 和 Oracle 宣布合作:Azure 客户可以在 Azure 控制台内使用 Oracle 的数据库服务,数据实际运行在 Oracle Cloud Infrastructure(OCI)上。(参见 06-公司画像-Oracle)

这是另一种形式的算力弹性:当 Azure GPU 不足时,可以调用 OCI 的算力。Azure 不需要自己建更多数据中心,而是用合作伙伴关系填充供给缺口。

对 Neocloud 的威胁程度:高。Azure 既是 Neocloud 最大的客户,也是最有动机消化 Neocloud 的玩家(通过自建 + Maia + 投资 CoreWeave 三管齐下)。


2.3 GCP:技术上最独立,商业上最弱

TPU:最彻底的自研路线

Google 的 TPU(Tensor Processing Unit,张量处理单元,Google 专门为 AI 计算设计的芯片)是三大云中最成熟的自研 AI 芯片。从 2015 年第一代至今,已迭代到 TPU v7,Google 内部(训练 Gemini 等模型)大量使用 TPU。

关键点:Google 对 NVIDIA 的依赖是三大云中最低的。Gemini 系列模型的训练主要跑在 TPU 上,不需要采购 NVIDIA H100。这让 Google 在 GPU 供应链博弈中有真正的独立性——不受 NVIDIA 定价权影响。

但 TPU 的问题也在于此:生态封闭。TPU 最适配 TensorFlow(Google 自己的 AI 框架),对 PyTorch(目前 AI 研究者使用最广泛的框架)的支持较弱,切换门槛高。AI 创业公司和研究机构普遍用 PyTorch,这让 TPU 的市场推广受限。

GCP 的 TPU 外部商业化(即非 Google 内部使用的 TPU 租赁)增速远不如 AWS 的 GPU 实例,客户黏性不如 CUDA 生态。

Anthropic 投资:对冲 Microsoft/OpenAI 的棋局

Google 和 Amazon 共同投资了 Anthropic(Claude 系列模型的开发商),投资额各约 $30 亿。GCP 客户可以通过 Vertex AI(GCP 的 AI 平台,类似 AWS Bedrock,提供一站式模型部署和微调服务)直接使用 Claude。

这是一步对冲棋:Microsoft 有 OpenAI,Google + Amazon 有 Anthropic。如果 Claude 成为第二强的 AI 模型,GCP 的模型生态就不会被 Azure 垄断。

与 Neocloud 的关系

GCP 与 Neocloud 的竞争关系相对单纯——没有投资关系,没有重大客户依赖。GCP 的 AI 客户画像偏向企业级(大型数据合规需求),与 Neocloud 主打的 AI 原生公司(AI-native,指以 AI 为核心业务的初创或成长期公司)有一定客户分层。

对 Neocloud 的威胁程度:中等偏低。GCP 是三大云中商业化能力最弱的一个,但 TPU 的技术独立性让它长期来看不需要依赖 Neocloud。


2.4 Meta:特殊玩家,不卖云但塑造市场

Meta 不是云服务商,不向外部出售 GPU 算力。但它是 AI 算力市场中最不应该被忽略的玩家,原因有三:

MTIA:巨头级自研芯片

MTIA(Meta Training and Inference Accelerator,Meta 训练与推理加速器,Meta 自主设计的 AI 专用芯片)从 2023 年开始部署。Meta 目前的战略是将推理工作负载逐步迁移到 MTIA,同时保留 NVIDIA GPU 用于大规模训练。

MTIA v1(2023 年):主要用于推荐系统(Feed、广告排序等)的推理 MTIA v2(2024 年):拓展到更多 AI 推理场景,算力效率进一步提升

Meta 的目标不是替代所有 NVIDIA GPU,而是针对推理场景(Meta 广告系统每天要运行数十亿次推理请求)用自研芯片降低成本。

Llama 开源:重塑算力需求分布

Meta 的 Llama 系列(Llama 3 于 2024 年发布,Llama 4 于 2025 年发布)是目前最被广泛使用的开源大语言模型。

开源 Llama 对 Neocloud 的影响是双面的:

利好

  • 大量中小 AI 公司用 Llama fine-tune(微调)自己的模型,需要 GPU 算力,可能租用 Neocloud
  • Llama 降低了 AI 模型的准入门槛,扩大了整个 AI 算力市场的蛋糕

利空

  • 如果用开源 Llama 就能完成大部分任务,AI 公司对闭源模型(GPT-4o、Claude)的依赖降低,进而对 Azure OpenAI Service 和 Bedrock 的粘性下降
  • Neocloud 的客户(AI 实验室)如果转向”用开源模型 + 少量算力自训”模式,大规模算力需求可能收缩

Meta 自身的 GPU 需求:NVIDIA 的超级买家

2024 年 Meta 宣布到年底将部署超过 35 万张 NVIDIA H100,2025 年进一步扩张到 60 万张以上。Meta 是全球最大的 NVIDIA GPU 买家之一(与 Microsoft 并列)。

这对 Neocloud 的含义:当 Meta 这样的巨头大规模采购时,NVIDIA GPU 的供给就更紧张,Neocloud 能拿到的 allocation(分配份额)就更少。Meta 和 Neocloud 在 NVIDIA 的供给链上是隐性竞争者。


三、CSP-Neocloud 关系矩阵

玩家对 Neocloud 的角色关系类型当前依存度(Neocloud 视角)
Microsoft (Azure)最大客户 + 投资方 + 竞争对手三角关系极高(CoreWeave 62% 收入)
AWS直接竞争对手纯竞争低(无直接资金关联)
Google (GCP)间接竞争对手 + Anthropic 共同投资方弱竞争
Meta算力市场的间接压制者竞争 GPU 供应中(影响 NVIDIA 分配)
Oracle (OCI)部分竞争 + 算力补充方灰色地带中(DGX Cloud 合作)

关键不对称性:Neocloud 对传统云的依赖,远大于传统云对 Neocloud 的依赖。CoreWeave 失去 Microsoft 会死,Microsoft 失去 CoreWeave 只是麻烦。


四、AI 实验室供应链分析:谁从哪里买算力?

AI 实验室(Foundation Model Labs,基础模型实验室)是 Neocloud 和传统云的主要争夺对象。

4.1 OpenAI:去云化的标志性行动

OpenAI 是 AI 算力需求最集中的单一买家。其供应链演变:

2019-2024 年:几乎全部算力来自 Azure。Microsoft 的 $130 亿投资换取的是 OpenAI 使用 Azure 作为主要计算平台。

2025 年转折点

  • 2025 年 3 月:CoreWeave 与 OpenAI 签署 $11.9B / 5 年协议,成为 Neocloud 历史上最大单笔合同
  • Stargate 项目(OpenAI + Oracle + SoftBank 的联合计划)宣布在美国建设 $1000 亿规模的 AI 数据中心,OpenAI 将部分算力转移到 Oracle 自建基础设施上

供应链去中心化的信号是明确的:OpenAI 不想把所有鸡蛋放在 Azure 这一个篮子里。动机有三:

  1. 成本控制(Azure 加价层让训练成本高于直接租用 Neocloud)
  2. 谈判筹码(有了 CoreWeave 和 Stargate 作为选项,对 Microsoft 的议价能力提升)
  3. 长期独立性(随着 OpenAI 探索 IPO,降低对 Microsoft 的依赖是投资者希望看到的)

供应链结构(2026 年预估)

  • Azure:仍占 OpenAI 算力的 50% 以上(短期内不可能大幅下降)
  • CoreWeave:占比快速上升,估计 20-30%
  • 自建(Stargate):处于建设期,2026-2027 年逐渐投入使用

4.2 Anthropic:被两个云争夺的模型公司

Anthropic 同时获得 Google($30 亿)和 Amazon($40 亿)的投资,两家云都提供算力并希望绑定 Anthropic。

实际算力分布:Anthropic 以 AWS 为主要云平台(Amazon 投资更多,且 Anthropic 的 Claude 在 AWS Bedrock 上优先上线)。Google Cloud 是次要平台。

对 Neocloud 的启示:Anthropic 没有大规模使用 Neocloud,这是因为 Google 和 Amazon 用投资换来了算力绑定。Neocloud 抢不过有投资关系的大云平台。

4.3 xAI(Elon Musk 的 AI 公司):自建派代表

xAI 在 2024 年以惊人速度自建了 Memphis 数据中心(100,000 张 H100,45 天内完成从空地到上电),成为算力自建速度的世界纪录。

这对 Neocloud 的启示是负面的:超级富翁+有执行力的团队可以绕过 Neocloud,直接自建。不是每个 AI 实验室都会选择租用。

4.4 Mistral(欧洲领先的开源大模型公司):Neocloud 的真实客户画像

Mistral 是中型 AI 实验室的代表,没有 OpenAI 那样的资金规模,也没有自建能力。这类公司是 Neocloud 最真实的客户来源:

  • 需要大量 GPU 但买不起自建数据中心
  • 没有被大云投资绑定(保持独立性)
  • 对 GPU 型号有具体要求(NVIDIA H100/H200/B200)

AI 实验室算力来源分类

类型代表主要算力来源Neocloud 机会
超大型(>$100亿融资)OpenAI、xAI自建 + Azure/AWS有限(OpenAI 已有 CoreWeave;xAI 自建)
大型($10-100亿融资)Anthropic、Cohere战略投资方云平台低(被投资绑定)
中型($1-10亿融资)Mistral、Stability AINeocloud + 公有云混合主战场
小型研究机构各大学 AI Lab公有云按需实例低(用量小,不需要专用集群)

五、自建 vs. 租用 Neocloud 的经济账

这是判断 Neocloud 长期需求的核心问题:当 AI 公司规模足够大时,自建是不是比租用 Neocloud 更合算?

5.1 成本结构比较

以建设一个 10,000 张 H100 集群为例(2025 年价格基准):

自建方案

  • 硬件采购:H100 ~$3 万/张 × 10,000 = $3 亿
  • 数据中心建设(土地、电力、冷却、机架):$1-2 亿
  • 人力(运维团队、网络工程师、基础设施团队):$2000-5000 万/年
  • 总初始资本支出(CapEx):$4-5 亿
  • 设备折旧周期:3-5 年(GPU 技术迭代快,实际有效期可能 2-3 年)

租用 Neocloud(CoreWeave 等)

  • 市场价:H100 约 $2-3/小时/张
  • 10,000 张全年全时使用成本:$2/小时 × 10,000 × 8760 = $1.75 亿/年
  • 无需承担折旧风险,无需运维团队
  • 但长期合同(3-5 年)通常有折扣,实际价格可能更低

盈亏平衡测算

  • 自建前期成本 $4-5 亿,年运营成本 $5000 万
  • 租用年成本 $1-2 亿(含折扣合同)
  • 如果 GPU 满负载运行,大约 3-4 年后自建才比租用更便宜
  • 但 3-4 年后,B200/Blackwell 等更新一代 GPU 已经上市,自建的 H100 在算力效率上已经落后

关键洞察:自建的成本优势需要至少 3-4 年才能显现,但 AI 芯片的技术迭代周期也是 2-3 年。这意味着除了最大规模的 AI 公司,租用 Neocloud 在财务上通常更合理。

5.2 非财务因素

自建的优势

  • 算力控制权(网络拓扑、存储架构完全自主)
  • 安全性(敏感模型权重不经过第三方服务器)
  • 长期可预期成本(不依赖 Neocloud 的合同条款)

自建的劣势

  • 建设周期 18-24 个月(从土地审批到上电运行)
  • 执行风险高(xAI 能 45 天完成是极端个例,多数公司无法复制)
  • GPU 技术快速迭代导致折旧风险

租用 Neocloud 的优势

  • 即时可用(天级别而非月级别)
  • 技术风险外包(Neocloud 负责机房运维和硬件升级)
  • 财务弹性(不需要大额 CapEx,保留资金用于研发)

结论:对于年 GPU 小时需求在 1000 万小时以下的 AI 公司,租用 Neocloud 是财务最优选。超过这个规模,自建+Neocloud 混合才有意义。这个门槛意味着中型 AI 实验室(Mistral、Cohere 级别)是 Neocloud 的稳定需求来源。


六、Neocloud 五大生存场景

根据上述分析,Neocloud 赛道的未来取决于以下几个核心变量的组合:

  1. AI 训练规模是否持续扩大(Scaling Law 是否继续有效)
  2. 传统云的自研芯片能否大规模替代 NVIDIA GPU
  3. AI 实验室是否大规模自建算力
  4. NVIDIA GPU 供给是否趋于宽松(商品化)

场景一:Neocloud 黄金期延续(2026-2027)

  • 条件:Scaling Law 继续,AI 实验室需求高增长;传统云 GPU 缺货;自研芯片生态不成熟
  • 结果:CoreWeave、Nebius 等收入高速增长,IPO 后市值飙升
  • 概率评估:35%

场景二:需求放缓 + 供给过剩(“AI 寒冬小周期”)

  • 条件:大模型性能提升边际效益递减;NVIDIA Blackwell 大规模出货缓解供给紧张;传统云开始降价
  • 结果:Neocloud GPU 利用率下降,长期合同客户开始违约或不续签,股价大幅回调
  • 概率评估:25%

场景三:传统云通过投资吃掉 Neocloud

  • 条件:Microsoft 进一步增加 CoreWeave 持股,最终并购;或 AWS/GCP 通过投资 + 采购 binding 主要 Neocloud 玩家
  • 结果:Neocloud 作为独立上市公司消失,但 GPU 专用服务作为传统云的一个细分品牌继续存在
  • 概率评估:20%

场景四:AI 实验室自建取代 Neocloud

  • 条件:OpenAI Stargate、xAI Memphis 模式被更多 AI 公司复制;资本市场继续支持 AI 公司大规模 CapEx
  • 结果:Neocloud 的头部客户(AI 实验室)逐渐迁出,Neocloud 下沉到中小客户市场,估值收缩
  • 概率评估:15%

场景五:Neocloud 向上整合,从”租 GPU”升级为”AI 基础设施平台”

  • 条件:CoreWeave 等在 GPU 租赁上积累的网络效应和数据,演化为 MLOps 工具、AI 开发平台
  • 结果:Neocloud 从”卖算力”转向”卖 AI 开发服务”,估值倍数提升
  • 概率评估:5%

当前最可能路径:场景一和场景二的混合,即 2026 年前后经历高速增长,2027-2028 年随供给扩张和自研芯片成熟进入估值回调期。投资者需要在场景一的高潮期前出场。


八、五条核心判断

判断一:Hyperscaler 不会颠覆 Neocloud,但会持续压缩 Neocloud 的利润天花板

自研芯片(Trainium/Maia/TPU)生态需要 3-5 年才能真正替代 NVIDIA GPU,在此之前 Neocloud 有明确的生存空间。但随着三大云降价和生态改善,Neocloud 的定价溢价会逐步收窄。Neocloud 的超额利润窗口大约是 2024-2027 年。

判断二:Microsoft 与 CoreWeave 的关系是 Neocloud 赛道最大的单一风险因子

CoreWeave 62% 的收入来自 Microsoft,这不是”客户集中度问题”,这是”生死依赖”。Microsoft 任何战略调整(Maia 商业化提速、Azure 自建产能扩张、与其他 Neocloud 签约)都会直接冲击 CoreWeave 的估值。这一指标必须每季度追踪。

判断三:AI 实验室的”去云化”是趋势,但速度比想象中慢

OpenAI 的 CoreWeave 大单和 Stargate 计划确实是去云化的信号,但 Azure 仍然是 OpenAI 算力的主体,且 Microsoft 的 $130 亿投资形成深度利益绑定,短期内不会彻底解除。去云化是 3-5 年的方向性趋势,不是 2026 年就会爆发的事件。

判断四:Meta 的 MTIA 和 Llama 战略对 Neocloud 的影响是间接且负面的

Meta 自建 MTIA 减少了对外部 GPU 的推理需求;Llama 开源降低了 AI 实验室对闭源模型的依赖,可能收缩大规模训练的必要性。Meta 不是 Neocloud 的直接竞争对手,但它的战略选择会收缩 Neocloud 的潜在市场空间。

判断五:Neocloud 的投资价值取决于你对 AI Scaling Law 的信念

如果你相信模型规模仍然是性能提升的关键(Scaling Law 继续有效),那么对 GPU 的需求会持续膨胀,Neocloud 有更长的增长跑道。如果你认为 Scaling Law 已经接近瓶颈(边际收益递减),AI 公司会把预算从”买算力”转向”优化算法”,Neocloud 的需求峰值可能已经在视野内。这是整个 AI 基础设施投资的底层假设,值得持续观察。


九、改变一切的信号

  • Microsoft 在 CoreWeave 合同中大规模减量(Neocloud 危机开始)
  • AWS Trainium 3 被 Anthropic 或 Meta 大规模采用(自研芯片生态转折点)
  • NVIDIA 宣布自己提供 AI 云服务并大幅扩张(全面颠覆 Neocloud 和三大云的格局)
  • OpenAI Stargate 第一期($1000 亿)提前完工,算力完全自给(去云化提速)
  • AI 大模型集体遭遇性能天花板(Scaling Law 失效,算力需求收缩,整个赛道估值重置)

  • 00-Index
  • 01-Neocloud作为新资产类别
  • 02-AI算力商品化路径
  • 04-公司画像-CoreWeave
  • 06-公司画像-Oracle