CABINET / The Physical Stack of AI / Neocloud
传统云玩家横扫
一句话定位
传统云巨头(Hyperscaler,超大规模云服务商)和 Meta 既是 Neocloud 的上游客户、融资担保方,又是它最危险的竞争对手——理解这种复杂关系,才能判断 Neocloud 的生存窗口有多宽。
一、为什么要把传统云和 Neocloud 放在同一个框架里看?
前六篇(参见 01-Neocloud作为新资产类别 和 02-AI算力商品化路径)把 Neocloud 当作一个独立赛道来研究。但有一个视角始终缺失:Neocloud 的客户、Neocloud 的资金来源、Neocloud 的最终威胁,统统来自同一批传统云玩家。
具体来说:
- CoreWeave 62% 的收入来自 Microsoft(Azure)。如果 Microsoft 明天削减采购,CoreWeave 会立刻陷入财务危机。(参见 04-公司画像-CoreWeave)
- Google 和 Amazon 都投资了 Anthropic,Anthropic 是 CoreWeave 和 Nebius 的重要潜在客户。
- Microsoft 投资了 CoreWeave,同时又是 CoreWeave 最大的直接竞争对手(Azure GPU 实例)。
这不是普通的竞争关系,而是一种”我养你、我用你、我也可以取代你”的不对称结构。研究 Neocloud 而不把这个结构讲清楚,分析就是不完整的。
本篇补齐这块拼图。
二、四大玩家逐一拆解
2.1 AWS:自研芯片的最认真执行者
基本盘
AWS 是全球最大的云服务商,2025 年云收入约 $1100 亿,占亚马逊总收入的 17%,但贡献了 60% 以上的营业利润。AI 是 AWS 当前的第一增长叙事。
芯片策略:Trainium + Inferentia
AWS 的自研 AI 芯片分两条线:
Trainium(训练加速芯片):专门用于 AI 模型训练(Training),是 NVIDIA H100/H200 的直接竞争者。AWS 希望客户用 Trainium 跑训练,而不是用昂贵的 NVIDIA GPU。
- Trainium 1:2020 年发布,初代产品,生态不成熟
- Trainium 2:2023 年 re:Invent 发布,2024 年全面上线,单实例最多 16 颗 Trainium 2,与 H100 竞争
- Trainium 3:2024 年 re:Invent 发布,采用 3nm 制程(比 Trainium 2 更先进的芯片制造工艺),计算能力翻倍,能耗效率提升 40%,预计 2025 年底量产
Inferentia(推理加速芯片):专门用于 AI 模型推理(Inference),即让训练好的模型对外提供服务。推理比训练更高频、成本更敏感,Inferentia 的定价比 NVIDIA 便宜。
两条线形成”训练用 Trainium,推理用 Inferentia”的组合,理论上一个 AI 应用的全生命周期都可以在 AWS 自研芯片上完成。
但生态是短板:NVIDIA 的 CUDA(一种让开发者写 GPU 程序的软件框架,类似 iPhone 的 App Store 对开发者的吸引力)经过十多年积累,拥有海量代码库和工具链。Trainium 需要用户重新适配代码,切换成本高。
与 NVIDIA 的关系:边用边防
AWS 仍然是 NVIDIA GPU 的大客户,EC2 P 系列实例(P4、P5)配备 H100/H200,供给无法或不愿迁移到 Trainium 的客户使用。
这是一种”双轨并行”战略:给客户选择权(NVIDIA GPU 或 Trainium),同时逐步压缩对 NVIDIA 的依赖。
与 Neocloud 的关系
AWS 与 Neocloud 是直接竞争关系,没有 Microsoft 那样的投资纠缠。AWS 的反击手段是:
- 让 Trainium 成本更低,吸引价格敏感的 AI 客户
- 用 Bedrock(AWS 的 AI 模型托管平台,客户可以直接调用 Anthropic Claude、Meta Llama 等主流大模型的 API)做生态锁定——你用了 Bedrock 的模型 API,就很难迁移到 CoreWeave
对 Neocloud 的威胁程度:中等。AWS 体量大、决策慢,短期内不会大幅降价;但 Trainium 一旦生态成熟,会削弱 Neocloud 的”NVIDIA 专用算力”差异化卖点。
2.2 Azure:与 Neocloud 关系最复杂的玩家
OpenAI 绑定:最强的 AI 生态护城河
Microsoft 累计投资 OpenAI 超过 $130 亿,Azure OpenAI Service 让 Azure 客户直接使用 GPT-4o、o3 等模型。OpenAI 的主要算力跑在 Azure 上——这意味着 Azure 的 GPU 采购量直接受 OpenAI 的训练需求驱动。
这是一把双刃剑:
- 优势:只要 OpenAI 继续做最强的模型,Azure 就是 AI 工作负载最密集的云平台,客户自然跟随
- 风险:如果 OpenAI 推进”去 Azure 化”(就像 2025 年 CoreWeave 大单所暗示的),Azure 的 AI 护城河会出现裂缝
Maia 100:自研芯片的追随者
Maia 100 是 Microsoft 的自研 AI 训练芯片,2023 年 Ignite 大会发布。比 AWS Trainium 晚几年,目前主要在 Microsoft 内部(Azure 数据中心)使用,尚未全面对外开放。Maia 100 的定位与 Trainium 类似,但商业化进度更慢。
投资 CoreWeave:竞争对手还是战略外包?
Microsoft 是 CoreWeave 的股东之一。从表面上看很矛盾——为什么要投资一个直接竞争对手?
逻辑如下:Azure 的数据中心建设需要 2-3 年周期。当 OpenAI 的训练需求爆发式增长时,Azure 自己的 GPU 产能跟不上,短期内需要外包给 CoreWeave。CoreWeave 等于是 Azure 的”弹性算力外包商”。
但这个关系有一个隐含风险:CoreWeave 对 Microsoft 的依赖远大于 Microsoft 对 CoreWeave 的依赖。Microsoft 随时可以减少采购(转而自建或转向其他 Neocloud),CoreWeave 却无法在短期内替代 Microsoft 62% 的收入来源。
Oracle Database@Azure:算力弹性的另一条线
2023 年 Microsoft 和 Oracle 宣布合作:Azure 客户可以在 Azure 控制台内使用 Oracle 的数据库服务,数据实际运行在 Oracle Cloud Infrastructure(OCI)上。(参见 06-公司画像-Oracle)
这是另一种形式的算力弹性:当 Azure GPU 不足时,可以调用 OCI 的算力。Azure 不需要自己建更多数据中心,而是用合作伙伴关系填充供给缺口。
对 Neocloud 的威胁程度:高。Azure 既是 Neocloud 最大的客户,也是最有动机消化 Neocloud 的玩家(通过自建 + Maia + 投资 CoreWeave 三管齐下)。
2.3 GCP:技术上最独立,商业上最弱
TPU:最彻底的自研路线
Google 的 TPU(Tensor Processing Unit,张量处理单元,Google 专门为 AI 计算设计的芯片)是三大云中最成熟的自研 AI 芯片。从 2015 年第一代至今,已迭代到 TPU v7,Google 内部(训练 Gemini 等模型)大量使用 TPU。
关键点:Google 对 NVIDIA 的依赖是三大云中最低的。Gemini 系列模型的训练主要跑在 TPU 上,不需要采购 NVIDIA H100。这让 Google 在 GPU 供应链博弈中有真正的独立性——不受 NVIDIA 定价权影响。
但 TPU 的问题也在于此:生态封闭。TPU 最适配 TensorFlow(Google 自己的 AI 框架),对 PyTorch(目前 AI 研究者使用最广泛的框架)的支持较弱,切换门槛高。AI 创业公司和研究机构普遍用 PyTorch,这让 TPU 的市场推广受限。
GCP 的 TPU 外部商业化(即非 Google 内部使用的 TPU 租赁)增速远不如 AWS 的 GPU 实例,客户黏性不如 CUDA 生态。
Anthropic 投资:对冲 Microsoft/OpenAI 的棋局
Google 和 Amazon 共同投资了 Anthropic(Claude 系列模型的开发商),投资额各约 $30 亿。GCP 客户可以通过 Vertex AI(GCP 的 AI 平台,类似 AWS Bedrock,提供一站式模型部署和微调服务)直接使用 Claude。
这是一步对冲棋:Microsoft 有 OpenAI,Google + Amazon 有 Anthropic。如果 Claude 成为第二强的 AI 模型,GCP 的模型生态就不会被 Azure 垄断。
与 Neocloud 的关系
GCP 与 Neocloud 的竞争关系相对单纯——没有投资关系,没有重大客户依赖。GCP 的 AI 客户画像偏向企业级(大型数据合规需求),与 Neocloud 主打的 AI 原生公司(AI-native,指以 AI 为核心业务的初创或成长期公司)有一定客户分层。
对 Neocloud 的威胁程度:中等偏低。GCP 是三大云中商业化能力最弱的一个,但 TPU 的技术独立性让它长期来看不需要依赖 Neocloud。
2.4 Meta:特殊玩家,不卖云但塑造市场
Meta 不是云服务商,不向外部出售 GPU 算力。但它是 AI 算力市场中最不应该被忽略的玩家,原因有三:
MTIA:巨头级自研芯片
MTIA(Meta Training and Inference Accelerator,Meta 训练与推理加速器,Meta 自主设计的 AI 专用芯片)从 2023 年开始部署。Meta 目前的战略是将推理工作负载逐步迁移到 MTIA,同时保留 NVIDIA GPU 用于大规模训练。
MTIA v1(2023 年):主要用于推荐系统(Feed、广告排序等)的推理 MTIA v2(2024 年):拓展到更多 AI 推理场景,算力效率进一步提升
Meta 的目标不是替代所有 NVIDIA GPU,而是针对推理场景(Meta 广告系统每天要运行数十亿次推理请求)用自研芯片降低成本。
Llama 开源:重塑算力需求分布
Meta 的 Llama 系列(Llama 3 于 2024 年发布,Llama 4 于 2025 年发布)是目前最被广泛使用的开源大语言模型。
开源 Llama 对 Neocloud 的影响是双面的:
利好:
- 大量中小 AI 公司用 Llama fine-tune(微调)自己的模型,需要 GPU 算力,可能租用 Neocloud
- Llama 降低了 AI 模型的准入门槛,扩大了整个 AI 算力市场的蛋糕
利空:
- 如果用开源 Llama 就能完成大部分任务,AI 公司对闭源模型(GPT-4o、Claude)的依赖降低,进而对 Azure OpenAI Service 和 Bedrock 的粘性下降
- Neocloud 的客户(AI 实验室)如果转向”用开源模型 + 少量算力自训”模式,大规模算力需求可能收缩
Meta 自身的 GPU 需求:NVIDIA 的超级买家
2024 年 Meta 宣布到年底将部署超过 35 万张 NVIDIA H100,2025 年进一步扩张到 60 万张以上。Meta 是全球最大的 NVIDIA GPU 买家之一(与 Microsoft 并列)。
这对 Neocloud 的含义:当 Meta 这样的巨头大规模采购时,NVIDIA GPU 的供给就更紧张,Neocloud 能拿到的 allocation(分配份额)就更少。Meta 和 Neocloud 在 NVIDIA 的供给链上是隐性竞争者。
三、CSP-Neocloud 关系矩阵
| 玩家 | 对 Neocloud 的角色 | 关系类型 | 当前依存度(Neocloud 视角) |
|---|---|---|---|
| Microsoft (Azure) | 最大客户 + 投资方 + 竞争对手 | 三角关系 | 极高(CoreWeave 62% 收入) |
| AWS | 直接竞争对手 | 纯竞争 | 低(无直接资金关联) |
| Google (GCP) | 间接竞争对手 + Anthropic 共同投资方 | 弱竞争 | 低 |
| Meta | 算力市场的间接压制者 | 竞争 GPU 供应 | 中(影响 NVIDIA 分配) |
| Oracle (OCI) | 部分竞争 + 算力补充方 | 灰色地带 | 中(DGX Cloud 合作) |
关键不对称性:Neocloud 对传统云的依赖,远大于传统云对 Neocloud 的依赖。CoreWeave 失去 Microsoft 会死,Microsoft 失去 CoreWeave 只是麻烦。
四、AI 实验室供应链分析:谁从哪里买算力?
AI 实验室(Foundation Model Labs,基础模型实验室)是 Neocloud 和传统云的主要争夺对象。
4.1 OpenAI:去云化的标志性行动
OpenAI 是 AI 算力需求最集中的单一买家。其供应链演变:
2019-2024 年:几乎全部算力来自 Azure。Microsoft 的 $130 亿投资换取的是 OpenAI 使用 Azure 作为主要计算平台。
2025 年转折点:
- 2025 年 3 月:CoreWeave 与 OpenAI 签署 $11.9B / 5 年协议,成为 Neocloud 历史上最大单笔合同
- Stargate 项目(OpenAI + Oracle + SoftBank 的联合计划)宣布在美国建设 $1000 亿规模的 AI 数据中心,OpenAI 将部分算力转移到 Oracle 自建基础设施上
供应链去中心化的信号是明确的:OpenAI 不想把所有鸡蛋放在 Azure 这一个篮子里。动机有三:
- 成本控制(Azure 加价层让训练成本高于直接租用 Neocloud)
- 谈判筹码(有了 CoreWeave 和 Stargate 作为选项,对 Microsoft 的议价能力提升)
- 长期独立性(随着 OpenAI 探索 IPO,降低对 Microsoft 的依赖是投资者希望看到的)
供应链结构(2026 年预估):
- Azure:仍占 OpenAI 算力的 50% 以上(短期内不可能大幅下降)
- CoreWeave:占比快速上升,估计 20-30%
- 自建(Stargate):处于建设期,2026-2027 年逐渐投入使用
4.2 Anthropic:被两个云争夺的模型公司
Anthropic 同时获得 Google($30 亿)和 Amazon($40 亿)的投资,两家云都提供算力并希望绑定 Anthropic。
实际算力分布:Anthropic 以 AWS 为主要云平台(Amazon 投资更多,且 Anthropic 的 Claude 在 AWS Bedrock 上优先上线)。Google Cloud 是次要平台。
对 Neocloud 的启示:Anthropic 没有大规模使用 Neocloud,这是因为 Google 和 Amazon 用投资换来了算力绑定。Neocloud 抢不过有投资关系的大云平台。
4.3 xAI(Elon Musk 的 AI 公司):自建派代表
xAI 在 2024 年以惊人速度自建了 Memphis 数据中心(100,000 张 H100,45 天内完成从空地到上电),成为算力自建速度的世界纪录。
这对 Neocloud 的启示是负面的:超级富翁+有执行力的团队可以绕过 Neocloud,直接自建。不是每个 AI 实验室都会选择租用。
4.4 Mistral(欧洲领先的开源大模型公司):Neocloud 的真实客户画像
Mistral 是中型 AI 实验室的代表,没有 OpenAI 那样的资金规模,也没有自建能力。这类公司是 Neocloud 最真实的客户来源:
- 需要大量 GPU 但买不起自建数据中心
- 没有被大云投资绑定(保持独立性)
- 对 GPU 型号有具体要求(NVIDIA H100/H200/B200)
AI 实验室算力来源分类:
| 类型 | 代表 | 主要算力来源 | Neocloud 机会 |
|---|---|---|---|
| 超大型(>$100亿融资) | OpenAI、xAI | 自建 + Azure/AWS | 有限(OpenAI 已有 CoreWeave;xAI 自建) |
| 大型($10-100亿融资) | Anthropic、Cohere | 战略投资方云平台 | 低(被投资绑定) |
| 中型($1-10亿融资) | Mistral、Stability AI | Neocloud + 公有云混合 | 主战场 |
| 小型研究机构 | 各大学 AI Lab | 公有云按需实例 | 低(用量小,不需要专用集群) |
五、自建 vs. 租用 Neocloud 的经济账
这是判断 Neocloud 长期需求的核心问题:当 AI 公司规模足够大时,自建是不是比租用 Neocloud 更合算?
5.1 成本结构比较
以建设一个 10,000 张 H100 集群为例(2025 年价格基准):
自建方案:
- 硬件采购:H100 ~$3 万/张 × 10,000 = $3 亿
- 数据中心建设(土地、电力、冷却、机架):$1-2 亿
- 人力(运维团队、网络工程师、基础设施团队):$2000-5000 万/年
- 总初始资本支出(CapEx):$4-5 亿
- 设备折旧周期:3-5 年(GPU 技术迭代快,实际有效期可能 2-3 年)
租用 Neocloud(CoreWeave 等):
- 市场价:H100 约 $2-3/小时/张
- 10,000 张全年全时使用成本:$2/小时 × 10,000 × 8760 = $1.75 亿/年
- 无需承担折旧风险,无需运维团队
- 但长期合同(3-5 年)通常有折扣,实际价格可能更低
盈亏平衡测算:
- 自建前期成本 $4-5 亿,年运营成本 $5000 万
- 租用年成本 $1-2 亿(含折扣合同)
- 如果 GPU 满负载运行,大约 3-4 年后自建才比租用更便宜
- 但 3-4 年后,B200/Blackwell 等更新一代 GPU 已经上市,自建的 H100 在算力效率上已经落后
关键洞察:自建的成本优势需要至少 3-4 年才能显现,但 AI 芯片的技术迭代周期也是 2-3 年。这意味着除了最大规模的 AI 公司,租用 Neocloud 在财务上通常更合理。
5.2 非财务因素
自建的优势:
- 算力控制权(网络拓扑、存储架构完全自主)
- 安全性(敏感模型权重不经过第三方服务器)
- 长期可预期成本(不依赖 Neocloud 的合同条款)
自建的劣势:
- 建设周期 18-24 个月(从土地审批到上电运行)
- 执行风险高(xAI 能 45 天完成是极端个例,多数公司无法复制)
- GPU 技术快速迭代导致折旧风险
租用 Neocloud 的优势:
- 即时可用(天级别而非月级别)
- 技术风险外包(Neocloud 负责机房运维和硬件升级)
- 财务弹性(不需要大额 CapEx,保留资金用于研发)
结论:对于年 GPU 小时需求在 1000 万小时以下的 AI 公司,租用 Neocloud 是财务最优选。超过这个规模,自建+Neocloud 混合才有意义。这个门槛意味着中型 AI 实验室(Mistral、Cohere 级别)是 Neocloud 的稳定需求来源。
六、Neocloud 五大生存场景
根据上述分析,Neocloud 赛道的未来取决于以下几个核心变量的组合:
- AI 训练规模是否持续扩大(Scaling Law 是否继续有效)
- 传统云的自研芯片能否大规模替代 NVIDIA GPU
- AI 实验室是否大规模自建算力
- NVIDIA GPU 供给是否趋于宽松(商品化)
场景一:Neocloud 黄金期延续(2026-2027)
- 条件:Scaling Law 继续,AI 实验室需求高增长;传统云 GPU 缺货;自研芯片生态不成熟
- 结果:CoreWeave、Nebius 等收入高速增长,IPO 后市值飙升
- 概率评估:35%
场景二:需求放缓 + 供给过剩(“AI 寒冬小周期”)
- 条件:大模型性能提升边际效益递减;NVIDIA Blackwell 大规模出货缓解供给紧张;传统云开始降价
- 结果:Neocloud GPU 利用率下降,长期合同客户开始违约或不续签,股价大幅回调
- 概率评估:25%
场景三:传统云通过投资吃掉 Neocloud
- 条件:Microsoft 进一步增加 CoreWeave 持股,最终并购;或 AWS/GCP 通过投资 + 采购 binding 主要 Neocloud 玩家
- 结果:Neocloud 作为独立上市公司消失,但 GPU 专用服务作为传统云的一个细分品牌继续存在
- 概率评估:20%
场景四:AI 实验室自建取代 Neocloud
- 条件:OpenAI Stargate、xAI Memphis 模式被更多 AI 公司复制;资本市场继续支持 AI 公司大规模 CapEx
- 结果:Neocloud 的头部客户(AI 实验室)逐渐迁出,Neocloud 下沉到中小客户市场,估值收缩
- 概率评估:15%
场景五:Neocloud 向上整合,从”租 GPU”升级为”AI 基础设施平台”
- 条件:CoreWeave 等在 GPU 租赁上积累的网络效应和数据,演化为 MLOps 工具、AI 开发平台
- 结果:Neocloud 从”卖算力”转向”卖 AI 开发服务”,估值倍数提升
- 概率评估:5%
当前最可能路径:场景一和场景二的混合,即 2026 年前后经历高速增长,2027-2028 年随供给扩张和自研芯片成熟进入估值回调期。投资者需要在场景一的高潮期前出场。
八、五条核心判断
判断一:Hyperscaler 不会颠覆 Neocloud,但会持续压缩 Neocloud 的利润天花板
自研芯片(Trainium/Maia/TPU)生态需要 3-5 年才能真正替代 NVIDIA GPU,在此之前 Neocloud 有明确的生存空间。但随着三大云降价和生态改善,Neocloud 的定价溢价会逐步收窄。Neocloud 的超额利润窗口大约是 2024-2027 年。
判断二:Microsoft 与 CoreWeave 的关系是 Neocloud 赛道最大的单一风险因子
CoreWeave 62% 的收入来自 Microsoft,这不是”客户集中度问题”,这是”生死依赖”。Microsoft 任何战略调整(Maia 商业化提速、Azure 自建产能扩张、与其他 Neocloud 签约)都会直接冲击 CoreWeave 的估值。这一指标必须每季度追踪。
判断三:AI 实验室的”去云化”是趋势,但速度比想象中慢
OpenAI 的 CoreWeave 大单和 Stargate 计划确实是去云化的信号,但 Azure 仍然是 OpenAI 算力的主体,且 Microsoft 的 $130 亿投资形成深度利益绑定,短期内不会彻底解除。去云化是 3-5 年的方向性趋势,不是 2026 年就会爆发的事件。
判断四:Meta 的 MTIA 和 Llama 战略对 Neocloud 的影响是间接且负面的
Meta 自建 MTIA 减少了对外部 GPU 的推理需求;Llama 开源降低了 AI 实验室对闭源模型的依赖,可能收缩大规模训练的必要性。Meta 不是 Neocloud 的直接竞争对手,但它的战略选择会收缩 Neocloud 的潜在市场空间。
判断五:Neocloud 的投资价值取决于你对 AI Scaling Law 的信念
如果你相信模型规模仍然是性能提升的关键(Scaling Law 继续有效),那么对 GPU 的需求会持续膨胀,Neocloud 有更长的增长跑道。如果你认为 Scaling Law 已经接近瓶颈(边际收益递减),AI 公司会把预算从”买算力”转向”优化算法”,Neocloud 的需求峰值可能已经在视野内。这是整个 AI 基础设施投资的底层假设,值得持续观察。
九、改变一切的信号
- Microsoft 在 CoreWeave 合同中大规模减量(Neocloud 危机开始)
- AWS Trainium 3 被 Anthropic 或 Meta 大规模采用(自研芯片生态转折点)
- NVIDIA 宣布自己提供 AI 云服务并大幅扩张(全面颠覆 Neocloud 和三大云的格局)
- OpenAI Stargate 第一期($1000 亿)提前完工,算力完全自给(去云化提速)
- AI 大模型集体遭遇性能天花板(Scaling Law 失效,算力需求收缩,整个赛道估值重置)
Backlinks
- 00-Index
- 01-Neocloud作为新资产类别
- 02-AI算力商品化路径
- 04-公司画像-CoreWeave
- 06-公司画像-Oracle