AWS vs 谷歌云 vs 阿里云 GPU 服务器对比:A100/H100 价格、配额与 AI 训练场景选型

选择哪个云平台跑 AI 训练,价格只是判断的起点。配额申请的难易程度、亚太区域的资源可用性、Spot 实例的稳定性、以及出站流量费用对长期训练任务的影响,这些因素叠加在一起,才决定了实际的 AI 训练成本。

2026 年三大云平台的 GPU 格局已经发生了明显变化。AWS 在 2025 年 6 月将 H100 实例价格下调约 44%,直接反超谷歌云,成为 H100 按需价格最低的主流云厂商。谷歌云的 A100 仍然是三大云中单 GPU 价格最低的选项。阿里云 GPU 服务(2026 年更名为 EGS,Elastic GPU Service)在国内版资源充足,但国际版的 H100 供给极为有限,主要面向亚太市场提供 A100 和 L20 实例。

三平台 GPU 资源概况

AWS 是三大云中 GPU 实例类型最多、资源最充足的平台。H100 实例(p5 系列)在 us-east-1 和 us-west-2 全量可用,A100 实例(p4d 系列)同样成熟稳定,同时提供最新的 B200 实例(p6 系列)和用于推理的 Inferentia2(Inf2)以及训练专用芯片 Trainium2(Trn2)。AWS GPU 实例的生态成熟度最高,和 SageMaker、ECS、EKS 的集成最完善。

谷歌云 的 A100 实例(a2 系列)是三大云中性价比最高的 A100 选项,GCP 在全球多个区域维持了充足的 A100 库存,配额申请审批速度快于 AWS。H100 实例(a3 系列)在 2025 年 AWS 降价后成本劣势明显,但谷歌云有一张独特的牌:TPU(Tensor Processing Unit)。TPU v5e 在主流 LLM 训练任务上的性能与 H100 接近,价格比同等计算量的 H100 便宜约 40%,是谷歌云在 AI 训练领域的核心差异化产品。

阿里云 的 GPU 服务在中国国内版(aliyun.com)有丰富的 A100、H100、L20 资源,是国内出海 AI 团队在数据合规要求下的常见选择。国际版(alibabacloud.com)的 GPU 资源集中在新加坡、香港、日本节点,主要覆盖 A100(gn7e 系列)和 L20(gn8is 系列),H100 在国际版的供给极为有限且不稳定。阿里云 GPU 国际版的核心优势是付款灵活(支持 USDT 和对公转账)、亚太节点网络延迟低,以及与阿里云其他产品的深度集成。

A100 实例按需价格对比

A100 是目前大多数中等规模 AI 训练任务(7B–70B 参数模型微调、推理部署)的主力 GPU,在成本和性能之间取得了较好的平衡。以下是三平台 A100 实例的按需价格参考(2026 年数据,美国/国际区域):

平台实例型号GPU 数量按需价格(/小时)单 GPU 成本(/小时)
谷歌云a2-highgpu-8g8 × A100 40GB~$26.24~$3.28(最低)
AWSp4d.24xlarge8 × A100 40GB~$32.77~$4.10
AWSp4de.24xlarge8 × A100 80GB~$40.96~$5.12
阿里云gn7e(国际版)1 × A100 80GB~$4.80~$4.80

谷歌云 a2-highgpu 是三大云中按需价格最低的 A100 实例,比 AWS 同等配置便宜约 20%。这个差距在长时间连续训练中相当可观:一个需要 200 小时的 70B 模型训练任务,A100 集群在谷歌云上比 AWS 便宜约 $1,306。

阿里云国际版的 A100(gn7e)单卡价格约 $4.80,略高于 AWS,且最大实例规格受限(单实例 GPU 数量少于 AWS 和 GCP 的 8 卡配置),不适合需要多机多卡并行训练的大规模任务。

A100 的抢占式实例(Preemptible/Spot)可以大幅降低训练成本,三平台折扣幅度均在 60–80% 之间。训练代码需要实现 Checkpoint 机制(定期保存训练进度),实例被回收后从上一个 Checkpoint 恢复,可以在不损失太多训练时间的情况下充分利用抢占式实例的低价。

H100 实例按需价格对比

H100 的训练吞吐量约为 A100 的 3 倍(NVLink 互联带宽大幅提升),适合需要加快训练速度的任务,或者模型规模大到 A100 单机内存不够用的场景。

平台实例型号GPU 数量按需价格(/小时)单 GPU 成本(/小时)
AWSp5.48xlarge8 × H100 SXM~$55–60~$3.90(最低)
谷歌云a3-highgpu-8g8 × H100 SXM~$88.49~$11.06
阿里云国际版极为有限

AWS 在 2025 年 6 月下调 H100 价格约 44% 后,单 GPU 成本约 $3.90/小时,明显低于谷歌云的 $11.06/小时。谷歌云 H100 的高价在很大程度上反映了其 H100 供给较 AWS 更为紧张,以及定价策略的差异。对于必须使用 H100 的团队(超大规模模型训练、需要 H100 的高内存带宽),AWS 是目前按需价格最合理的选择。

AWS H100 的 Spot 实例价格波动较大,在算力需求平稳时可以达到按需价格的 20–30%,即约 $12–18/小时(整机 8 卡)。2025 年 9 月的 Spot 实测价格约为整机 $12.16/小时,比按需价格便宜约 80%。Spot 价格持续下降的趋势预计在 2026 年下半年仍会持续,随着下一代 H200 和 B200 资源逐步释放,旧代 H100 的 Spot 价格将进一步走低。

谷歌云的 TPU 选项

如果 AI 训练任务的模型架构兼容 TPU(主要的 Transformer 架构都兼容),谷歌云的 TPU v5e 是一个不应该被忽略的选项。TPU v5e 在 LLM 训练任务上的性能与 H100 接近,按计算量折算后的训练成本比 H100 便宜约 40%。

以训练一个 70B 参数模型为例的成本估算:使用 AWS H100(p5 实例)按需训练 72 小时,整机成本约 $7,000;使用谷歌云 TPU v5e 完成同等训练,成本约 $4,000,节省约 43%。

TPU 的主要限制在于编程框架适配:TensorFlow 和 JAX 对 TPU 支持最完善,PyTorch(通过 PyTorch/XLA)也可以使用 TPU,但迁移成本视代码复杂度不同。如果训练代码完全用 PyTorch 编写且没有针对 TPU 做过适配,迁移到 TPU 的工程成本可能抵消价格优势,需要提前评估。关于谷歌云 GPU 和 TPU 实例的完整选型和配额说明,可以参考谷歌云 GPU 定价完全指南。

配额申请:三平台新账号的实际门槛

GPU 实例在三个平台的新账号下默认配额均为零,使用前必须提交申请,审批速度是影响项目上线时间的实际变量。

AWS 的 GPU 配额申请通过 Service Quotas 控制台提交,标准实例(G、P 系列)的审批周期通常在 2–4 周,新账号或消费记录稀少的账号审批更慢,有时需要多次申请或联系支持工程师介入。H100(p5 系列)和 A100(p4d 系列)的配额申请需要提供详细的使用场景说明,申请中包含具体模型规模、训练时长和商业用途的通过率明显高于模糊描述。高权重账号的配额申请审批速度更快、通过率更高,这是通过代理渠道开户的实际价值之一。关于 AI 训练的 GPU 配额申请策略和常见的配额报错处理,可以参考 谷歌云跑 AI 大模型 的配额申请说明,两个平台的申请逻辑高度相似。

谷歌云 的 GPU 配额同样从零开始,但审批周期通常比 AWS 短,大多数情况在 2–7 天内完成,部分区域的 A100 配额申请当天就能获批。GCP 的配额申请页面(IAM → 配额)比 AWS 的 Service Quotas 更直观,新账号的审批通过率相对更高,这让谷歌云在初次使用 GPU 资源时的上手体验优于 AWS。

阿里云 国际版的 GPU 资源供给主要集中在新加坡节点,A100 实例的配额申请通常需要联系销售或通过代理渠道协助处理,不像 AWS 和 GCP 有标准化的在线申请流程。H100 在国际版几乎没有稳定供给,有 H100 需求的团队不应以阿里云国际版为主力选项。

亚太区域 GPU 资源可用性

面向亚太用户提供 AI 服务(模型推理、API 接口)的团队,需要在亚太区域部署 GPU 实例,三个平台在亚太的资源分布差异明显。

AWS 在亚太的 GPU 资源主要集中在 ap-northeast-1(东京),新加坡(ap-southeast-1)和香港(ap-east-1)的 GPU 实例类型和库存明显少于美国区域。需要在亚太部署 H100 的团队,东京节点是相对最稳定的选择,但配额申请同样需要时间。

谷歌云 的 A100 在亚太区域(asia-southeast1 新加坡、asia-northeast1 东京)的供给相对充足,是三大云中亚太 A100 资源最稳定的平台。如果业务需要同时覆盖亚太用户的推理延迟和训练成本,谷歌云的新加坡节点是较优的选择。

阿里云 在新加坡和香港节点有一定的 A100 资源,且配合阿里云的整体网络架构(OSS、SLB、CDN)使用时,出站流量费相对 AWS 更低。对于出海 AI 业务同时需要存储大量训练数据和对外提供推理 API 的团队,阿里云国际版在亚太的综合成本有一定优势,尤其是训练数据的存储和访问费用低于 AWS 同等配置。

AI 训练成本实测:三平台综合对比

以训练一个 13B 参数的中文大语言模型为基准场景(使用 4 张 A100 80GB,训练时长约 120 小时):

只算 GPU 计算费用(按需实例):

  • 谷歌云(a2-highgpu):4 × $3.28 × 120 = $1,574
  • AWS(p4de,半实例):4 × $5.12 × 120 = $2,458
  • 阿里云国际版(gn7e):4 × $4.80 × 120 = $2,304

考虑出站流量(模型 Checkpoint 定期下载到本地,约 500GB):

  • 谷歌云出站费:约 $60(us-central1 出站 $0.12/GB)
  • AWS 出站费:约 $45(us-east-1 出站 $0.09/GB,前 10GB 免费)
  • 阿里云出站费:约 $60(新加坡节点 $0.12/GB)

使用 Spot/抢占式实例(折扣约 70%):

  • 谷歌云:约 $472 + $60 = $532
  • AWS:约 $737 + $45 = $782
  • 阿里云:约 $691 + $60 = $751

纯按需计算成本下谷歌云最便宜,引入 Spot 实例后差距缩小,AWS 和阿里云接近。实际训练任务中,Checkpoint 频率、数据集读取方式(是否用对象存储)、多机多卡的节点间通信成本,都会影响最终账单。上面的数字是方向性估算,不代表你的实际账单,以各平台控制台当期报价为准。

什么场景选哪个平台

选 AWS 的场景: H100 是训练任务的必要条件,或者需要在 SageMaker 上管理训练任务和模型部署的完整 MLOps 流程,或者团队已经有其他服务运行在 AWS 上希望减少平台数量。通过亚马逊云账号出售渠道获取高权重账号,GPU 配额申请更顺畅,同时通过亚马逊云代理商充值享受低至 7 折的折扣,叠加 Spot 实例后实际训练成本可以显著低于按需价格。

选谷歌云的场景: A100 是训练主力,或者任务框架兼容 TPU 且希望进一步降低训练成本,或者亚太区域(新加坡、东京)需要稳定的 GPU 资源。谷歌云的 A100 按需价格是三大云中最低的,配额申请审批也相对更快,对于首次在公有云上跑 GPU 训练的团队友好度更高。

选阿里云的场景: 业务同时覆盖国内和海外用户,需要在统一平台管理两侧资源;或者训练数据量大、存储和访问费用是主要成本项,阿里云 OSS 的存储成本和内网访问在亚太区域有优势;或者需要 USDT 或对公转账付款且不想处理信用卡问题的团队。阿里云不适合以 H100 训练为核心需求的场景。

滚动至顶部