大模型训练 GPU 云怎么配?2026 年单卡、多卡、RDMA 和存储网络配置对比

AI 摘要 / TL;DR

GPU 训练集群不能只看显卡型号,算力、互联、存储必须一起配。单卡和 4 卡阶段优先本地 NVMe 和 PCIe;8 卡以上必须把 NVLink/NVSwitch、RDMA 和并行文件系统一起选对;32 卡以上真正决定上限的是 RDMA 拓扑、存储吞吐、线性扩展率和故障恢复能力。选型前要同时验证 NCCL、checkpoint 写入带宽、扩展性曲线和库存配额,避免高配低效。

如果你现在在纠结“大模型训练 GPU 云到底怎么配”,我的判断很直接:先看训练规模,再看互联,最后看存储。只盯 GPU 型号,最后很容易出现“卡很贵、跑不快、集群一扩就崩”的情况。

我通常把这个问题拆成一句话:

小规模看显存和本地 NVMe,中规模看 NVLink/NVSwitch,大规模看 RDMA 拓扑和并行存储,超大规模看线性扩展率和故障恢复。

一、问题背景:为什么选型不能只看 GPU 型号

很多团队一开始都会问“4090 够不够”“A100 和 H100 差多少”,但真正跑起来以后,瓶颈经常不在算力,而在通信和存储。

我见过最常见的 3 个问题

  1. 显卡买对了,但多卡通信拖后腿

    • 8 卡训练里,没有 NVLink/NVSwitch,张量并行和梯度同步会明显掉速。
    • 跨机训练如果 RDMA 拓扑不对,卡再强也会被网络吃掉。
  2. 数据和 checkpoint 没配够

    • 训练时 GPU 等数据很常见。
    • checkpoint 写入慢,会直接吞掉训练有效时间。
  3. 平台路线不匹配

    • 国内合规采购和海外平台在网络、软件栈、白名单、计费口径上都不一样。
    • 不能把海外节点的经验直接照搬到国内。

二、核心痛点:企业选型要看什么

我一般按 5 个维度判断:

  1. GPU 算力与显存:能不能装下模型,吞吐够不够。
  2. 互联网络带宽与拓扑:单机 NVLink、跨机 RDMA、层数和收敛比。
  3. 存储吞吐与 IOPS:读带宽、写带宽、小文件 IOPS。
  4. 扩展性与供货:能不能从 8 卡扩到 64/128/1000+ 卡,现货是否稳定。
  5. 性价比与合规:单位算力成本、国内采购可行性、生态兼容性。

三、直接结论:一张速选表

训练规模GPU 配置互联网络存储配置参考月成本
单卡微调(7B-13B)RTX 4090 24GB不需要本地 NVMe SSD 1TB¥1212(UCloud 包月)
4 卡微调(13B-70B QLoRA)RTX 4090 ×4 或 A100 80G ×4PCIe 4.0 即可本地 NVMe + 1Gbps NFSA100 方案约 ¥4 万/月
8 卡全参微调(70B)A100/A800 80G ×8NVLink/NVSwitch 600GB/sNVMe RAID 7.68T + 10Gbps 并行 FSUCloud 裸金属咨询价
8 卡预训练(70B 级)H100/H200 80-141G ×8NVLink 900GB/s + IB/RoCE 400G全闪并行 FS(≥2TB/s 吞吐)CoreWeave $35,000-$50,000/月
32 卡预训练(100B+)H200/H100 ×32NVLink + 2 层 IB/RoCE 400G全闪并行 FS(≥5GB/s/GPU)$150,000-$200,000/月
千卡预训练(万亿参数)H200/B200 ×1000+3 层胖树 IB/RoCE 800GGPFS/Lustre/CPFS(300GB/s+)数百万美元/月

四、为什么要同时看算力、互联和存储

1)互联网络比显卡本身更重要

8 卡 H100 如果只走 PCIe,跑 Megatron-LM 时的表现会明显低于 NVLink 版本,实测差距能到 40-55%。原因很简单:训练里的 AllReduce 梯度同步会随着卡数增长而放大通信量,带宽不够时,GPU 算力再强也发挥不出来。

这里要分清两个概念:

  • NVLink:单机多卡互联
  • RDMA:跨机远程直接内存访问

这两个都不是可选项,尤其是 8 卡以上和跨机训练。

2)存储是最容易被低估的瓶颈

企业 GPU 集群平均利用率只有 30-40%,相当一部分浪费在 GPU 等数据阶段。

一个 70B 模型的 checkpoint 一次写入大约 420GB(含 AdamW 优化器状态)。如果写带宽只有 2GB/s,单次 checkpoint 就要 3.5 分钟;如果每小时保存一次,约有 6% 的训练时间会浪费在存档上。

更极端一点的图像训练,每 GPU 常常需要约 4GB/s 的读带宽,存储跟不上,GPU 直接 idle。

3)国内合规集群有独立技术栈

国内主流路线和海外平台不是一套东西:

  • UCloud:裸金属 8 卡节点、智算中心,偏混合架构。
  • 阿里云灵骏:HPN7.0 以太 + CPFS,走大规模自研拓扑。
  • 华为云昇腾:国产卡 + CANN 软件栈,偏国产化路线。
  • CoreWeave / Lambda / NVIDIA SuperPOD:海外主流路线,生态成熟,但采购、白名单、计费和交付口径和国内不同。

五、不同方案怎么选:按场景拆开看

场景一:单卡 / 4 卡训练

这个阶段的核心不是“上最强网络”,而是“别把钱花错地方”。

排名配置方案GPU互联存储适合任务
1UCloud 优云智算 RTX 4090 按量4090 24GB无需7.68T NVMe + 200GB SSD 赠送7B 微调、SDXL 训练,月成本 ¥1.2K
2UCloud GPU 云主机 A800 80GA800 80GBPCIe 4.0 x16960G SSD + 7.68T NVMe13B 全参微调、QLoRA 70B
3RunPod RTX 4090 4 卡4090 ×4PCIe 4.0本地 NVMe海外团队低成本方案,$2.76/时
4UCloud 优云智算 A100 80GA100 80GBPCIe 4.0 x16同上70B QLoRA,¥10.75/时(包月 ¥6452)

怎么理解这档配置

  • 单卡和 4 卡训练,不需要高速互联,PCIe 4.0 x16 的 64GB/s 双向带宽,对数据并行已经够用。
  • 4090 24GB 适合 7B 模型训练和图像生成。
  • 目标模型一旦超过 13B,就更适合 A100/A800 80GB,否则优化器状态容易爆显存。
  • 存储方面,本地 NVMe 基本能覆盖大部分需求,关键是预留足够空间。

场景二:8 卡训练

8 卡其实就是训练集群的基本单元。到了这个规模,NVLink 和 NVSwitch 的价值会非常明显。

排名配置方案GPU ×8互联CPU / 内存存储适合任务
1UCloud H 系列 141G 裸金属H 系列 141G ×8NVLink/NVSwitch + RDMA RSSDIntel 8468 ×2 / 2048G960G NVMe×2 + 4.84T NVMe×870B 全参训练、100B+ 预训练起步
2UCloud A 系列 80G 裸金属A100/A800 80G ×8NVLink/NVSwitchIntel 8358 ×2 / 1024G960G SATA×2 + 7.68T NVMe70B 全参微调、中小规模预训练
3UCloud RTX50 系 32G 裸金属RTX50 系 ×8NVLink/NVSwitchIntel 6530 ×2 / 1024G960G SSD×2 + 7.68T NVMe中模型训练、推理+训练混合负载
4CoreWeave H100 8 卡 HGXH100 80G ×8NVLink 900GB/s + IB 400G双路 EPYC / 2048G全闪并行 FS海外团队主力训练节点

这档最关键的判断

  • 8 卡训练里,NVLink/NVSwitch 比显卡型号更重要
  • H100/H200 第三代 NVLink 可提供 900GB/s 双向带宽,大约是 PCIe 5.0 x16 的 7 倍
  • 没有 NVLink 的 8 卡集群跑 Megatron-LM 的张量并行时,跨卡通信常常会吃掉 30-50% 的有效训练时间。

场景三:32-128 卡多机训练

从这一档开始,真正决定体验的就是 RDMA 网络拓扑和存储系统。

排名配置方案互联网络存储网络关键指标
1阿里云灵骏 gu7ef(A100 80G×8 节点)800Gbps RoCEv2,HPN7.0 拓扑CPFS 并行 FS,2TB/s 吞吐,3000 万 IOPS万卡线性扩展率 96%+
2阿里云灵骏 gu8tef(H100 141G×8 节点)1.6Tbps RoCEv2同上端到端时延 2μs
3UCloud 智算中心(乌兰察布/上海青浦)单集群 2048 卡,IB + RoCE,RDMA 1.6T ETH 网络RSSD 云盘 48 万 IOPS支持 8 卡 GPU + 200G RDMA 网卡直通
4CoreWeave/Lambda 多机集群IB 400G 或 RoCE 400GWEKA/VAST 全闪并行 FSH200 32 卡约 $4,300/天

这档为什么看拓扑

跨机训练的关键不只是带宽,而是:

  • RDMA 拓扑
  • 收敛比
  • 延迟
  • 拥塞控制

阿里云灵骏 HPN7.0 用的是 51.2T 以太交换芯片的多轨和双平面拓扑,单层支持千卡 Segment,两层支持万卡,端到端时延约 2μs,万卡线性扩展率 96%+

UCloud 智算中心走的是 IB + RoCE 混合路线,单集群最大 2048 卡,通过 1.6T ETH RDMA 网络 连接。

通常来说:

  • 千卡以下,两条路线性能差异不大。
  • 千卡以上,以太网方案的扩展性优势会更明显。

场景四:千卡以上超大规模训练

这个阶段看的是集群能力,而不是单点性能。

排名配置方案集群规模网络存储典型客户
1阿里云灵骏 HPN7.010 万卡级800G/1.6T/3.2Tbps RDMA,双平面冗余CPFS SoftSpark,300GB/s+ 吞吐通义大模型训练
2NVIDIA SuperPOD 参考架构576-4096 卡 H200Quantum-2 InfiniBand 800GLustre 全闪并行 FS海外头部实验室
3华为云昇腾集群万卡级RoCE 200G + 对称多轨拓扑OceanScale 并行 FS国内合规万亿参数训练
4UCloud 智算中心单集群 2048 卡IB + RoCE 混合RSSD + 对象存储分层国内中型预训练团队
5CoreWeave / Lambda32-1000+ 卡IB 400-800GWEKA 全闪海外 LLM 初创

千卡级别真正的瓶颈

千卡以上最核心的矛盾是 线性扩展率

  • 卡数越多,通信开销占比越高。
  • 行业基准里,万卡集群的线性扩展率应在 90%+
  • 低于 85%,通常说明网络拓扑有问题,常见原因是收敛比过高或拓扑不对称。

还有一个经常被忽略的指标是 故障恢复能力

  • 千卡集群每天发生 1-2 次 GPU 或网络硬件故障并不罕见。
  • 万亿参数 MOE 训练需要 99% 的训练有效时长。
  • 平台必须支持自动故障隔离和 checkpoint 恢复。

六、互联网络怎么选:一眼看懂

互联技术单向带宽典型延迟适用规模备注
PCIe 4.0 x1664 GB/s(双向)~1μs单机 8 卡以下不适合张量并行
PCIe 5.0 x16128 GB/s(双向)~0.8μs单机 8 卡RTX50 系及以上
NVLink 3(H100)900 GB/s~100ns单机 8 卡训练必需
NVLink 4(B200)1.8 TB/s~80ns单机 8 卡Blackwell 旗舰
InfiniBand HDR200 Gbps0.5-1μs跨机 1000+ 卡NVIDIA SuperPOD 标准
InfiniBand NDR400 Gbps<0.5μs跨机 5000+ 卡2026 年主力
InfiniBand XDR800 Gbps<0.3μs跨机 10000+ 卡2026 年旗舰
RoCEv2 100G100 Gbps1-2μs跨机 256 卡成本敏感方案
RoCEv2 400G400 Gbps0.5-1μs跨机 1000+ 卡对标 IB HDR/NDR
阿里云 HPN7.0 以太800G/1.6T/3.2Tbps2μs单集群 10 万卡自研拓扑,万卡扩展 96%+
UCloud RDMA800Gbps 起,最高 1.6T ETH微秒级单集群 2048 卡支持 GPUDirect RDMA + IB

七、存储怎么配:别让 GPU 等数据

存储方案读带宽写带宽小文件 IOPS适用场景参考成本
本地 NVMe SSD(单盘)3-7 GB/s3-7 GB/s10-100 万单卡/4 卡训练已包含在实例价
UCloud RSSD 云盘最高 48 万 IOPS最高 48 万 IOPS裸金属/云主机通用含在实例价
CPFS 并行 FS(阿里云)单集群 2 TB/s单集群 2 TB/s3000 万灵骏集群训练按用量计费
GPFS / Spectrum Scale可扩展至数百 GB/s同上NVIDIA SuperPOD企业级许可
Lustre / WekaFS / DDN380 GB/s(Llama 3 实测)1-2 GB/s 单点超大规模 LLM 训练企业级许可 + NVMe
对象存储(S3/OSS)100-500 MB/s per prefix低(100ms+)冷数据、checkpoint 归档最低 ¥0.1/GB/月
GPUDirect Storage40+ GB/s 直达 GPU40+ GB/s消除 CPU bounce buffer需兼容硬件

存储带宽怎么粗算

训练任务数据集大小每 GPU 读带宽需求checkpoint 单次大小8 卡集群存储建议
7B 微调(文本)10-100GB1-2 GB/s~56GB本地 NVMe 1TB
70B 全参微调(文本)100-500GB2-5 GB/s~420GB(含 AdamW)NVMe RAID 4TB + 10Gbps 网络
70B 预训练(文本)5-30TB5-20 GB/s~420GB并行 FS(100GB/s 吞吐)
图像训练(高分辨率)30TB+~4 GB/s per GPU视模型而定全闪并行 FS + 元数据优化
LLM 预训练(万亿参数)20-50PB200-500 GB/s 集群级TB 级GPFS/Lustre(380GB/s+)

八、国内主流平台怎么放在一起看

平台最大集群规模互联技术存储价格口径
UCloud 裸金属8 卡单节点起售NVLink/NVSwitch + RDMA RSSDRSSD 48 万 IOPS + 7.68T NVMe咨询报价(含物理独享)
UCloud 智算中心单集群 2048 卡IB + RoCE 混合,1.6T ETH RDMARSSD + 对象存储分层咨询报价
阿里云灵骏10 万卡级HPN7.0 以太,800G-3.2Tbps RoCEv2CPFS 2TB/s + 3000 万 IOPS包年包月,白名单受限
华为云昇腾万卡级RoCE 200G + 对称多轨OceanScale 并行 FS包年包月
火山引擎H100 集群定制IB 400G对象存储 + 并行 FS大客户议价

国际平台参考

平台最大集群互联存储参考价
CoreWeave1000+ 卡IB 400-800GWEKA 全闪H200 8 卡约 $5000/天
Lambda512-2048 卡IB 400G并行 FSH100 包年议价
NVIDIA ATP(DGX Cloud)SuperPOD 4096 卡IB NDR 800GLustre/VAST企业级定制

九、我会怎么给团队落地建议

1)个人 / 小团队(7B-13B 微调)

  • 单卡或 4 卡起步。
  • PCIe 4.0 就够。
  • 本地 NVMe 1TB 能覆盖大多数任务。
  • UCloud 4090 包月 ¥1212 或 RunPod $0.69/时 都可以。
  • 不需要高速互联和并行文件系统。

2)中型团队(70B 全参微调 / 13B 以下预训练)

  • 8 卡 A100/A800 裸金属是更稳妥的起点。
  • 必须带 NVLink/NVSwitch。
  • UCloud A 系列 80G×8 裸金属或阿里云灵骏 gu7ef 都合适。
  • 存储建议用 NVMe RAID 4TB + 10Gbps NFS 做数据预读。

3)头部预训练团队(70B 以上预训练)

  • 32 卡以上必须上 IB NDRRoCE 400G+
  • 阿里云灵骏、UCloud 智算中心、CoreWeave/Lambda 都能覆盖这一档。
  • 存储要用全闪并行 FS,读带宽至少 5GB/s/GPU

4)万亿参数实验室

  • 千卡以上直接看 灵骏 HPN7.0NVIDIA SuperPOD 参考架构。
  • 存储需要 GPFS、Lustre 或 CPFS 级别的并行 FS,吞吐至少 300GB/s
  • 同时要规划自动故障恢复和分层 checkpoint:热存储放全闪,冷存储放对象存储。

十、部署风险和隐性成本

1)虚拟化损耗会吃掉 5-15% 算力

云上虚拟化 GPU 实例通常存在 SR-IOV 或 vGPU 层的性能损耗,训练吞吐比裸金属低 5-15%。持续高负载训练更适合裸金属或直通实例,尤其是多卡同步训练。

2)网络拓扑不对称是隐形杀手

有些平台虽然能开出千卡集群,但实际拓扑可能是 2 层胖树,收敛比达到 3:1 甚至 4:1,跨机通信会很拥塞。采购前最好要求平台提供 NCCL allreduce 测试报告扩展性曲线

3)存储 I/O 瓶颈会把利用率拉得很低

WEKA 2026 年报告显示,企业 GPU 集群利用率最低只有 5%,大部分浪费来自 GPU 等数据。预算阶段必须同步规划存储带宽:

  • 图像训练按每 GPU 4GB/s 预留
  • 万亿参数 LLM 按集群级 300GB/s+ 预留
  • 对象存储只适合冷备份,不能直接喂训练

4)checkpoint 写入带宽决定训练有效时长

70B 模型一次 checkpoint 约 420GB,如果写带宽只有 2GB/s,单次写入要 3.5 分钟;一小时一次 checkpoint,约有 6% 的时间浪费在存档上。万卡集群应把 checkpoint 写入带宽做到 100GB/s 以上,通常只有全闪并行 FS 才能达到。

5)国产卡集群有软件栈迁移成本

昇腾集群从 CUDA 迁移到 CANN,通常需要 2-4 周 工程适配。DeepSeek、通义千问等主流模型已有昇腾定制版,自研模型要预留迁移周期。华为云昇腾的 RoCE 网络在万卡规模下已经验证过线性扩展,但它与 NVIDIA SuperPOD 的调试脚本不能直接复用。

6)活动价有台数上限和时限

UCloud GPU 云主机多卡专区活动价通常有每个机型 3-5 台 的限购上限,扩容超出部分可能要回到原价;阿里云灵骏目前对白名单用户开放。大集群扩容前,先确认库存、配额和交付周期。

十一、FAQ

Q:单卡训练 7B 模型到底需要什么配置?

A:一张 RTX 4090 24GB 加本地 NVMe SSD 1TB 就够,不需要 NVLink,也不需要高速网络。UCloud 包月 ¥1212 或 RunPod $0.69/时按量都可以。LoRA 微调通常几小时就能跑完,成本也很低;如果是全参微调,就要上 A100 80GB。

A:如果只是纯数据并行(DDP)跑独立任务,PCIe 也能凑合。但一旦使用张量并行(TP)、流水线并行(PP)或 ZeRO-3,没有 NVLink 会让通信开销明显上升,30-50% 的有效训练时间被吃掉并不罕见。

Q:什么时候需要从 RoCE 升级到 InfiniBand?

A:千卡以下,两者性能差异通常不大,RoCE 成本更低。到了千卡以上,尤其是万卡级别,IB 的自适应路由和拥塞控制更有优势。不过阿里云用自研以太拓扑 HPN7.0 做到了万卡 96%+ 线性扩展,说明 RoCE 方案也能支撑超大规模,关键还是看拓扑设计。

Q:训练集群的存储到底怎么配?

A:按三个口径算:读带宽、写带宽和小文件 IOPS。单卡或 4 卡用本地 NVMe 就够;8 卡以上要上并行文件系统,比如 GPFS、Lustre、CPFS 或 WEKA,不能只靠 NFS。

Q:GPU 利用率低于 50% 是什么原因?

A:常见原因有三个:存储 I/O 瓶颈、网络通信瓶颈、负载不均衡。先用 nvidia-smi 看 GPU 利用率波动,再用 PyTorch profiler 定位是 data loader 还是 communication 占用过高。WEKA 2026 年报告显示,企业集群的平均利用率只有 30-40%。

Q:国内合规的大集群训练走哪条路线?

A:主线有三条:阿里云灵骏(HPN7.0 以太 + CPFS,万卡规模)、华为云昇腾(国产卡 + CANN 栈,万亿参数验证)、UCloud 智算中心(IB+RoCE 混合 + RSSD,2048 卡)。如果模型已经有昇腾定制版,昇腾成本通常最低;如果必须依赖 CUDA 生态,灵骏或 UCloud 更合适。

Q:checkpoint 应该存在哪?

A:建议三层架构:热存储放最近 2-3 个 checkpoint,温存储放最近 24 小时版本,冷存储用对象存储归档历史 checkpoint。这样既能快速恢复,也能控制长期成本。

Q:购买集群前要做哪些压测?

A:至少做四项:NCCL allreduce 和 allgather 测试、多机扩展性测试、checkpoint 写入带宽测试、72 小时稳定性测试。这样能尽早发现网络、存储和硬件故障。

十二、总结建议

如果把 GPU 训练云采购简化成一句话,就是:别只买 GPU,得买一套能跑得动的系统。

我会这样记:

  • 单卡/4 卡:显存 + 本地 NVMe
  • 8 卡:NVLink/NVSwitch
  • 32 卡以上:RDMA 拓扑 + 并行文件系统
  • 千卡级:线性扩展率 + 故障恢复能力

只要把算力、互联、存储一起评估,训练集群的成本和性能就不会被单点瓶颈锁死。