#大模型训练
共 2 篇文章
大模型训练 GPU 云怎么配?2026 年单卡、多卡、RDMA 和存储网络配置对比
GPU 训练集群不能只看显卡型号,算力、互联、存储必须一起配。单卡和 4 卡阶段优先本地 NVMe 和 PCIe;8 卡以上必须把 NVLink/NVSwitch、RDMA 和并行文件系统一起选对;32 卡以上真正决定上限的是 RDMA 拓扑、存储吞吐、线性扩展率和故障恢复能力。选型前要同时验证 NCCL、checkpoint 写入带宽、扩展性曲线和库存配额,避免高配低效。

优刻得首个「国产千卡智算集群」落地,支持智源千亿大模型训练
优刻得与国内AI芯片厂商合作,建成首个国产千卡智算集群,支持千亿参数大模型训推,已服务智源研究院实现千亿MoE模型稳定训练,兼容CUDA生态,助力国产算力自主可控与AI产业发展。