首页/GPU 云

GPU 云与 AI 超算

NVIDIA GPU 云,从一个节点到 4,096 张卡

按秒租用单租户 NVIDIA 加速卡,或在整个训练周期内预留一整套 InfiniBand 互联的集群。无论用哪种方式购买,硬件、网络和工程师团队都是同一套。

开通速度
< 90 秒
计费方式
按秒计费,无流量费
网络
400G / 800G 无阻塞
最大集群
单网络 4,096 卡
可用性 SLA
99.99% 基础设施
GPU 清单

选择你的加速卡

每一种型号都可以选择单租户裸金属实例,或 GPU 直通的虚拟化实例。多节点型号默认配备 rail-optimized InfiniBand。

GPU架构显存 / 带宽互联适用场景起价(每卡时)
GB300 NVL72Blackwell Ultra288 GB HBM3e · 8 TB/sNVLink 5 rack-scale + XDR 800G万亿参数训练、长上下文推理$8.91
B300 SXM (HGX)Blackwell Ultra288 GB HBM3e · 8 TB/sNVLink 5 + XDR 800G前沿预训练、MoE 微调$8.34
B200 SXM (HGX)Blackwell180 GB HBM3e · 8 TB/sNVLink 5 + NDR/XDR大规模训练、FP4 推理$6.61
H200 SXM (HGX)Hopper141 GB HBM3e · 4.8 TB/sNVLink 4 + NDR 400G70B–400B 训练与高吞吐推理$3.79
H100 SXM (HGX)Hopper80 GB HBM3 · 3.35 TB/sNVLink 4 + NDR 400G主流训练、微调与推理$3.10
H100 NVL / PCIeHopper94 / 80 GB · 3.9 TB/sNVLink bridge + 200G高密度推理、混合负载$2.70
A100 SXM 80GBAmpere80 GB HBM2e · 2.0 TB/sNVLink 3 + HDR 200G成本优先的训练与批量推理$1.90
A100 SXM 40GBAmpere40 GB HBM2 · 1.6 TB/sNVLink 3 + HDR 200G成本优先的训练与批量推理$1.47
RTX PRO 6000 BlackwellBlackwell96 GB GDDR7 · 1.8 TB/sPCIe Gen5 · 200G推理、仿真、图形与 Omniverse$2.18
L40SAda Lovelace48 GB GDDR6 · 864 GB/sPCIe Gen4 · 100G推理、渲染、视频、云桌面$1.35
RTX 5090Blackwell32 GB GDDR7 · 1.8 TB/sPCIe Gen5 · 100G科研、扩散模型、开发集群$0.75

以上为按需美元参考标价(每卡时),不含税。预留与长约有折扣,详见价格页

三种购买方式

按你项目的预算方式来买算力

弹性

按需

按秒计费、无需承诺。适合实验、评测流水线与突发微调。

  • 每实例 1–8 卡
  • API / 控制台即时开通
  • 快照与恢复
  • 无流量费
最常选

预留集群

1–36 个月独占的 InfiniBand 互联 pod,容量锁定、价格在合约期内固定。

  • 16–4,096 卡,无阻塞网络
  • 托管 Slurm 或 Kubernetes
  • 最高比按需低 55%
  • 合同中写明容量保障
企业级

私有 AI 云

由 Velyrix 按你的命名、策略与审计要求运营的物理隔离机房、网络与存储。

  • 专属笼位或套间
  • 客户自持加密密钥
  • 可选物理隔离
  • 定制 SLA 与变更管理
集群网络

让 GPU 不闲着的 rail-optimized 网络

训练集群的速度取决于最慢的那次 all-reduce。Velyrix 的每一个多节点 pod 都建立在 rail-optimized、无阻塞的胖树之上,并配备独立的存储与管理平面。

  • 计算平面:NVIDIA Quantum-2 NDR 400G 或 Quantum-X800 XDR 800G InfiniBand,1:1 收敛比
  • 以太网方案:NVIDIA Spectrum-X,支持 RoCEv2、自适应路由与拥塞控制
  • 网内计算:启用 SHARP 聚合,降低大规模集合通信的 all-reduce 时延
  • 存储平面:独立 200/400G 网络,checkpoint 写入不会与梯度通信争抢带宽
  • 管理平面:与租户流量隔离的带外 BMC 网络
  • 验证:交付前提供 NCCL 总线带宽与 all-reduce 时延报告
acceptance-report.txt
# 512× NVIDIA H200 SXM — XDR 800G rail-optimized
nccl-tests/all_reduce_perf -b 8 -e 8G -f 2 -g 8

size        busbw       algbw      status
1.00 GB     372.4 GB/s  198.1 GB/s  PASS
4.00 GB     381.9 GB/s  203.7 GB/s  PASS
8.00 GB     384.6 GB/s  205.1 GB/s  PASS

fabric      : 1:1 无阻塞,72 小时 0 链路错误
gpu_burnin  : 72 小时满载 — 0 次 XID,0 次 ECC 行重映射
sustained   : 48.9% MFU,Llama 级 70B 参考任务

以上为一次 Velyrix 验收测试的代表性数据。结果会随拓扑、模型、batch size 与软件栈变化; 你的集群会单独实测并出具报告。

调度与软件

带着你现有的技术栈过来,而不是做一次迁移项目

托管 Slurm

预装 Slurm,含 Pyxis/Enroot、公平共享计费、拓扑感知调度,以及适配长周期预训练的 checkpoint-restart 钩子。

托管 Kubernetes

符合 CNCF 标准的集群,集成 NVIDIA GPU Operator、Network Operator、MIG 切分、KubeRay 与 Kueue 多租户调度。

裸金属 API

提供 Terraform Provider 与 REST API,支持镜像部署、iPXE 引导、BMC 控制与网络分区 — 你可以在其上自建控制平面。

📦

镜像仓库

区域本地的 NGC、Docker Hub 与私有镜像缓存,避免 40 GB 镜像拉取拖慢 512 卡任务的启动。

📈

可观测性

DCGM、Prometheus 与 Grafana,提供按任务的 GPU 利用率、功耗、温度、XID 事件与网络计数器,可导出到你自己的 SIEM。

🔧

框架支持

PyTorch、JAX、NeMo、Megatron-LM、DeepSpeed、TorchTitan、vLLM、SGLang 与 TensorRT-LLM 的验证镜像,每月更新。

每个集群都包含

第一个任务跑起来之前你已经拥有的东西

存储

按 token 预算配置的高性能并行文件系统(WEKA 或 VAST),以及用于数据集与 checkpoint 的 S3 兼容对象存储。每节点含 10 TB NVMe 本地暂存。

网络

无阻塞 InfiniBand 或 Spectrum-X 计算网络、双路 100G 互联网出口、到 AWS/Azure/GCP/Oracle 的云专线,以及可选 BGP/IP 出口。标准套餐不收流量费。

安全

单租户主机、隔离的 VLAN/VRF 与网络分区、安全启动固件校验、客户自管密钥,以及下架时的擦除与核验(符合 NIST SP 800-88 purge)。

支持

7×24 NOC、专属解决方案架构师、P1 级 15 分钟响应、四小时现场硬件更换目标,以及对照合同可用率的月度 SLA 报告。

验收

交付前完成:72 小时 GPU 烤机、内存与 ECC 验证、NCCL 带宽测试、网络错误扫描,并出具可交给你审计方的签署版验收报告。

与 AI 基础设施架构师沟通

GPU 归你所有,运营交给我们

从任何一家 OEM 或代理商采购你的 NVIDIA 服务器,直接发到 Velyrix 机房,剩下的交给我们 — 部署、组网、散热、监控与长期支持。当然也可以直接租用我们的机器。无论哪种方式,一个工作日内给你完整方案。

常见问题

Velyrix GPU 云怎么计费?

按需实例按秒计费,无最低消费,标准套餐不收数据流出费。预留集群按月固定费率计费,租期 1 至 36 个月。企业私有云按固定月度平台费加算力容量报价。

我拿到的是裸金属还是虚拟机?

两种都有。多节点训练默认使用单租户裸金属,直接访问 GPU、网卡与 NVMe。在更看重快照与快速重装的场景,也提供 GPU 直通的虚拟化实例。

多节点训练集群用什么网络?

rail-optimized 无阻塞 InfiniBand —— 每卡 400G 的 NVIDIA Quantum-2 NDR 或 800G 的 Quantum-X800 XDR,并启用 SHARP 网内归约。如果你需要纯以太网运维模型,也可选择支持 RoCEv2 的 NVIDIA Spectrum-X。

Slurm 和 Kubernetes 能跑在同一个集群上吗?

可以。常见做法是把预留集群划分为两部分:Slurm 分区跑长周期训练,Kubernetes 分区跑推理服务,两者共享同一套并行文件系统。分区比例在合约期内可以调整。

大规模集群有最短合约期吗?

256 卡以上的集群通常最短三个月,因为涉及网络建设与布线工作。如果某个机房已有空闲且规格匹配的 pod,可以接受更短的窗口。