选择你的加速卡
每一种型号都可以选择单租户裸金属实例,或 GPU 直通的虚拟化实例。多节点型号默认配备 rail-optimized InfiniBand。
| GPU | 架构 | 显存 / 带宽 | 互联 | 适用场景 | 起价(每卡时) |
|---|---|---|---|---|---|
| GB300 NVL72 | Blackwell Ultra | 288 GB HBM3e · 8 TB/s | NVLink 5 rack-scale + XDR 800G | 万亿参数训练、长上下文推理 | $8.91 |
| B300 SXM (HGX) | Blackwell Ultra | 288 GB HBM3e · 8 TB/s | NVLink 5 + XDR 800G | 前沿预训练、MoE 微调 | $8.34 |
| B200 SXM (HGX) | Blackwell | 180 GB HBM3e · 8 TB/s | NVLink 5 + NDR/XDR | 大规模训练、FP4 推理 | $6.61 |
| H200 SXM (HGX) | Hopper | 141 GB HBM3e · 4.8 TB/s | NVLink 4 + NDR 400G | 70B–400B 训练与高吞吐推理 | $3.79 |
| H100 SXM (HGX) | Hopper | 80 GB HBM3 · 3.35 TB/s | NVLink 4 + NDR 400G | 主流训练、微调与推理 | $3.10 |
| H100 NVL / PCIe | Hopper | 94 / 80 GB · 3.9 TB/s | NVLink bridge + 200G | 高密度推理、混合负载 | $2.70 |
| A100 SXM 80GB | Ampere | 80 GB HBM2e · 2.0 TB/s | NVLink 3 + HDR 200G | 成本优先的训练与批量推理 | $1.90 |
| A100 SXM 40GB | Ampere | 40 GB HBM2 · 1.6 TB/s | NVLink 3 + HDR 200G | 成本优先的训练与批量推理 | $1.47 |
| RTX PRO 6000 Blackwell | Blackwell | 96 GB GDDR7 · 1.8 TB/s | PCIe Gen5 · 200G | 推理、仿真、图形与 Omniverse | $2.18 |
| L40S | Ada Lovelace | 48 GB GDDR6 · 864 GB/s | PCIe Gen4 · 100G | 推理、渲染、视频、云桌面 | $1.35 |
| RTX 5090 | Blackwell | 32 GB GDDR7 · 1.8 TB/s | PCIe Gen5 · 100G | 科研、扩散模型、开发集群 | $0.75 |
以上为按需美元参考标价(每卡时),不含税。预留与长约有折扣,详见价格页。
按你项目的预算方式来买算力
按需
按秒计费、无需承诺。适合实验、评测流水线与突发微调。
- 每实例 1–8 卡
- API / 控制台即时开通
- 快照与恢复
- 无流量费
预留集群
1–36 个月独占的 InfiniBand 互联 pod,容量锁定、价格在合约期内固定。
- 16–4,096 卡,无阻塞网络
- 托管 Slurm 或 Kubernetes
- 最高比按需低 55%
- 合同中写明容量保障
私有 AI 云
由 Velyrix 按你的命名、策略与审计要求运营的物理隔离机房、网络与存储。
- 专属笼位或套间
- 客户自持加密密钥
- 可选物理隔离
- 定制 SLA 与变更管理
让 GPU 不闲着的 rail-optimized 网络
训练集群的速度取决于最慢的那次 all-reduce。Velyrix 的每一个多节点 pod 都建立在 rail-optimized、无阻塞的胖树之上,并配备独立的存储与管理平面。
- 计算平面:NVIDIA Quantum-2 NDR 400G 或 Quantum-X800 XDR 800G InfiniBand,1:1 收敛比
- 以太网方案:NVIDIA Spectrum-X,支持 RoCEv2、自适应路由与拥塞控制
- 网内计算:启用 SHARP 聚合,降低大规模集合通信的 all-reduce 时延
- 存储平面:独立 200/400G 网络,checkpoint 写入不会与梯度通信争抢带宽
- 管理平面:与租户流量隔离的带外 BMC 网络
- 验证:交付前提供 NCCL 总线带宽与 all-reduce 时延报告
# 512× NVIDIA H200 SXM — XDR 800G rail-optimized nccl-tests/all_reduce_perf -b 8 -e 8G -f 2 -g 8 size busbw algbw status 1.00 GB 372.4 GB/s 198.1 GB/s PASS 4.00 GB 381.9 GB/s 203.7 GB/s PASS 8.00 GB 384.6 GB/s 205.1 GB/s PASS fabric : 1:1 无阻塞,72 小时 0 链路错误 gpu_burnin : 72 小时满载 — 0 次 XID,0 次 ECC 行重映射 sustained : 48.9% MFU,Llama 级 70B 参考任务
以上为一次 Velyrix 验收测试的代表性数据。结果会随拓扑、模型、batch size 与软件栈变化; 你的集群会单独实测并出具报告。
带着你现有的技术栈过来,而不是做一次迁移项目
托管 Slurm
预装 Slurm,含 Pyxis/Enroot、公平共享计费、拓扑感知调度,以及适配长周期预训练的 checkpoint-restart 钩子。
托管 Kubernetes
符合 CNCF 标准的集群,集成 NVIDIA GPU Operator、Network Operator、MIG 切分、KubeRay 与 Kueue 多租户调度。
裸金属 API
提供 Terraform Provider 与 REST API,支持镜像部署、iPXE 引导、BMC 控制与网络分区 — 你可以在其上自建控制平面。
镜像仓库
区域本地的 NGC、Docker Hub 与私有镜像缓存,避免 40 GB 镜像拉取拖慢 512 卡任务的启动。
可观测性
DCGM、Prometheus 与 Grafana,提供按任务的 GPU 利用率、功耗、温度、XID 事件与网络计数器,可导出到你自己的 SIEM。
框架支持
PyTorch、JAX、NeMo、Megatron-LM、DeepSpeed、TorchTitan、vLLM、SGLang 与 TensorRT-LLM 的验证镜像,每月更新。
第一个任务跑起来之前你已经拥有的东西
按 token 预算配置的高性能并行文件系统(WEKA 或 VAST),以及用于数据集与 checkpoint 的 S3 兼容对象存储。每节点含 10 TB NVMe 本地暂存。
无阻塞 InfiniBand 或 Spectrum-X 计算网络、双路 100G 互联网出口、到 AWS/Azure/GCP/Oracle 的云专线,以及可选 BGP/IP 出口。标准套餐不收流量费。
单租户主机、隔离的 VLAN/VRF 与网络分区、安全启动固件校验、客户自管密钥,以及下架时的擦除与核验(符合 NIST SP 800-88 purge)。
7×24 NOC、专属解决方案架构师、P1 级 15 分钟响应、四小时现场硬件更换目标,以及对照合同可用率的月度 SLA 报告。
交付前完成:72 小时 GPU 烤机、内存与 ECC 验证、NCCL 带宽测试、网络错误扫描,并出具可交给你审计方的签署版验收报告。
常见问题
Velyrix GPU 云怎么计费?
按需实例按秒计费,无最低消费,标准套餐不收数据流出费。预留集群按月固定费率计费,租期 1 至 36 个月。企业私有云按固定月度平台费加算力容量报价。
我拿到的是裸金属还是虚拟机?
两种都有。多节点训练默认使用单租户裸金属,直接访问 GPU、网卡与 NVMe。在更看重快照与快速重装的场景,也提供 GPU 直通的虚拟化实例。
多节点训练集群用什么网络?
rail-optimized 无阻塞 InfiniBand —— 每卡 400G 的 NVIDIA Quantum-2 NDR 或 800G 的 Quantum-X800 XDR,并启用 SHARP 网内归约。如果你需要纯以太网运维模型,也可选择支持 RoCEv2 的 NVIDIA Spectrum-X。
Slurm 和 Kubernetes 能跑在同一个集群上吗?
可以。常见做法是把预留集群划分为两部分:Slurm 分区跑长周期训练,Kubernetes 分区跑推理服务,两者共享同一套并行文件系统。分区比例在合约期内可以调整。
大规模集群有最短合约期吗?
256 卡以上的集群通常最短三个月,因为涉及网络建设与布线工作。如果某个机房已有空闲且规格匹配的 pod,可以接受更短的窗口。