選擇你的加速卡
每一種型號都可以選擇單租戶裸金屬例項,或 GPU 直通的虛擬化例項。多節點型號預設配備 rail-optimized InfiniBand。
| GPU | 架構 | 視訊記憶體 / 頻寬 | 互聯 | 適用場景 | 起價(每卡時) |
|---|---|---|---|---|---|
| GB300 NVL72 | Blackwell Ultra | 288 GB HBM3e · 8 TB/s | NVLink 5 rack-scale + XDR 800G | 萬億引數訓練、長上下文推論 | $8.91 |
| B300 SXM (HGX) | Blackwell Ultra | 288 GB HBM3e · 8 TB/s | NVLink 5 + XDR 800G | 前沿預訓練、MoE 微調 | $8.34 |
| B200 SXM (HGX) | Blackwell | 180 GB HBM3e · 8 TB/s | NVLink 5 + NDR/XDR | 大規模訓練、FP4 推論 | $6.61 |
| H200 SXM (HGX) | Hopper | 141 GB HBM3e · 4.8 TB/s | NVLink 4 + NDR 400G | 70B–400B 訓練與高吞吐推論 | $3.79 |
| H100 SXM (HGX) | Hopper | 80 GB HBM3 · 3.35 TB/s | NVLink 4 + NDR 400G | 主流訓練、微調與推論 | $3.10 |
| H100 NVL / PCIe | Hopper | 94 / 80 GB · 3.9 TB/s | NVLink bridge + 200G | 高密度推論、混合負載 | $2.70 |
| A100 SXM 80GB | Ampere | 80 GB HBM2e · 2.0 TB/s | NVLink 3 + HDR 200G | 成本優先的訓練與批次推論 | $1.90 |
| A100 SXM 40GB | Ampere | 40 GB HBM2 · 1.6 TB/s | NVLink 3 + HDR 200G | 成本優先的訓練與批次推論 | $1.47 |
| RTX PRO 6000 Blackwell | Blackwell | 96 GB GDDR7 · 1.8 TB/s | PCIe Gen5 · 200G | 推論、模擬、圖形與 Omniverse | $2.18 |
| L40S | Ada Lovelace | 48 GB GDDR6 · 864 GB/s | PCIe Gen4 · 100G | 推論、渲染、影片、雲桌面 | $1.35 |
| RTX 5090 | Blackwell | 32 GB GDDR7 · 1.8 TB/s | PCIe Gen5 · 100G | 科研、擴散模型、開發叢集 | $0.75 |
以上為按需美元參考標價(每卡時),不含稅。預留與長約有折扣,詳見價格頁。
按你專案的預算方式來買算力
按需
按秒計費、無需承諾。適合實驗、評測流水線與突發微調。
- 每例項 1–8 卡
- API / 控制檯即時開通
- 快照與恢復
- 無流量費
預留叢集
1–36 個月獨佔的 InfiniBand 互聯 pod,容量鎖定、價格在合約期內固定。
- 16–4,096 卡,無阻塞網路
- 託管 Slurm 或 Kubernetes
- 最高比按需低 55%
- 合同中寫明容量保障
私有 AI 雲
由 Velyrix 按你的命名、策略與審計要求營運的物理隔離機房、網路與儲存。
- 專屬籠位或套間
- 客戶自持加密金鑰
- 可選物理隔離
- 定製 SLA 與變更管理
讓 GPU 不閒著的 rail-optimized 網路
訓練叢集的速度取決於最慢的那次 all-reduce。Velyrix 的每一個多節點 pod 都建立在 rail-optimized、無阻塞的胖樹之上,並配備獨立的儲存與管理平面。
- 計算平面:NVIDIA Quantum-2 NDR 400G 或 Quantum-X800 XDR 800G InfiniBand,1:1 收斂比
- 乙太網方案:NVIDIA Spectrum-X,支援 RoCEv2、自適應路由與擁塞控制
- 網內計算:啟用 SHARP 聚合,降低大規模集合通訊的 all-reduce 時延
- 儲存平面:獨立 200/400G 網路,checkpoint 寫入不會與梯度通訊爭搶頻寬
- 管理平面:與租戶流量隔離的帶外 BMC 網路
- 驗證:交付前提供 NCCL 匯流排頻寬與 all-reduce 時延報告
# 512× NVIDIA H200 SXM — XDR 800G rail-optimized nccl-tests/all_reduce_perf -b 8 -e 8G -f 2 -g 8 size busbw algbw status 1.00 GB 372.4 GB/s 198.1 GB/s PASS 4.00 GB 381.9 GB/s 203.7 GB/s PASS 8.00 GB 384.6 GB/s 205.1 GB/s PASS fabric : 1:1 無阻塞,72 小時 0 鏈路錯誤 gpu_burnin : 72 小時滿載 — 0 次 XID,0 次 ECC 行重對映 sustained : 48.9% MFU,Llama 級 70B 參考任務
以上為一次 Velyrix 驗收測試的代表性資料。結果會隨拓撲、模型、batch size 與軟體棧變化; 你的叢集會單獨實測並出具報告。
帶著你現有的技術棧過來,而不是做一次遷移專案
託管 Slurm
預裝 Slurm,含 Pyxis/Enroot、公平共享計費、拓撲感知排程,以及適配長週期預訓練的 checkpoint-restart 鉤子。
託管 Kubernetes
符合 CNCF 標準的叢集,整合 NVIDIA GPU Operator、Network Operator、MIG 切分、KubeRay 與 Kueue 多租戶排程。
裸金屬 API
提供 Terraform Provider 與 REST API,支援映象部署、iPXE 引導、BMC 控制與網路分割槽 — 你可以在其上自建控制平面。
映象倉庫
區域本地的 NGC、Docker Hub 與私有映象快取,避免 40 GB 映象拉取拖慢 512 卡任務的啟動。
可觀測性
DCGM、Prometheus 與 Grafana,提供按任務的 GPU 利用率、功耗、溫度、XID 事件與網路計數器,可匯出到你自己的 SIEM。
框架支援
PyTorch、JAX、NeMo、Megatron-LM、DeepSpeed、TorchTitan、vLLM、SGLang 與 TensorRT-LLM 的驗證映象,每月更新。
第一個任務跑起來之前你已經擁有的東西
按 token 預算配置的高效能並行檔案系統(WEKA 或 VAST),以及用於資料集與 checkpoint 的 S3 相容物件儲存。每節點含 10 TB NVMe 本地暫存。
無阻塞 InfiniBand 或 Spectrum-X 計算網路、雙路 100G 網際網路出口、到 AWS/Azure/GCP/Oracle 的雲專線,以及可選 BGP/IP 出口。標準套餐不收流量費。
單租戶主機、隔離的 VLAN/VRF 與網路分割槽、安全啟動韌體校驗、客戶自管金鑰,以及下架時的擦除與核驗(符合 NIST SP 800-88 purge)。
7×24 NOC、專屬解決方案架構師、P1 級 15 分鐘響應、四小時現場硬體更換目標,以及對照合同可用率的月度 SLA 報告。
交付前完成:72 小時 GPU 烤機、記憶體與 ECC 驗證、NCCL 頻寬測試、網路錯誤掃描,並出具可交給你審計方的簽署版驗收報告。
常見問題
Velyrix GPU 雲怎麼計費?
按需例項按秒計費,無最低消費,標準套餐不收資料流出費。預留叢集按月固定費率計費,租期 1 至 36 個月。企業私有云按固定月度平臺費加算力容量報價。
我拿到的是裸金屬還是虛擬機器?
兩種都有。多節點訓練預設使用單租戶裸金屬,直接訪問 GPU、網路卡與 NVMe。在更看重快照與快速重灌的場景,也提供 GPU 直通的虛擬化例項。
多節點訓練叢集用什麼網路?
rail-optimized 無阻塞 InfiniBand —— 每卡 400G 的 NVIDIA Quantum-2 NDR 或 800G 的 Quantum-X800 XDR,並啟用 SHARP 網內歸約。如果你需要純乙太網維運模型,也可選擇支援 RoCEv2 的 NVIDIA Spectrum-X。
Slurm 和 Kubernetes 能跑在同一個叢集上嗎?
可以。常見做法是把預留叢集劃分為兩部分:Slurm 分割槽跑長週期訓練,Kubernetes 分割槽跑推論服務,兩者共享同一套並行檔案系統。分割槽比例在合約期內可以調整。
大規模叢集有最短合約期嗎?
256 卡以上的叢集通常最短三個月,因為涉及網路建設與佈線工作。如果某個機房已有空閒且規格匹配的 pod,可以接受更短的視窗。