首頁/平臺

儲存、網路與託管維運

昂貴的 GPU 不閒著的平臺層

加速卡只是最容易的部分。儲存、網路、排程與可觀測性這幾層,才決定你的叢集是跑在 30% 利用率還是 55% — 而這些我們全部 7×24 營運。

儲存

餵飽 GPU,並且 checkpoint 不卡頓

一個 512 卡任務寫入數 TB 的 checkpoint,會把儲存鏈路上任何一個短板暴露出來。Velyrix 按你的 checkpoint 間隔與資料集讀取模式來配置儲存,而不是照著採購單上的容量數字配。

層級技術典型效能用途起價(每 TB/月)
本地暫存本地 NVMe Gen4/Gen5單節點最高 60 GB/sShuffle 空間、dataloader 快取、臨時檔案已包含
並行檔案系統 — 效能型WEKA 或 VAST(NVMe)總讀頻寬 1–10 TB/s訓練資料集、checkpoint$42
並行檔案系統 — 容量型NVMe + HDD 混合層200–800 GB/s冷資料輪次、資料集歸檔$22
塊儲存NVMe-oF 多副本單卷最高 100 萬 IOPS資料庫、向量庫、系統盤$101
物件儲存S3 相容、糾刪碼多 GB/s,11 個 9 永續性設計資料湖、模型倉庫、產物$20
歸檔冷物件 / 磁帶閘道器數分鐘至數小時取回留存、合規、原始語料$6

以上為美元參考標價,不含稅。並行檔案系統按叢集單獨配置與報價;效能資料取決於實際部署配置。

網路

三個平面,互不拖累

  • 計算平面:NVIDIA Quantum-X800 XDR 800G 或 Quantum-2 NDR 400G InfiniBand,rail-optimized、1:1 無阻塞、啟用 SHARP
  • 乙太網方案:NVIDIA Spectrum-X,支援 RoCEv2、自適應路由、擁塞控制與 BlueField-3 DPU 解除安裝
  • 儲存平面:獨立 200/400G,checkpoint 寫入永遠不會撞上梯度 all-reduce
  • 管理平面:隔離的帶外 BMC 網路,透過跳板機訪問並全程審計
  • 對外出口:雙上聯 100G 出口、DDoS 防護,可按需提供 BYOIP 與 BGP 會話
  • 互聯:到 AWS、Azure、Google Cloud 與 Oracle 的專線,以及 Velyrix 園區之間的自有暗光纖
脊交換 — Quantum-X800 XDR×8
葉交換 — rail 0–7×32
儲存葉交換 — Spectrum-X SN5600×4
邊界 / 出口路由器2N
帶外管理網路物理隔離
雲專線 — 4×10G私有
子網管理器 — 高可用對主備

以上為 512 卡 pod 的參考拓撲。更大規模的網路會增加第三層,但 rail-optimized 的原則不變。

託管維運

一個懂 NCCL、而不只是會 ping 的 NOC

7×24 NOC

7×24 值班輪轉,合同約定 P1 級 15 分鐘響應;接電話的工程師真正懂 GPU,並可直接升級到建設你叢集的那支團隊 — 不是照著話術唸的一線客服。

📊

可觀測性

DCGM、node exporter、網路計數器與任務遙測統一進入 Prometheus 與 Grafana,支援按任務歸因並匯出到你的 SIEM。

🛡

主動健康檢查

任務之間自動執行節點健康檢查,分析 XID 與 ECC 趨勢,在訓練任務受損之前提前隔離並更換。

🔄

生命週期管理

韌體、驅動程式與推論引擎升級先在預釋出 pod 驗證,再按約定視窗滾動到生產環境。

📦

排程器維運

Slurm 與 Kubernetes 調優、佇列與配額策略、公平共享配置,以及按團隊或成本中心的利用率報告。

📝

SLA 報告

按合同口徑出具月度可用性、故障與容量報告,未達標時自動核減下一期賬單。

安全架構

可舉證的隔離

  • 租戶隔離:單租戶物理主機、專屬 VLAN/VRF 與專屬 InfiniBand 分割槽
  • 身份:SAML/OIDC 單點登入、SCIM 自動開戶、硬體 MFA、按作用域的 API Key 與基於角色的許可權
  • 金鑰:由 HSM 支撐的客戶自管金鑰;Velyrix 無法讀取租戶卷
  • 靜態資料:塊、物件與並行儲存層均採用 AES-256 加密
  • 傳輸中資料:對外 TLS 1.3,專線可選 MACsec 與 IPsec
  • 韌體完整性:安全啟動、簽名韌體基線,每次開通時執行校驗
  • 下架:按 NIST SP 800-88 執行擦除並出具證明,或客戶見證銷燬
  • 日誌:控制檯、API 與物理准入事件的不可篡改審計記錄
main.tf
provider "velyrix" {
  region = "us-east-1"
}

resource "velyrix_cluster" "training" {
  name          = "acme-pretrain"
  node_type     = "hgx-h200-8g"
  node_count    = 64
  fabric        = "infiniband-ndr"
  scheduler     = "slurm"

  storage {
    parallel_fs_tb = 800
    object_tb      = 2000
  }

  # 512 張 GPU,一次 apply,交付時完成驗證
}
與 AI 基礎設施架構師洽談

GPU 由你擁有,維運交給我們

向任何一家 OEM 或經銷商採購你的 NVIDIA 伺服器,直接寄送至 Velyrix 機房,其餘交給我們 — 部署、組網、散熱、監控與長期支援。當然也可以直接租用我們的機器。無論哪一種方式,一個工作天內提供完整方案。

常見問題

大規模訓練應該用什麼儲存?

活躍資料集與 checkpoint 用效能型並行檔案系統(WEKA 或 VAST,基於 NVMe),更大的資料湖用 S3 相容物件儲存承接,每個節點再配本地 NVMe 作為 shuffle 空間。Velyrix 會按你的 checkpoint 大小與寫入間隔來配置效能層,確保 checkpoint 不會主導單步時間。

可以用乙太網代替 InfiniBand 嗎?

可以。如果你更希望統一為乙太網維運模型,我們提供支援 RoCEv2、自適應路由與擁塞控制的 NVIDIA Spectrum-X。最大規模的訓練網路預設仍用 InfiniBand,因為它有 SHARP 網內歸約和成熟的子網管理。

Velyrix 叢集能連到我們現有的雲環境嗎?

可以,透過到 AWS、Azure、Google Cloud 與 Oracle Cloud 的專線、到你自有機房的 IPsec 或 MACsec 鏈路,以及我們中立 MMR 機房內的跳線。

日常由誰來維運叢集?

你可以自己維運(擁有完整的 Root 與 BMC 許可權),也可以把維運交給 Velyrix 託管服務,涵蓋監控、故障響應、韌體與驅動程式生命週期、排程策略與 SLA 報告。