Beranda/Platform
Penyimpanan, jaringan & operasi terkelolaPlatform yang menjaga GPU mahal tetap sibuk
Akselerator adalah bagian yang mudah. Velyrix membangun lapisan penyimpanan, fabric, penjadwalan, dan observabilitas yang menentukan apakah klaster Anda berjalan pada utilisasi 30% atau 55% — dan mengoperasikan semuanya 24×7.
Beri makan GPU, checkpoint tanpa tersendat
Job 512 GPU yang menulis checkpoint multi-terabyte akan menyingkap setiap kelemahan pada jalur penyimpanan. Velyrix menentukan ukuran penyimpanan berdasarkan interval checkpoint dan pola baca dataset Anda, bukan berdasarkan angka kapasitas pada pesanan pembelian.
| Tingkat | Teknologi | Performa umum | Kasus penggunaan | Mulai (per TB/bulan) |
|---|---|---|---|---|
| Scratch | NVMe lokal Gen4/Gen5 | Hingga 60 GB/s per node | Ruang shuffle, cache dataloader, sementara | Termasuk |
| FS paralel — performa | WEKA atau VAST di NVMe | Baca agregat 1–10 TB/s | Dataset pelatihan, checkpoint | $42 |
| FS paralel — kapasitas | Tingkat hibrida NVMe + HDD | 200–800 GB/s | Epoch dingin, arsip dataset | $22 |
| Blok | NVMe-oF tereplikasi | Hingga 1 juta IOPS per volume | Basis data, vector store, volume boot | $101 |
| Objek | Kompatibel S3, erasure coded | Multi-GB/s, desain daya tahan 11 nine | Data lake, registry model, artefak | $20 |
| Arsip | Objek dingin / gateway tape | Pengambilan dalam menit hingga jam | Retensi, kepatuhan, korpus mentah | $6 |
Harga daftar indikatif, belum termasuk pajak. Sistem file paralel ditentukan ukuran dan harganya per klaster; angka kinerja bergantung pada konfigurasi yang di-deploy.
Tiga plane, tidak pernah berbagi hari buruk
- Plane komputasi: InfiniBand NVIDIA Quantum-X800 XDR 800G atau Quantum-2 NDR 400G, rail-optimised, non-blocking 1:1, SHARP aktif
- Alternatif Ethernet: NVIDIA Spectrum-X dengan RoCEv2, routing adaptif, kendali kongesti, dan offload DPU BlueField-3
- Plane penyimpanan: 200/400G dedikasi agar penulisan checkpoint tidak pernah bertabrakan dengan all-reduce gradien
- Plane manajemen: jaringan BMC out-of-band terisolasi dengan akses jump host dan audit penuh
- Eksternal: transit 100G dual-homed, mitigasi DDoS, BYOIP, dan sesi BGP atas permintaan
- Interkoneksi: tautan privat ke AWS, Azure, Google Cloud, dan Oracle, plus serat gelap antar kampus Velyrix
Topologi referensi untuk pod 512 GPU. Fabric yang lebih besar menambah tingkat ketiga; prinsip rail-optimised tidak berubah.
NOC yang memahami NCCL, bukan sekadar ping
NOC 24×7
Rotasi siaga 24×7 dengan respons P1 kontraktual 15 menit, insinyur yang paham GPU, dan eskalasi langsung ke tim yang membangun klaster Anda — bukan skrip lini pertama.
Observabilitas
DCGM, node exporter, penghitung fabric, dan telemetri job di Prometheus dan Grafana, dengan atribusi per job dan ekspor ke SIEM Anda.
Kesehatan proaktif
Pemeriksaan kesehatan node otomatis di antara job, analisis tren XID dan ECC, serta drain dan penggantian preventif sebelum satu run hilang.
Manajemen siklus hidup
Peningkatan firmware, driver, dan mesin divalidasi lebih dulu di pod staging, lalu digulirkan ke produksi pada jendela yang disepakati.
Operasi penjadwal
Penyetelan Slurm dan Kubernetes, kebijakan antrean dan kuota, konfigurasi fair-share, dan pelaporan utilisasi per tim atau pusat biaya.
Pelaporan SLA
Laporan ketersediaan, insiden, dan kapasitas bulanan diukur terhadap kontrak, dengan kredit diterapkan otomatis saat target tidak tercapai.
Isolasi yang dapat Anda buktikan
- Penyewaan: host fisik single-tenant, VLAN/VRF dedikasi, dan partisi InfiniBand dedikasi
- Identitas: single sign-on SAML/OIDC, penyediaan SCIM, MFA perangkat keras, kunci API bercakupan, dan akses berbasis peran
- Kunci: kunci enkripsi dikelola pelanggan dengan dukungan HSM; Velyrix tidak dapat membaca volume penyewa
- Data saat diam: AES-256 pada tier blok, objek, dan penyimpanan paralel
- Data saat transit: TLS 1.3 secara eksternal, opsi MACsec dan IPsec pada tautan privat
- Integritas firmware: secure boot, baseline firmware bertanda tangan, dan atestasi pada setiap penyediaan
- Dekomisioning: purge NIST SP 800-88 dengan sertifikat sanitasi, atau penghancuran disaksikan pelanggan
- Pencatatan: jejak audit tak terubah atas setiap peristiwa konsol, API, dan akses fisik
provider "velyrix" { region = "us-east-1" } resource "velyrix_cluster" "training" { name = "acme-pretrain" node_type = "hgx-h200-8g" node_count = 64 fabric = "infiniband-ndr" scheduler = "slurm" storage { parallel_fs_tb = 800 object_tb = 2000 } # 512 GPUs, one apply, validated on delivery }
GPU milik Anda. Kami yang mengoperasikannya.
Beli server NVIDIA Anda dari OEM atau distributor mana pun, kirim langsung ke fasilitas Velyrix, dan kami menangani sisanya: implementasi, jaringan, pendinginan, pemantauan, dan dukungan. Atau sewa milik kami. Apa pun pilihannya, Anda menerima rencana dalam satu hari kerja.
Pertanyaan umum
Penyimpanan apa yang harus kami pakai untuk pelatihan besar?
Sistem file paralel berkinerja - WEKA atau VAST pada NVMe - untuk dataset aktif dan checkpoint, didukung penyimpanan objek kompatibel S3 untuk data lake yang lebih luas, dengan NVMe scratch lokal di tiap node untuk ruang shuffle. Velyrix menentukan ukuran tier kinerja dari ukuran dan interval checkpoint Anda agar checkpointing tidak pernah mendominasi waktu langkah.
Apakah Anda mendukung Ethernet alih-alih InfiniBand?
Ya. NVIDIA Spectrum-X dengan RoCEv2, routing adaptif, dan kendali kongesti tersedia bila model operasional khusus Ethernet lebih disukai. InfiniBand tetap menjadi standar untuk fabric pelatihan terbesar karena reduksi SHARP dalam jaringan dan manajemen subnet yang matang.
Bisakah kami menghubungkan klaster Velyrix ke lingkungan cloud kami yang ada?
Ya, melalui interkoneksi privat ke AWS, Azure, Google Cloud, dan Oracle Cloud, tautan terlindungi IPsec atau MACsec ke pusat data Anda sendiri, serta cross-connect di ruang meet-me netral operator kami.
Siapa yang mengoperasikan klaster sehari-hari?
Anda dapat mengoperasikannya sendiri dengan akses root dan BMC penuh, atau menyerahkan operasi kepada Velyrix di bawah layanan terkelola yang mencakup pemantauan, respons insiden, siklus hidup firmware dan driver, kebijakan penjadwal, dan pelaporan SLA.