Beranda/Deployment AI

Deployment & commissioning infrastruktur AI

Dari palet di dok hingga klaster tervalidasi

Insinyur deployment Velyrix membangun pabrik AI untuk operator, perusahaan, dan pemerintah — di ruang kami atau ruang Anda. Setiap penugasan berakhir sama: klaster yang telah di-burn-in, di-benchmark, terdokumentasi, dan laporan uji terima bertanda tangan yang dapat dibaca auditor Anda.

Pembangunan greenfield
12 – 20 minggu
Pod ekspansi
3 – 6 minggu
Skala klaster yang didukung
8 – 4,096 GPUs
Burn-in
Minimal 72 jam
Serah terima
Laporan uji terima bertanda tangan
Lingkup

Semua hal antara pesanan pembelian dan job pelatihan pertama

Sebagian besar proyek GPU tidak gagal pada silikonnya. Mereka gagal pada sirkuit pendingin, pada satu rail yang salah kabel, pada firmware yang tidak seragam di delapan node, atau karena tidak ada yang pernah mengukur kinerja fabric yang sebenarnya.

📐

Desain & rekayasa

Topologi klaster, elevasi rak, jadwal daya, desain sirkuit pendingin, bobot dan beban lantai, rencana kabel fabric, serta daftar material.

🚚

Logistik & penerimaan

Koordinasi pengangkutan, dukungan dokumen kepabeanan, penerimaan aman, pencatatan aset, pendaftaran nomor seri, dan pembuangan kemasan.

🔨

Rack & stack

Instalasi mekanis sistem HGX, DGX, MGX, dan ORv3, kit rail, perpipaan CDU dan manifold, pengencangan dengan torsi terkendali, dan penanganan terkendali ESD.

Daya & pendinginan

Terminasi busway dan whip oleh teknisi listrik berlisensi, penyeimbangan suplai A/B, pengisian pendingin dan uji tekanan, serta commissioning deteksi kebocoran.

📡

Pembangunan fabric

Pengabelan InfiniBand atau Spectrum-X rail-optimised, pelabelan sesuai rencana, pemasangan optik, pelatihan tautan, penyisiran laju galat, dan verifikasi topologi.

💾

Penyelarasan firmware

BIOS, BMC, CPLD, NIC, NVSwitch, dan VBIOS GPU diselaraskan ke satu baseline tervalidasi di setiap node, dengan pelaporan penyimpangan.

💻

Tumpukan perangkat lunak

Image OS, driver NVIDIA, CUDA, Fabric Manager, DCGM, runtime kontainer, Slurm atau Kubernetes, klien penyimpanan, dan agen pemantauan.

🔥

Burn-in & validasi

Tekanan berkelanjutan 72 jam, perendaman termal, pemantauan ECC dan XID, pemeriksaan remap baris memori, serta uji throughput penyimpanan dan fabric.

📋

Uji terima & serah terima

Hasil uji terima terdokumentasi, gambar as-built, daftar aset, runbook, matriks eskalasi, dan pelatihan operator.

Program

Metode deployment Velyrix

Program sembilan tahap yang dapat diulang dengan manajer proyek bernama, pelaporan mingguan, dan gate terdokumentasi di akhir setiap tahap.

Penemuan & tinjauan desain

Profil beban kerja, ukuran model, anggaran token, dan kurva pertumbuhan diterjemahkan menjadi topologi klaster, amplop daya, dan ukuran penyimpanan. Keluaran: dokumen desain dan BOM.

Penilaian kesiapan lokasi

Kapasitas daya, beban lantai, ketersediaan pendingin, akses pengiriman, pemadam kebakaran, dan jalur fabric disurvei terhadap desain. Keluaran: laporan kesiapan dengan daftar kesenjangan.

Dukungan pengadaan & logistik

Pelacakan waktu tunggu OEM, rencana staging, dukungan dokumen ekspor dan impor, serta penyaringan pengguna akhir sebelum perangkat keras terkendali dikirim. Keluaran: jadwal pengiriman.

Instalasi mekanis

Rak diratakan dan dibonding, sistem dipasang, manifold dan cold plate diperpipa, pendingin diisi dan diuji tekanan, manajemen kabel dirapikan sesuai rencana. Keluaran: elevasi as-built.

Commissioning kelistrikan

Terminasi sirkuit, penyeimbangan fasa, koordinasi pemutus, dan verifikasi pengukuran oleh teknisi listrik berlisensi sesuai pernyataan metode terdokumentasi. Keluaran: persetujuan kelistrikan.

Pembangunan & verifikasi fabric

Pengabelan rail-optimised dipasang dan diberi label, setiap tautan dilatih pada laju penuh, penyisiran laju galat bit, peta topologi dibandingkan dengan desain. Keluaran: laporan tautan dan topologi.

Perangkat lunak & bring-up klaster

Deployment golden image, penegakan baseline firmware, konfigurasi penjadwal, mount penyimpanan, integrasi pemantauan dan peringatan. Keluaran: baseline konfigurasi.

Burn-in & validasi kinerja

Tekanan 72 jam pada daya penuh, benchmark NCCL all-reduce dan all-gather, throughput penyimpanan, dan pelatihan model referensi pada skala target. Keluaran: hasil benchmark.

Uji terima & serah terima operasional

Laporan uji terima ditinjau dan ditandatangani, runbook dan jalur eskalasi diserahkan, pelatihan operator diberikan, opsi transisi ke operasi terkelola Velyrix. Keluaran: ATP bertanda tangan.

Protokol uji terima

Apa yang kami ukur sebelum menyatakan selesai

Kriteria lulus disepakati tertulis pada tahap desain dan diuji saat serah terima. Apa pun yang gagal diperbaiki dan diuji ulang atas biaya Velyrix dalam penugasan harga tetap.

UjiMetodeKriteria lulus tipikalBukti
Inventaris & kesehatan GPUnvidia-smi, DCGM diagnostics level 3100% GPU terdeteksi, nol ECC tak terkoreksi, nol remap baris tertundaLaporan DCGM per node
Burn-in berkelanjutanTekanan gabungan GPU, CPU, memori, dan NVMe selama 72 jamNol galat XID, nol peristiwa throttle termal, clock stabilEkspor telemetri deret waktu
NVLink / NVSwitchnvbandwidth, uji latensi bandwidth p2pDalam 5% dari bandwidth referensi platform pada setiap pasanganMatriks bandwidth
Kualitas tautan fabricPelatihan tautan, penyisiran BER, penghitung galat portSemua tautan pada laju penuh, laju galat simbol di bawah ambang vendor, nol flap dalam 72 jamLaporan kesehatan fabric
Kinerja kolektifNCCL all-reduce dan all-gather, 8 MB – 8 GBBandwidth bus dalam 10% dari referensi topologi pada skala penuhnccl-tests output
Throughput penyimpananfio dan IOR terhadap sistem file paralelBaca/tulis agregat dan waktu checkpoint sesuai kontrak tercapaiLog benchmark
Pelatihan referensiModel referensi kelas Llama pada jumlah node targetUtilisasi FLOPs model dan waktu langkah sesuai kontrak tercapaiLog pelatihan & perhitungan MFU
Failover & ketahananPencabutan daya A/B, pencabutan switch leaf, failover pompa CDUTidak ada job hilang pada jalur redundan, waktu pemulihan terdokumentasiLembar saksi uji
Termal & dayaPerendaman beban penuh dengan telemetri masuk, keluar, dan pendinginSemua komponen dalam spesifikasi OEM pada suhu lingkungan desainSurvei termal
Baseline keamananSecure boot, pengerasan BMC, rotasi kredensial, segmentasi jaringanBaseline diterapkan pada 100% node, tanpa kredensial bawaanAudit konfigurasi
Cara kami bekerja dengan aman

Dibuat untuk lolos audit OEM dan pihak asuransi

Pekerjaan deployment menyentuh garansi orang lain, ruang orang lain, dan instalasi listrik yang hidup. Velyrix menjalankan penugasan sesuai dengan itu.

  • Pernyataan metode & penilaian risiko diterbitkan dan disetujui sebelum pekerjaan apa pun di lantai yang hidup
  • Teknisi listrik berlisensi untuk seluruh terminasi daya, sesuai kode setempat dan praktik arc-flash
  • Penanganan terkendali ESD sesuai ANSI/ESD S20.20 untuk melindungi ketentuan garansi OEM
  • Panduan instalasi OEM diikuti agar garansi pabrikan dan hak dukungan tetap utuh
  • Rantai penjagaan dari dok hingga rak, dengan pencatatan aset tingkat nomor seri dan rekaman foto
  • Kendali perubahan dengan jendela kerja terdokumentasi, rencana rollback, dan gate persetujuan pelanggan
  • Insinyur terasuransi dan tersaring, dengan pemeriksaan latar belakang dan otorisasi akses per lokasi
  • Penyaringan pengendalian ekspor diselesaikan sebelum perangkat keras terkendali dikirim atau dipasang

Model penugasan

Pembangunan harga tetap

Lingkup disepakati, kriteria uji terima disepakati, harga disepakati. Model paling umum untuk klaster greenfield.

Waktu & material

Tarif harian insinyur untuk ekspansi, perbaikan, migrasi, dan penelusuran masalah pada estat yang sudah ada.

Residensi

Insinyur Velyrix ditempatkan di lokasi Anda selama periode tertentu untuk membangun kapabilitas bersama tim Anda.

Bangun & operasikan

Kami membangunnya, lalu menjalankannya di bawah layanan terkelola dengan SLA ketersediaan dan kinerja.

Biaya deployment harga tetap tipikal berkisar dari sekitar $2.300 per node untuk ekspansi berpendingin udara yang sederhana hingga $4.600–$10.900 per node untuk sistem berskala rak berpendingin cair, termasuk pembangunan fabric, validasi, dan dokumentasi. Setiap penugasan ditawarkan setelah tinjauan desain.

Untuk OEM, distributor & reseller

Kami juga bangku layanan lapangan di balik kesepakatan pihak lain

Kami siap menjalankan pekerjaan deployment untuk vendor perangkat keras dan mitranya — dengan merek kami atau, yang lebih berguna bagi Anda, dengan merek mereka.

  • Penyerahan white-label — merek Anda pada rencana proyek dan laporan uji terima
  • Playbook tervalidasi untuk platform Dell, Supermicro, GIGABYTE, HPE, Lenovo, dan NVIDIA DGX
  • Dukungan L1–L3 dengan jalur eskalasi terdokumentasi ke pabrikan
  • Koordinasi RMA dan depot suku cadang disesuaikan dengan armada yang di-deploy
  • Registrasi peluang dan kebijakan netralitas channel tertulis

Menjaga garansi sejak rancangannya

Setiap platform yang kami deploy memiliki playbook Velyrix yang diturunkan dari panduan instalasi terbitan pabrikan.

  • Penanganan ESD sesuai ANSI/ESD S20.20
  • Spesifikasi torsi dan prosedur kit rail diikuti
  • Baseline firmware disesuaikan dengan tumpukan tervalidasi vendor
  • Catatan tingkat nomor seri dan bukti foto disimpan
  • Bukti kegagalan dikemas dalam format yang diminta vendor

Hasilnya: garansi pabrikan dan hak dukungan tetap utuh, dan sengketa RMA soal praktik instalasi tidak terjadi.

Juga tersedia

Layanan deployment setelah pembangunan pertama

Migrasi & relokasi

Pindahkan estat GPU yang sedang berjalan antar ruang atau penyedia dengan rencana cutover bertahap, downtime pelatihan minimal, dan rekonsiliasi aset penuh.

🔍

Audit kesehatan klaster

Penilaian independen atas klaster yang sudah ada: galat fabric, penyimpangan firmware, ruang termal, efisiensi penjadwal, dan MFU yang terealisasi, dengan rencana perbaikan berprioritas.

🔁

Siklus hidup & peremajaan

Perencanaan kapasitas, peremajaan perangkat keras bertahap, dekomisioning dengan sanitasi media NIST SP 800-88, serta dukungan pembuangan bersertifikat atau penjualan kembali.

👥

Operasi terkelola

Pemantauan 24×7, respons insiden, siklus hidup firmware dan driver, manajemen suku cadang, dan pelaporan kapasitas terhadap SLA Anda.

Bicara dengan arsitek infrastruktur AI

GPU milik Anda. Kami yang mengoperasikannya.

Beli server NVIDIA Anda dari OEM atau distributor mana pun, kirim langsung ke fasilitas Velyrix, dan kami menangani sisanya: implementasi, jaringan, pendinginan, pemantauan, dan dukungan. Atau sewa milik kami. Apa pun pilihannya, Anda menerima rencana dalam satu hari kerja.

Pertanyaan umum

Apa sebenarnya yang termasuk dalam commissioning infrastruktur AI?

Commissioning adalah proses formal membuktikan bahwa sebuah klaster bekerja sesuai spesifikasi sebelum diserahkan: penyelarasan firmware, burn-in 72 jam, pemeriksaan kesehatan GPU dan NVLink, penyisiran kualitas tautan fabric, benchmark kolektif NCCL, uji throughput penyimpanan, pelatihan referensi, uji failover, dan survei termal - semuanya terekam dalam laporan uji terima bertanda tangan.

Bisakah Velyrix men-deploy di pusat data kami sendiri, bukan milik Anda?

Ya. Sebagian besar pekerjaan kami berlangsung di lokasi pelanggan atau pihak ketiga - pusat data perusahaan, fasilitas pemerintah, dan ruang kolokasi operator lain. Kami mengikuti aturan akses, keselamatan, dan kendali perubahan lokasi tuan rumah, dan kami dapat bertindak sebagai subkontraktor integrator Anda yang sudah ada bila itu lebih sederhana.

Berapa lama klaster GPU greenfield diselesaikan?

Setelah perangkat keras berada di lokasi, pembangunan tipikal berlangsung tiga hingga enam minggu per pod. Dari ujung ke ujung - desain, pekerjaan lokasi, waktu tunggu perangkat keras, pembangunan, dan commissioning - pabrik AI greenfield biasanya 12 hingga 20 minggu, dengan waktu tunggu OEM sebagai variabel terbesar.

Apakah pekerjaan deployment pihak ketiga membatalkan garansi perangkat keras OEM kami?

Tidak, selama pekerjaan mengikuti panduan instalasi terbitan pabrikan. Insinyur Velyrix bekerja sesuai prosedur OEM dengan penanganan terkendali ESD, spesifikasi torsi, dan catatan tingkat nomor seri yang terdokumentasi, sehingga garansi pabrikan dan hak dukungan tetap utuh.

Apa yang terjadi jika klaster gagal uji terima?

Dalam penugasan harga tetap, Velyrix memperbaiki dan menguji ulang atas biaya kami sampai kriteria yang disepakati terpenuhi. Kegagalan yang berasal dari perangkat keras cacat diajukan ke OEM di bawah garansi, dan kami mengelola proses itu atas nama Anda.

Apakah Anda mendukung sistem berpendingin cair dan berskala rak seperti GB300 NVL72?

Ya. Deployment berpendingin cair mencakup pemasangan manifold dan cold plate, pengisian pendingin dan uji tekanan, commissioning CDU, validasi deteksi kebocoran, dan uji failover pompa, di samping protokol uji terima komputasi dan fabric standar.