Beranda/Deployment AI
Deployment & commissioning infrastruktur AIDari palet di dok hingga klaster tervalidasi
Insinyur deployment Velyrix membangun pabrik AI untuk operator, perusahaan, dan pemerintah — di ruang kami atau ruang Anda. Setiap penugasan berakhir sama: klaster yang telah di-burn-in, di-benchmark, terdokumentasi, dan laporan uji terima bertanda tangan yang dapat dibaca auditor Anda.
Semua hal antara pesanan pembelian dan job pelatihan pertama
Sebagian besar proyek GPU tidak gagal pada silikonnya. Mereka gagal pada sirkuit pendingin, pada satu rail yang salah kabel, pada firmware yang tidak seragam di delapan node, atau karena tidak ada yang pernah mengukur kinerja fabric yang sebenarnya.
Desain & rekayasa
Topologi klaster, elevasi rak, jadwal daya, desain sirkuit pendingin, bobot dan beban lantai, rencana kabel fabric, serta daftar material.
Logistik & penerimaan
Koordinasi pengangkutan, dukungan dokumen kepabeanan, penerimaan aman, pencatatan aset, pendaftaran nomor seri, dan pembuangan kemasan.
Rack & stack
Instalasi mekanis sistem HGX, DGX, MGX, dan ORv3, kit rail, perpipaan CDU dan manifold, pengencangan dengan torsi terkendali, dan penanganan terkendali ESD.
Daya & pendinginan
Terminasi busway dan whip oleh teknisi listrik berlisensi, penyeimbangan suplai A/B, pengisian pendingin dan uji tekanan, serta commissioning deteksi kebocoran.
Pembangunan fabric
Pengabelan InfiniBand atau Spectrum-X rail-optimised, pelabelan sesuai rencana, pemasangan optik, pelatihan tautan, penyisiran laju galat, dan verifikasi topologi.
Penyelarasan firmware
BIOS, BMC, CPLD, NIC, NVSwitch, dan VBIOS GPU diselaraskan ke satu baseline tervalidasi di setiap node, dengan pelaporan penyimpangan.
Tumpukan perangkat lunak
Image OS, driver NVIDIA, CUDA, Fabric Manager, DCGM, runtime kontainer, Slurm atau Kubernetes, klien penyimpanan, dan agen pemantauan.
Burn-in & validasi
Tekanan berkelanjutan 72 jam, perendaman termal, pemantauan ECC dan XID, pemeriksaan remap baris memori, serta uji throughput penyimpanan dan fabric.
Uji terima & serah terima
Hasil uji terima terdokumentasi, gambar as-built, daftar aset, runbook, matriks eskalasi, dan pelatihan operator.
Metode deployment Velyrix
Program sembilan tahap yang dapat diulang dengan manajer proyek bernama, pelaporan mingguan, dan gate terdokumentasi di akhir setiap tahap.
Penemuan & tinjauan desain
Profil beban kerja, ukuran model, anggaran token, dan kurva pertumbuhan diterjemahkan menjadi topologi klaster, amplop daya, dan ukuran penyimpanan. Keluaran: dokumen desain dan BOM.
Penilaian kesiapan lokasi
Kapasitas daya, beban lantai, ketersediaan pendingin, akses pengiriman, pemadam kebakaran, dan jalur fabric disurvei terhadap desain. Keluaran: laporan kesiapan dengan daftar kesenjangan.
Dukungan pengadaan & logistik
Pelacakan waktu tunggu OEM, rencana staging, dukungan dokumen ekspor dan impor, serta penyaringan pengguna akhir sebelum perangkat keras terkendali dikirim. Keluaran: jadwal pengiriman.
Instalasi mekanis
Rak diratakan dan dibonding, sistem dipasang, manifold dan cold plate diperpipa, pendingin diisi dan diuji tekanan, manajemen kabel dirapikan sesuai rencana. Keluaran: elevasi as-built.
Commissioning kelistrikan
Terminasi sirkuit, penyeimbangan fasa, koordinasi pemutus, dan verifikasi pengukuran oleh teknisi listrik berlisensi sesuai pernyataan metode terdokumentasi. Keluaran: persetujuan kelistrikan.
Pembangunan & verifikasi fabric
Pengabelan rail-optimised dipasang dan diberi label, setiap tautan dilatih pada laju penuh, penyisiran laju galat bit, peta topologi dibandingkan dengan desain. Keluaran: laporan tautan dan topologi.
Perangkat lunak & bring-up klaster
Deployment golden image, penegakan baseline firmware, konfigurasi penjadwal, mount penyimpanan, integrasi pemantauan dan peringatan. Keluaran: baseline konfigurasi.
Burn-in & validasi kinerja
Tekanan 72 jam pada daya penuh, benchmark NCCL all-reduce dan all-gather, throughput penyimpanan, dan pelatihan model referensi pada skala target. Keluaran: hasil benchmark.
Uji terima & serah terima operasional
Laporan uji terima ditinjau dan ditandatangani, runbook dan jalur eskalasi diserahkan, pelatihan operator diberikan, opsi transisi ke operasi terkelola Velyrix. Keluaran: ATP bertanda tangan.
Apa yang kami ukur sebelum menyatakan selesai
Kriteria lulus disepakati tertulis pada tahap desain dan diuji saat serah terima. Apa pun yang gagal diperbaiki dan diuji ulang atas biaya Velyrix dalam penugasan harga tetap.
| Uji | Metode | Kriteria lulus tipikal | Bukti |
|---|---|---|---|
| Inventaris & kesehatan GPU | nvidia-smi, DCGM diagnostics level 3 | 100% GPU terdeteksi, nol ECC tak terkoreksi, nol remap baris tertunda | Laporan DCGM per node |
| Burn-in berkelanjutan | Tekanan gabungan GPU, CPU, memori, dan NVMe selama 72 jam | Nol galat XID, nol peristiwa throttle termal, clock stabil | Ekspor telemetri deret waktu |
| NVLink / NVSwitch | nvbandwidth, uji latensi bandwidth p2p | Dalam 5% dari bandwidth referensi platform pada setiap pasangan | Matriks bandwidth |
| Kualitas tautan fabric | Pelatihan tautan, penyisiran BER, penghitung galat port | Semua tautan pada laju penuh, laju galat simbol di bawah ambang vendor, nol flap dalam 72 jam | Laporan kesehatan fabric |
| Kinerja kolektif | NCCL all-reduce dan all-gather, 8 MB – 8 GB | Bandwidth bus dalam 10% dari referensi topologi pada skala penuh | nccl-tests output |
| Throughput penyimpanan | fio dan IOR terhadap sistem file paralel | Baca/tulis agregat dan waktu checkpoint sesuai kontrak tercapai | Log benchmark |
| Pelatihan referensi | Model referensi kelas Llama pada jumlah node target | Utilisasi FLOPs model dan waktu langkah sesuai kontrak tercapai | Log pelatihan & perhitungan MFU |
| Failover & ketahanan | Pencabutan daya A/B, pencabutan switch leaf, failover pompa CDU | Tidak ada job hilang pada jalur redundan, waktu pemulihan terdokumentasi | Lembar saksi uji |
| Termal & daya | Perendaman beban penuh dengan telemetri masuk, keluar, dan pendingin | Semua komponen dalam spesifikasi OEM pada suhu lingkungan desain | Survei termal |
| Baseline keamanan | Secure boot, pengerasan BMC, rotasi kredensial, segmentasi jaringan | Baseline diterapkan pada 100% node, tanpa kredensial bawaan | Audit konfigurasi |
Dibuat untuk lolos audit OEM dan pihak asuransi
Pekerjaan deployment menyentuh garansi orang lain, ruang orang lain, dan instalasi listrik yang hidup. Velyrix menjalankan penugasan sesuai dengan itu.
- Pernyataan metode & penilaian risiko diterbitkan dan disetujui sebelum pekerjaan apa pun di lantai yang hidup
- Teknisi listrik berlisensi untuk seluruh terminasi daya, sesuai kode setempat dan praktik arc-flash
- Penanganan terkendali ESD sesuai ANSI/ESD S20.20 untuk melindungi ketentuan garansi OEM
- Panduan instalasi OEM diikuti agar garansi pabrikan dan hak dukungan tetap utuh
- Rantai penjagaan dari dok hingga rak, dengan pencatatan aset tingkat nomor seri dan rekaman foto
- Kendali perubahan dengan jendela kerja terdokumentasi, rencana rollback, dan gate persetujuan pelanggan
- Insinyur terasuransi dan tersaring, dengan pemeriksaan latar belakang dan otorisasi akses per lokasi
- Penyaringan pengendalian ekspor diselesaikan sebelum perangkat keras terkendali dikirim atau dipasang
Model penugasan
Lingkup disepakati, kriteria uji terima disepakati, harga disepakati. Model paling umum untuk klaster greenfield.
Tarif harian insinyur untuk ekspansi, perbaikan, migrasi, dan penelusuran masalah pada estat yang sudah ada.
Insinyur Velyrix ditempatkan di lokasi Anda selama periode tertentu untuk membangun kapabilitas bersama tim Anda.
Kami membangunnya, lalu menjalankannya di bawah layanan terkelola dengan SLA ketersediaan dan kinerja.
Biaya deployment harga tetap tipikal berkisar dari sekitar $2.300 per node untuk ekspansi berpendingin udara yang sederhana hingga $4.600–$10.900 per node untuk sistem berskala rak berpendingin cair, termasuk pembangunan fabric, validasi, dan dokumentasi. Setiap penugasan ditawarkan setelah tinjauan desain.
Kami juga bangku layanan lapangan di balik kesepakatan pihak lain
Kami siap menjalankan pekerjaan deployment untuk vendor perangkat keras dan mitranya — dengan merek kami atau, yang lebih berguna bagi Anda, dengan merek mereka.
- Penyerahan white-label — merek Anda pada rencana proyek dan laporan uji terima
- Playbook tervalidasi untuk platform Dell, Supermicro, GIGABYTE, HPE, Lenovo, dan NVIDIA DGX
- Dukungan L1–L3 dengan jalur eskalasi terdokumentasi ke pabrikan
- Koordinasi RMA dan depot suku cadang disesuaikan dengan armada yang di-deploy
- Registrasi peluang dan kebijakan netralitas channel tertulis
Menjaga garansi sejak rancangannya
Setiap platform yang kami deploy memiliki playbook Velyrix yang diturunkan dari panduan instalasi terbitan pabrikan.
- Penanganan ESD sesuai ANSI/ESD S20.20
- Spesifikasi torsi dan prosedur kit rail diikuti
- Baseline firmware disesuaikan dengan tumpukan tervalidasi vendor
- Catatan tingkat nomor seri dan bukti foto disimpan
- Bukti kegagalan dikemas dalam format yang diminta vendor
Hasilnya: garansi pabrikan dan hak dukungan tetap utuh, dan sengketa RMA soal praktik instalasi tidak terjadi.
Layanan deployment setelah pembangunan pertama
Migrasi & relokasi
Pindahkan estat GPU yang sedang berjalan antar ruang atau penyedia dengan rencana cutover bertahap, downtime pelatihan minimal, dan rekonsiliasi aset penuh.
Audit kesehatan klaster
Penilaian independen atas klaster yang sudah ada: galat fabric, penyimpangan firmware, ruang termal, efisiensi penjadwal, dan MFU yang terealisasi, dengan rencana perbaikan berprioritas.
Siklus hidup & peremajaan
Perencanaan kapasitas, peremajaan perangkat keras bertahap, dekomisioning dengan sanitasi media NIST SP 800-88, serta dukungan pembuangan bersertifikat atau penjualan kembali.
Operasi terkelola
Pemantauan 24×7, respons insiden, siklus hidup firmware dan driver, manajemen suku cadang, dan pelaporan kapasitas terhadap SLA Anda.
GPU milik Anda. Kami yang mengoperasikannya.
Beli server NVIDIA Anda dari OEM atau distributor mana pun, kirim langsung ke fasilitas Velyrix, dan kami menangani sisanya: implementasi, jaringan, pendinginan, pemantauan, dan dukungan. Atau sewa milik kami. Apa pun pilihannya, Anda menerima rencana dalam satu hari kerja.
Pertanyaan umum
Apa sebenarnya yang termasuk dalam commissioning infrastruktur AI?
Commissioning adalah proses formal membuktikan bahwa sebuah klaster bekerja sesuai spesifikasi sebelum diserahkan: penyelarasan firmware, burn-in 72 jam, pemeriksaan kesehatan GPU dan NVLink, penyisiran kualitas tautan fabric, benchmark kolektif NCCL, uji throughput penyimpanan, pelatihan referensi, uji failover, dan survei termal - semuanya terekam dalam laporan uji terima bertanda tangan.
Bisakah Velyrix men-deploy di pusat data kami sendiri, bukan milik Anda?
Ya. Sebagian besar pekerjaan kami berlangsung di lokasi pelanggan atau pihak ketiga - pusat data perusahaan, fasilitas pemerintah, dan ruang kolokasi operator lain. Kami mengikuti aturan akses, keselamatan, dan kendali perubahan lokasi tuan rumah, dan kami dapat bertindak sebagai subkontraktor integrator Anda yang sudah ada bila itu lebih sederhana.
Berapa lama klaster GPU greenfield diselesaikan?
Setelah perangkat keras berada di lokasi, pembangunan tipikal berlangsung tiga hingga enam minggu per pod. Dari ujung ke ujung - desain, pekerjaan lokasi, waktu tunggu perangkat keras, pembangunan, dan commissioning - pabrik AI greenfield biasanya 12 hingga 20 minggu, dengan waktu tunggu OEM sebagai variabel terbesar.
Apakah pekerjaan deployment pihak ketiga membatalkan garansi perangkat keras OEM kami?
Tidak, selama pekerjaan mengikuti panduan instalasi terbitan pabrikan. Insinyur Velyrix bekerja sesuai prosedur OEM dengan penanganan terkendali ESD, spesifikasi torsi, dan catatan tingkat nomor seri yang terdokumentasi, sehingga garansi pabrikan dan hak dukungan tetap utuh.
Apa yang terjadi jika klaster gagal uji terima?
Dalam penugasan harga tetap, Velyrix memperbaiki dan menguji ulang atas biaya kami sampai kriteria yang disepakati terpenuhi. Kegagalan yang berasal dari perangkat keras cacat diajukan ke OEM di bawah garansi, dan kami mengelola proses itu atas nama Anda.
Apakah Anda mendukung sistem berpendingin cair dan berskala rak seperti GB300 NVL72?
Ya. Deployment berpendingin cair mencakup pemasangan manifold dan cold plate, pengisian pendingin dan uji tekanan, commissioning CDU, validasi deteksi kebocoran, dan uji failover pompa, di samping protokol uji terima komputasi dan fabric standar.