होम/प्लेटफ़ॉर्म

स्टोरेज, नेटवर्क और प्रबंधित संचालन

वह प्लेटफ़ॉर्म जो महँगे GPU को व्यस्त रखता है

एक्सेलेरेटर आसान हिस्सा हैं। Velyrix वे स्टोरेज, फैब्रिक, शेड्यूलिंग और ऑब्ज़र्वेबिलिटी परतें बनाता है जो तय करती हैं कि आपका क्लस्टर 30% उपयोग पर चलता है या 55% पर — और यह सब 24×7 संचालित करता है।

स्टोरेज

GPU को खिलाइए, बिना रुके चेकपॉइंट कीजिए

मल्टी-टेराबाइट चेकपॉइंट लिखने वाली 512-GPU जॉब स्टोरेज पथ की हर कमज़ोरी उजागर कर देगी। Velyrix स्टोरेज का आकार क्रय आदेश पर लिखे क्षमता अंक से नहीं, बल्कि आपके चेकपॉइंट अंतराल और डेटासेट पठन पैटर्न से तय करता है।

स्तरतकनीकसामान्य प्रदर्शनउपयोगसे (प्रति TB/माह)
स्क्रैचलोकल NVMe Gen4/Gen5प्रति नोड 60 GB/s तकशफ़ल स्पेस, डेटालोडर कैश, अस्थायीशामिल
पैरेलल FS — प्रदर्शनNVMe पर WEKA या VAST1–10 TB/s कुल रीडप्रशिक्षण डेटासेट, चेकपॉइंट$42
पैरेलल FS — क्षमताहाइब्रिड NVMe + HDD स्तर200–800 GB/sकोल्ड एपॉक, डेटासेट आर्काइव$22
ब्लॉकNVMe-oF रेप्लिकेटेडप्रति वॉल्यूम 10 लाख IOPS तकडेटाबेस, वेक्टर स्टोर, बूट वॉल्यूम$101
ऑब्जेक्टS3-संगत, इरेज़र कोडेडमल्टी-GB/s, 11 नाइन्स टिकाऊपनडेटा लेक, मॉडल रजिस्ट्री, आर्टिफैक्ट$20
आर्काइवकोल्ड ऑब्जेक्ट / टेप गेटवेमिनटों से घंटों में पुनर्प्राप्तिरिटेंशन, अनुपालन, कच्चा कॉर्पस$6

सांकेतिक सूची मूल्य, कर रहित। पैरेलल फाइल सिस्टम प्रति क्लस्टर आकारित और कोट किए जाते हैं; प्रदर्शन आँकड़े डिप्लॉय किए गए कॉन्फ़िगरेशन पर निर्भर हैं।

नेटवर्किंग

तीन प्लेन, जो कभी एक साथ बुरा दिन नहीं देखते

  • कंप्यूट प्लेन: NVIDIA Quantum-X800 XDR 800G या Quantum-2 NDR 400G InfiniBand, रेल-ऑप्टिमाइज़्ड, 1:1 नॉन-ब्लॉकिंग, SHARP सक्षम
  • Ethernet विकल्प: RoCEv2, अनुकूली रूटिंग, कंजेशन नियंत्रण और BlueField-3 DPU ऑफ़लोड सहित NVIDIA Spectrum-X
  • स्टोरेज प्लेन: समर्पित 200/400G ताकि चेकपॉइंट लेखन कभी ग्रेडिएंट all-reduce से न टकराए
  • प्रबंधन प्लेन: जंप-होस्ट पहुँच और पूर्ण ऑडिट सहित पृथक आउट-ऑफ-बैंड BMC नेटवर्क
  • बाह्य: ड्यूल-होम्ड 100G ट्रांज़िट, DDoS शमन, BYOIP और अनुरोध पर BGP सत्र
  • इंटरकनेक्ट: AWS, Azure, Google Cloud और Oracle तक निजी लिंक, साथ ही Velyrix कैंपसों के बीच डार्क फ़ाइबर
Spine — Quantum-X800 XDR×8
Leaf — rail 0–7×32
स्टोरेज leaf — Spectrum-X SN5600×4
बॉर्डर / ट्रांज़िट राउटर2N
आउट-ऑफ-बैंड प्रबंधनपृथक
क्लाउड ऑन-रैंप — 4×10Gनिजी
सबनेट मैनेजर — HA जोड़ीसक्रिय/स्टैंडबाय

512-GPU पॉड हेतु संदर्भ टोपोलॉजी। बड़े फैब्रिक में तीसरा स्तर जुड़ता है; रेल-ऑप्टिमाइज़्ड सिद्धांत अपरिवर्तित रहता है।

प्रबंधित संचालन

वह NOC जो NCCL समझता है, केवल ping नहीं

24×7 NOC

अनुबंधित 15-मिनट P1 प्रतिक्रिया, GPU-साक्षर इंजीनियरों और आपका क्लस्टर बनाने वाली टीम तक सीधे एस्केलेशन के साथ 24×7 ऑन-कॉल रोटेशन — कोई पहली-पंक्ति स्क्रिप्ट नहीं।

📊

ऑब्ज़र्वेबिलिटी

Prometheus और Grafana में DCGM, node exporter, फैब्रिक काउंटर और जॉब टेलीमेट्री, प्रति-जॉब आरोपण और आपके SIEM में निर्यात के साथ।

🛡

सक्रिय स्वास्थ्य

जॉब के बीच स्वचालित नोड स्वास्थ्य जाँच, XID व ECC प्रवृत्ति विश्लेषण, और रन खोने से पहले पूर्व-निवारक ड्रेन व प्रतिस्थापन।

🔄

जीवनचक्र प्रबंधन

फर्मवेयर, ड्राइवर और इंजन अपग्रेड पहले स्टेजिंग पॉड में सत्यापित, फिर सहमत विंडो में उत्पादन में लागू।

📦

शेड्यूलर संचालन

Slurm और Kubernetes ट्यूनिंग, कतार व कोटा नीति, फेयर-शेयर कॉन्फ़िगरेशन, और प्रति टीम या लागत केंद्र उपयोग रिपोर्टिंग।

📝

SLA रिपोर्टिंग

अनुबंध के विरुद्ध मापी गई मासिक उपलब्धता, घटना और क्षमता रिपोर्ट, लक्ष्य चूकने पर स्वतः लागू क्रेडिट के साथ।

सुरक्षा संरचना

वह आइसोलेशन जिसे आप प्रमाणित कर सकें

  • टेनेंसी: सिंगल-टेनेंट भौतिक होस्ट, समर्पित VLAN/VRF और समर्पित InfiniBand विभाजन
  • पहचान: SAML/OIDC सिंगल साइन-ऑन, SCIM प्रोविज़निंग, हार्डवेयर MFA, स्कोप्ड API कुंजियाँ और भूमिका-आधारित पहुँच
  • कुंजियाँ: HSM समर्थित ग्राहक-प्रबंधित एन्क्रिप्शन कुंजियाँ; Velyrix टेनेंट वॉल्यूम नहीं पढ़ सकता
  • विश्राम में डेटा: ब्लॉक, ऑब्जेक्ट और पैरेलल स्टोरेज टियर पर AES-256
  • पारगमन में डेटा: बाह्य रूप से TLS 1.3, निजी लिंक पर वैकल्पिक MACsec और IPsec
  • फर्मवेयर अखंडता: हर प्रोविज़न पर सिक्योर बूट, हस्ताक्षरित फर्मवेयर बेसलाइन और अटेस्टेशन
  • डीकमीशन: सैनिटाइज़ेशन प्रमाणपत्र सहित NIST SP 800-88 पर्ज, या ग्राहक-साक्षी विनाश
  • लॉगिंग: हर कंसोल, API और भौतिक पहुँच घटना का अपरिवर्तनीय ऑडिट ट्रेल
main.tf
provider "velyrix" {
  region = "us-east-1"
}

resource "velyrix_cluster" "training" {
  name          = "acme-pretrain"
  node_type     = "hgx-h200-8g"
  node_count    = 64
  fabric        = "infiniband-ndr"
  scheduler     = "slurm"

  storage {
    parallel_fs_tb = 800
    object_tb      = 2000
  }

  # 512 GPUs, one apply, validated on delivery
}
AI इन्फ्रास्ट्रक्चर आर्किटेक्ट से बात करें

GPU आपके। संचालन हमारा।

अपने NVIDIA सर्वर किसी भी अधिकृत OEM या वितरक से खरीदें, उन्हें सीधे Velyrix सुविधा भेजें, और बाकी काम हम संभालते हैं — तैनाती, नेटवर्किंग, कूलिंग, निगरानी और निरंतर सहायता। या हमारे GPU किराए पर लें। दोनों ही स्थितियों में आपको एक कार्यदिवस में योजना मिलती है।

अक्सर पूछे जाने वाले प्रश्न

बड़े प्रशिक्षण रन के लिए हमें कौन-सा स्टोरेज उपयोग करना चाहिए?

सक्रिय डेटासेट और चेकपॉइंट के लिए उच्च-प्रदर्शन पैरेलल फाइल सिस्टम - NVMe पर WEKA या VAST - जिसके पीछे व्यापक डेटा लेक हेतु S3-संगत ऑब्जेक्ट स्टोरेज हो, और शफ़ल स्थान हेतु हर नोड पर स्थानीय NVMe स्क्रैच। Velyrix प्रदर्शन टियर का आकार आपके चेकपॉइंट आकार व अंतराल से तय करता है ताकि चेकपॉइंटिंग कभी स्टेप समय पर हावी न हो।

क्या आप InfiniBand के बजाय Ethernet समर्थित करते हैं?

हाँ। जहाँ एकल Ethernet परिचालन मॉडल पसंद हो, वहाँ RoCEv2, अनुकूली रूटिंग और कंजेशन नियंत्रण सहित NVIDIA Spectrum-X उपलब्ध है। सबसे बड़े प्रशिक्षण फैब्रिक के लिए InfiniBand ही डिफ़ॉल्ट बना रहता है, क्योंकि SHARP इन-नेटवर्क रिडक्शन और परिपक्व सबनेट प्रबंधन है।

क्या हम Velyrix क्लस्टर को अपने मौजूदा क्लाउड परिवेश से जोड़ सकते हैं?

हाँ, AWS, Azure, Google Cloud और Oracle Cloud तक निजी इंटरकनेक्ट, आपके अपने डेटा सेंटरों तक IPsec या MACsec-सुरक्षित लिंक, और हमारे कैरियर-निरपेक्ष मीट-मी रूम में क्रॉस-कनेक्ट के माध्यम से।

रोज़मर्रा में क्लस्टर कौन संचालित करता है?

आप पूर्ण रूट और BMC पहुँच के साथ स्वयं संचालित कर सकते हैं, या मॉनिटरिंग, घटना प्रतिक्रिया, फर्मवेयर व ड्राइवर जीवनचक्र, शेड्यूलर नीति और SLA रिपोर्टिंग समेटे प्रबंधित सेवा के तहत संचालन Velyrix को सौंप सकते हैं।