الرئيسية/المنصة
التخزين والشبكة والتشغيل المُدارالمنصة التي تُبقي وحدات GPU الغالية مشغولة
المسرّعات هي الجزء السهل. تبني Velyrix طبقات التخزين والنسيج والجدولة والمراقبة التي تحدد ما إذا كان عنقودك يعمل عند 30% أو 55% من الاستخدام — وتشغّلها كلها على مدار الساعة.
أطعِم وحدات GPU، واحفظ نقاط التحقق بلا تعثّر
مهمة بـ 512 وحدة GPU تكتب نقطة تحقق بحجم عدة تيرابايت ستكشف أي ضعف في مسار التخزين. تحدد Velyrix حجم التخزين وفق فترة نقاط التحقق ونمط قراءة مجموعة البيانات لديك، لا وفق رقم سعة في أمر شراء.
| الطبقة | التقنية | الأداء المعتاد | حالة الاستخدام | ابتداءً من (لكل تيرابايت/شهر) |
|---|---|---|---|---|
| تخزين مؤقت | NVMe محلي Gen4/Gen5 | حتى 60 جيجابايت/ث لكل عقدة | مساحة خلط وذاكرة مؤقتة للبيانات وملفات مؤقتة | مشمول |
| نظام ملفات متوازٍ — الأداء | WEKA أو VAST على NVMe | قراءة إجمالية 1–10 تيرابايت/ث | مجموعات التدريب ونقاط الحفظ | $42 |
| نظام ملفات متوازٍ — السعة | طبقة هجينة NVMe + أقراص | 200–800 جيجابايت/ث | الحقب الباردة وأرشيف مجموعات البيانات | $22 |
| كتلي | NVMe-oF مكرر | حتى مليون IOPS لكل وحدة تخزين | قواعد بيانات ومخازن متجهات وأقراص إقلاع | $101 |
| كائني | متوافق مع S3، ترميز محو | عدة جيجابايت/ث، متانة بأحد عشر تسعة | بحيرة بيانات وسجل نماذج ومخرجات | $20 |
| أرشيف | كائن بارد / بوابة أشرطة | الاسترجاع خلال دقائق إلى ساعات | الاحتفاظ والامتثال والنصوص الخام | $6 |
أسعار قائمة استرشادية، غير شاملة الضرائب. وتُحدَّد أحجام أنظمة الملفات المتوازية وتُسعَّر لكل عنقود؛ وتعتمد أرقام الأداء على التهيئة المنشورة.
ثلاثة مستويات لا تتشارك يومًا سيئًا
- مستوى الحوسبة: NVIDIA Quantum-X800 XDR 800G أو Quantum-2 NDR 400G InfiniBand، مُحسَّن حسب المسارات، بلا اختناق 1:1، مع تفعيل SHARP
- بديل Ethernet: NVIDIA Spectrum-X مع RoCEv2 وتوجيه تكيّفي وضبط ازدحام وتفريغ عبر DPU BlueField-3
- مستوى التخزين: 200/400G مخصصة كي لا تتصادم كتابة نقاط التحقق مع all-reduce للتدرجات
- مستوى الإدارة: شبكة BMC خارج النطاق معزولة مع وصول عبر مضيف وسيط وتدقيق كامل
- خارجي: نقل 100G بوصلة مزدوجة، وتخفيف DDoS، وBYOIP، وجلسات BGP عند الطلب
- الربط: وصلات خاصة إلى AWS وAzure وGoogle Cloud وOracle، إضافة إلى ألياف مظلمة بين حرم Velyrix
طوبولوجيا مرجعية لمجموعة بـ 512 وحدة GPU. وتضيف الأنسجة الأكبر طبقة ثالثة؛ ويبقى مبدأ التحسين حسب المسارات كما هو.
مركز عمليات يفهم NCCL، لا مجرد ping
مركز عمليات 24×7
مناوبة على مدار الساعة مع استجابة P1 تعاقدية خلال 15 دقيقة، ومهندسون ملمّون بوحدات GPU، وتصعيد مباشر إلى الفريق الذي بنى عنقودك — لا نص جاهز لخط أول.
المراقبة
DCGM، وnode exporter، وعدّادات النسيج، وقياسات المهام في Prometheus وGrafana، مع إسناد لكل مهمة وتصدير إلى نظام SIEM لديك.
صحة استباقية
فحوص صحة تلقائية للعقد بين المهام، وتحليل اتجاهات XID وECC، وسحب واستبدال وقائي قبل ضياع أي عملية تشغيل.
إدارة دورة الحياة
تُتحقَّق ترقيات البرامج الثابتة والتعريفات والمحركات أولًا في مجموعة اختبار، ثم تُطرح في الإنتاج ضمن نوافذ متفق عليها.
تشغيل المجدول
ضبط Slurm وKubernetes، وسياسة الطوابير والحصص، وتهيئة الحصص العادلة، وتقارير الاستخدام لكل فريق أو مركز تكلفة.
تقارير مستوى الخدمة
تقارير شهرية للتوافر والحوادث والسعة مقاسة مقابل العقد، مع أرصدة تُطبَّق تلقائيًا عند عدم بلوغ الأهداف.
عزل يمكنك إثباته
- الإشغال: مضيفات فيزيائية أحادية المستأجر، وVLAN/VRF مخصصة، وأقسام InfiniBand مخصصة
- الهوية: دخول موحد عبر SAML/OIDC، وتزويد SCIM، ومصادقة ثنائية بالأجهزة، ومفاتيح واجهة محدودة النطاق، ووصول قائم على الأدوار
- المفاتيح: مفاتيح تشفير يديرها العميل بدعم وحدات HSM؛ ولا تستطيع Velyrix قراءة وحدات تخزين المستأجرين
- البيانات الساكنة: AES-256 على طبقات الكتل والكائنات والتخزين المتوازي
- البيانات المنقولة: TLS 1.3 خارجيًا، مع MACsec وIPsec اختياريين على الوصلات الخاصة
- سلامة البرامج الثابتة: إقلاع آمن، وخطوط أساس موقَّعة للبرامج الثابتة، وتوثيق عند كل تجهيز
- إيقاف التشغيل: تطهير وفق NIST SP 800-88 مع شهادة تطهير، أو إتلاف بحضور العميل
- التسجيل: سجل تدقيق غير قابل للتغيير لكل حدث في لوحة التحكم والواجهة البرمجية والدخول المادي
provider "velyrix" { region = "us-east-1" } resource "velyrix_cluster" "training" { name = "acme-pretrain" node_type = "hgx-h200-8g" node_count = 64 fabric = "infiniband-ndr" scheduler = "slurm" storage { parallel_fs_tb = 800 object_tb = 2000 } # 512 GPUs, one apply, validated on delivery }
وحدات المعالجة ملكك. ونحن نشغّلها.
اشترِ خوادم NVIDIA من أي شركة مصنّعة أو موزّع معتمد، وأرسلها مباشرة إلى مركز بيانات Velyrix، ونتولى نحن الباقي: التركيب والشبكة والتبريد والمراقبة والدعم المستمر. أو استأجر خوادمنا. في الحالتين تحصل على خطة خلال يوم عمل واحد.
الأسئلة الشائعة
ما التخزين الذي ينبغي استخدامه لعمليات التدريب الكبيرة؟
نظام ملفات متوازٍ عالي الأداء - WEKA أو VAST على NVMe - لمجموعات البيانات النشطة ونقاط التحقق، مدعومًا بتخزين كائنات متوافق مع S3 لبحيرة البيانات الأوسع، مع NVMe محلي مؤقت في كل عقدة لمساحة الخلط. وتحدد Velyrix حجم طبقة الأداء من حجم نقطة التحقق وفترتها لديك كي لا يهيمن حفظ نقاط التحقق على زمن الخطوة.
هل تدعمون Ethernet بدل InfiniBand؟
نعم. يتوفر NVIDIA Spectrum-X مع RoCEv2 وتوجيه تكيّفي وضبط ازدحام حيثما يُفضَّل نموذج تشغيل قائم على Ethernet وحده. ويبقى InfiniBand هو الخيار الافتراضي لأكبر أنسجة التدريب بفضل تقليص SHARP داخل الشبكة ونضج إدارة الشبكات الفرعية.
هل يمكننا ربط عنقود Velyrix ببيئتنا السحابية الحالية؟
نعم، عبر ربط خاص مع AWS وAzure وGoogle Cloud وOracle Cloud، ووصلات محمية بـ IPsec أو MACsec إلى مراكز بياناتك، ووصلات متقاطعة في غرف الالتقاء المحايدة لدينا.
من يشغّل العنقود يوميًا؟
يمكنك تشغيله بنفسك بصلاحية جذر ووصول كامل إلى BMC، أو تسليم التشغيل إلى Velyrix ضمن خدمة مُدارة تشمل المراقبة والاستجابة للحوادث ودورة حياة البرامج الثابتة والتعريفات وسياسة المجدول وتقارير مستوى الخدمة.