الرئيسية/المنصة

التخزين والشبكة والتشغيل المُدار

المنصة التي تُبقي وحدات GPU الغالية مشغولة

المسرّعات هي الجزء السهل. تبني Velyrix طبقات التخزين والنسيج والجدولة والمراقبة التي تحدد ما إذا كان عنقودك يعمل عند 30% أو 55% من الاستخدام — وتشغّلها كلها على مدار الساعة.

التخزين

أطعِم وحدات GPU، واحفظ نقاط التحقق بلا تعثّر

مهمة بـ 512 وحدة GPU تكتب نقطة تحقق بحجم عدة تيرابايت ستكشف أي ضعف في مسار التخزين. تحدد Velyrix حجم التخزين وفق فترة نقاط التحقق ونمط قراءة مجموعة البيانات لديك، لا وفق رقم سعة في أمر شراء.

الطبقةالتقنيةالأداء المعتادحالة الاستخدامابتداءً من (لكل تيرابايت/شهر)
تخزين مؤقتNVMe محلي Gen4/Gen5حتى 60 جيجابايت/ث لكل عقدةمساحة خلط وذاكرة مؤقتة للبيانات وملفات مؤقتةمشمول
نظام ملفات متوازٍ — الأداءWEKA أو VAST على NVMeقراءة إجمالية 1–10 تيرابايت/ثمجموعات التدريب ونقاط الحفظ$42
نظام ملفات متوازٍ — السعةطبقة هجينة NVMe + أقراص200–800 جيجابايت/ثالحقب الباردة وأرشيف مجموعات البيانات$22
كتليNVMe-oF مكررحتى مليون IOPS لكل وحدة تخزينقواعد بيانات ومخازن متجهات وأقراص إقلاع$101
كائنيمتوافق مع S3، ترميز محوعدة جيجابايت/ث، متانة بأحد عشر تسعةبحيرة بيانات وسجل نماذج ومخرجات$20
أرشيفكائن بارد / بوابة أشرطةالاسترجاع خلال دقائق إلى ساعاتالاحتفاظ والامتثال والنصوص الخام$6

أسعار قائمة استرشادية، غير شاملة الضرائب. وتُحدَّد أحجام أنظمة الملفات المتوازية وتُسعَّر لكل عنقود؛ وتعتمد أرقام الأداء على التهيئة المنشورة.

الشبكات

ثلاثة مستويات لا تتشارك يومًا سيئًا

  • مستوى الحوسبة: ‏NVIDIA Quantum-X800 XDR 800G أو Quantum-2 NDR 400G InfiniBand، مُحسَّن حسب المسارات، بلا اختناق 1:1، مع تفعيل SHARP
  • بديل Ethernet: ‏NVIDIA Spectrum-X مع RoCEv2 وتوجيه تكيّفي وضبط ازدحام وتفريغ عبر DPU BlueField-3
  • مستوى التخزين: ‏200/400G مخصصة كي لا تتصادم كتابة نقاط التحقق مع all-reduce للتدرجات
  • مستوى الإدارة: شبكة BMC خارج النطاق معزولة مع وصول عبر مضيف وسيط وتدقيق كامل
  • خارجي: نقل 100G بوصلة مزدوجة، وتخفيف DDoS، وBYOIP، وجلسات BGP عند الطلب
  • الربط: وصلات خاصة إلى AWS وAzure وGoogle Cloud وOracle، إضافة إلى ألياف مظلمة بين حرم Velyrix
Spine — Quantum-X800 XDR×8
Leaf — rail 0–7×32
مبدّل تخزين — Spectrum-X SN5600×4
موجّهات الحدود / النقل2N
إدارة خارج النطاقمعزولة
منفذ دخول سحابي — 4×10Gخاص
مدير الشبكة الفرعية — زوج عالي التوافرنشط/احتياطي

طوبولوجيا مرجعية لمجموعة بـ 512 وحدة GPU. وتضيف الأنسجة الأكبر طبقة ثالثة؛ ويبقى مبدأ التحسين حسب المسارات كما هو.

التشغيل المُدار

مركز عمليات يفهم NCCL، لا مجرد ping

مركز عمليات 24×7

مناوبة على مدار الساعة مع استجابة P1 تعاقدية خلال 15 دقيقة، ومهندسون ملمّون بوحدات GPU، وتصعيد مباشر إلى الفريق الذي بنى عنقودك — لا نص جاهز لخط أول.

📊

المراقبة

‏DCGM، وnode exporter، وعدّادات النسيج، وقياسات المهام في Prometheus وGrafana، مع إسناد لكل مهمة وتصدير إلى نظام SIEM لديك.

🛡

صحة استباقية

فحوص صحة تلقائية للعقد بين المهام، وتحليل اتجاهات XID وECC، وسحب واستبدال وقائي قبل ضياع أي عملية تشغيل.

🔄

إدارة دورة الحياة

تُتحقَّق ترقيات البرامج الثابتة والتعريفات والمحركات أولًا في مجموعة اختبار، ثم تُطرح في الإنتاج ضمن نوافذ متفق عليها.

📦

تشغيل المجدول

ضبط Slurm وKubernetes، وسياسة الطوابير والحصص، وتهيئة الحصص العادلة، وتقارير الاستخدام لكل فريق أو مركز تكلفة.

📝

تقارير مستوى الخدمة

تقارير شهرية للتوافر والحوادث والسعة مقاسة مقابل العقد، مع أرصدة تُطبَّق تلقائيًا عند عدم بلوغ الأهداف.

بنية الأمن

عزل يمكنك إثباته

  • الإشغال: مضيفات فيزيائية أحادية المستأجر، وVLAN/VRF مخصصة، وأقسام InfiniBand مخصصة
  • الهوية: دخول موحد عبر SAML/OIDC، وتزويد SCIM، ومصادقة ثنائية بالأجهزة، ومفاتيح واجهة محدودة النطاق، ووصول قائم على الأدوار
  • المفاتيح: مفاتيح تشفير يديرها العميل بدعم وحدات HSM؛ ولا تستطيع Velyrix قراءة وحدات تخزين المستأجرين
  • البيانات الساكنة: ‏AES-256 على طبقات الكتل والكائنات والتخزين المتوازي
  • البيانات المنقولة: ‏TLS 1.3 خارجيًا، مع MACsec وIPsec اختياريين على الوصلات الخاصة
  • سلامة البرامج الثابتة: إقلاع آمن، وخطوط أساس موقَّعة للبرامج الثابتة، وتوثيق عند كل تجهيز
  • إيقاف التشغيل: تطهير وفق NIST SP 800-88 مع شهادة تطهير، أو إتلاف بحضور العميل
  • التسجيل: سجل تدقيق غير قابل للتغيير لكل حدث في لوحة التحكم والواجهة البرمجية والدخول المادي
main.tf
provider "velyrix" {
  region = "us-east-1"
}

resource "velyrix_cluster" "training" {
  name          = "acme-pretrain"
  node_type     = "hgx-h200-8g"
  node_count    = 64
  fabric        = "infiniband-ndr"
  scheduler     = "slurm"

  storage {
    parallel_fs_tb = 800
    object_tb      = 2000
  }

  # 512 GPUs, one apply, validated on delivery
}
تحدث إلى مهندس بنية تحتية للذكاء الاصطناعي

وحدات المعالجة ملكك. ونحن نشغّلها.

اشترِ خوادم NVIDIA من أي شركة مصنّعة أو موزّع معتمد، وأرسلها مباشرة إلى مركز بيانات Velyrix، ونتولى نحن الباقي: التركيب والشبكة والتبريد والمراقبة والدعم المستمر. أو استأجر خوادمنا. في الحالتين تحصل على خطة خلال يوم عمل واحد.

الأسئلة الشائعة

ما التخزين الذي ينبغي استخدامه لعمليات التدريب الكبيرة؟

نظام ملفات متوازٍ عالي الأداء - WEKA أو VAST على NVMe - لمجموعات البيانات النشطة ونقاط التحقق، مدعومًا بتخزين كائنات متوافق مع S3 لبحيرة البيانات الأوسع، مع NVMe محلي مؤقت في كل عقدة لمساحة الخلط. وتحدد Velyrix حجم طبقة الأداء من حجم نقطة التحقق وفترتها لديك كي لا يهيمن حفظ نقاط التحقق على زمن الخطوة.

هل تدعمون Ethernet بدل InfiniBand؟

نعم. يتوفر NVIDIA Spectrum-X مع RoCEv2 وتوجيه تكيّفي وضبط ازدحام حيثما يُفضَّل نموذج تشغيل قائم على Ethernet وحده. ويبقى InfiniBand هو الخيار الافتراضي لأكبر أنسجة التدريب بفضل تقليص SHARP داخل الشبكة ونضج إدارة الشبكات الفرعية.

هل يمكننا ربط عنقود Velyrix ببيئتنا السحابية الحالية؟

نعم، عبر ربط خاص مع AWS وAzure وGoogle Cloud وOracle Cloud، ووصلات محمية بـ IPsec أو MACsec إلى مراكز بياناتك، ووصلات متقاطعة في غرف الالتقاء المحايدة لدينا.

من يشغّل العنقود يوميًا؟

يمكنك تشغيله بنفسك بصلاحية جذر ووصول كامل إلى BMC، أو تسليم التشغيل إلى Velyrix ضمن خدمة مُدارة تشمل المراقبة والاستجابة للحوادث ودورة حياة البرامج الثابتة والتعريفات وسياسة المجدول وتقارير مستوى الخدمة.