Accueil/Plateforme

Stockage, réseau et exploitation infogérée

La plateforme qui garde les GPU coûteux occupés

Les accélérateurs sont la partie facile. Velyrix construit les couches de stockage, de fabric, d'ordonnancement et d'observabilité qui déterminent si votre cluster tourne à 30% d'utilisation ou à 55% — et les exploite toutes 24×7.

Stockage

Alimentez les GPU, faites vos checkpoints sans à-coups

Un job de 512 GPU écrivant un checkpoint de plusieurs téraoctets révélera la moindre faiblesse du chemin de stockage. Velyrix dimensionne le stockage selon votre intervalle de checkpoint et votre profil de lecture, pas selon un chiffre de capacité sur un bon de commande.

NiveauTechnologiePerformance typeCas d'usageÀ partir de (par To/mois)
ScratchNVMe local Gen4/Gen5Jusqu'à 60 Go/s par nœudEspace de shuffle, cache dataloader, temporairesInclus
FS parallèle — performanceWEKA ou VAST sur NVMe1–10 To/s en lecture agrégéeJeux d'entraînement, checkpoints$42
FS parallèle — capacitéNiveau hybride NVMe + HDD200–800 Go/sÉpoques froides, archives de datasets$22
BlocNVMe-oF répliquéJusqu'à 1M IOPS par volumeBases de données, index vectoriels, volumes de boot$101
ObjetCompatible S3, codage d'effacementPlusieurs Go/s, durabilité 11 neufsData lake, registre de modèles, artefacts$20
ArchiveObjet froid / passerelle bandeRécupération en minutes à heuresRétention, conformité, corpus bruts$6

Tarifs de liste indicatifs, hors taxes. Les systèmes de fichiers parallèles sont dimensionnés et chiffrés par cluster ; les chiffres de performance dépendent de la configuration déployée.

Réseau

Trois plans, jamais la même mauvaise journée

  • Plan de calcul : InfiniBand NVIDIA Quantum-X800 XDR 800G ou Quantum-2 NDR 400G, optimisé par rail, non bloquant 1:1, SHARP activé
  • Alternative Ethernet : NVIDIA Spectrum-X avec RoCEv2, routage adaptatif, contrôle de congestion et déchargement DPU BlueField-3
  • Plan de stockage : 200/400G dédiés afin que les écritures de checkpoint n'entrent jamais en collision avec l'all-reduce des gradients
  • Plan de gestion : réseau BMC hors bande isolé, avec accès par rebond et audit complet
  • Externe : transit 100G en double raccordement, mitigation DDoS, BYOIP et sessions BGP sur demande
  • Interconnexion : liens privés vers AWS, Azure, Google Cloud et Oracle, plus fibre noire entre campus Velyrix
Spine — Quantum-X800 XDR×8
Leaf — rail 0–7×32
Leaf de stockage — Spectrum-X SN5600×4
Routeurs de bordure / transit2N
Gestion hors bandeIsolée
Accès cloud — 4×10GPrivé
Gestionnaire de sous-réseau — paire HAActif/passif

Topologie de référence pour un pod de 512 GPU. Les fabrics plus grands ajoutent un troisième niveau ; le principe d'optimisation par rail ne change pas.

Exploitation infogérée

Un NOC qui comprend NCCL, pas seulement le ping

NOC 24×7

Une astreinte 24×7 avec réponse P1 contractuelle en 15 minutes, des ingénieurs qui maîtrisent les GPU et une escalade directe vers l'équipe qui a construit votre cluster — pas un script de premier niveau.

📊

Observabilité

DCGM, node exporter, compteurs de fabric et télémétrie de jobs dans Prometheus et Grafana, avec attribution par job et export vers votre propre SIEM.

🛡

Santé proactive

Contrôles de santé automatisés entre les jobs, analyse de tendance XID et ECC, et drainage et remplacement préventifs avant qu'une campagne soit perdue.

🔄

Gestion du cycle de vie

Mises à jour de firmware, de pilotes et de moteurs validées d'abord sur un pod de préproduction, puis déployées en production dans des fenêtres convenues.

📦

Exploitation de l'ordonnanceur

Réglage de Slurm et Kubernetes, politique de files et de quotas, configuration fair-share et reporting d'utilisation par équipe ou centre de coût.

📝

Reporting SLA

Rapports mensuels de disponibilité, d'incidents et de capacité mesurés par rapport au contrat, avec avoirs appliqués automatiquement lorsque les objectifs ne sont pas atteints.

Architecture de sécurité

Un isolement que vous pouvez prouver

  • Location : hôtes physiques mono-locataires, VLAN/VRF dédiés et partitions InfiniBand dédiées
  • Identité : authentification unique SAML/OIDC, provisionnement SCIM, MFA matérielle, clés d'API à portée limitée et accès basé sur les rôles
  • Clés : clés de chiffrement gérées par le client avec adossement HSM ; Velyrix ne peut pas lire les volumes locataires
  • Données au repos : AES-256 sur les niveaux bloc, objet et stockage parallèle
  • Données en transit : TLS 1.3 à l'extérieur, MACsec et IPsec en option sur les liens privés
  • Intégrité du firmware : démarrage sécurisé, lignes de base firmware signées et attestation à chaque provisionnement
  • Mise hors service : purge NIST SP 800-88 avec certificat d'effacement, ou destruction en présence du client
  • Journalisation : piste d'audit inaltérable de chaque accès console, API et physique
main.tf
provider "velyrix" {
  region = "us-east-1"
}

resource "velyrix_cluster" "training" {
  name          = "acme-pretrain"
  node_type     = "hgx-h200-8g"
  node_count    = 64
  fabric        = "infiniband-ndr"
  scheduler     = "slurm"

  storage {
    parallel_fs_tb = 800
    object_tb      = 2000
  }

  # 512 GPUs, one apply, validated on delivery
}
Échangez avec un architecte d'infrastructure IA

Les GPU sont à vous. Nous les exploitons.

Achetez vos serveurs NVIDIA auprès de l'OEM ou du distributeur de votre choix, expédiez-les vers un centre de données Velyrix et nous nous occupons du reste : déploiement, réseau, refroidissement, supervision et support. Ou louez les nôtres. Dans les deux cas, vous recevez un plan sous un jour ouvré.

Questions fréquentes

Quel stockage utiliser pour de grands entraînements ?

Un système de fichiers parallèle performant — WEKA ou VAST sur NVMe — pour les jeux de données actifs et les checkpoints, adossé à du stockage objet compatible S3 pour le data lake, avec du NVMe local sur chaque nœud comme espace de shuffle. Velyrix dimensionne le niveau performant à partir de la taille et de l'intervalle de vos checkpoints, afin que ceux-ci ne dominent jamais le temps par étape.

Prenez-vous en charge l'Ethernet plutôt que l'InfiniBand ?

Oui. NVIDIA Spectrum-X avec RoCEv2, routage adaptatif et contrôle de congestion est disponible lorsqu'un modèle d'exploitation tout-Ethernet est préféré. L'InfiniBand reste le choix par défaut pour les plus grands fabrics d'entraînement, en raison de la réduction SHARP dans le réseau et de la maturité de la gestion de sous-réseau.

Pouvons-nous relier un cluster Velyrix à notre environnement cloud existant ?

Oui, via des interconnexions privées vers AWS, Azure, Google Cloud et Oracle Cloud, des liens protégés par IPsec ou MACsec vers vos propres centres de données, et des cross-connects dans nos salles de brassage neutres.

Qui exploite le cluster au quotidien ?

Vous pouvez l'exploiter vous-même avec un accès root et BMC complet, ou confier l'exploitation à Velyrix dans le cadre d'un service infogéré couvrant la supervision, la réponse aux incidents, le cycle de vie firmware et pilotes, la politique d'ordonnancement et le reporting SLA.