Accueil/Plateforme
Stockage, réseau et exploitation infogéréeLa plateforme qui garde les GPU coûteux occupés
Les accélérateurs sont la partie facile. Velyrix construit les couches de stockage, de fabric, d'ordonnancement et d'observabilité qui déterminent si votre cluster tourne à 30% d'utilisation ou à 55% — et les exploite toutes 24×7.
Alimentez les GPU, faites vos checkpoints sans à-coups
Un job de 512 GPU écrivant un checkpoint de plusieurs téraoctets révélera la moindre faiblesse du chemin de stockage. Velyrix dimensionne le stockage selon votre intervalle de checkpoint et votre profil de lecture, pas selon un chiffre de capacité sur un bon de commande.
| Niveau | Technologie | Performance type | Cas d'usage | À partir de (par To/mois) |
|---|---|---|---|---|
| Scratch | NVMe local Gen4/Gen5 | Jusqu'à 60 Go/s par nœud | Espace de shuffle, cache dataloader, temporaires | Inclus |
| FS parallèle — performance | WEKA ou VAST sur NVMe | 1–10 To/s en lecture agrégée | Jeux d'entraînement, checkpoints | $42 |
| FS parallèle — capacité | Niveau hybride NVMe + HDD | 200–800 Go/s | Époques froides, archives de datasets | $22 |
| Bloc | NVMe-oF répliqué | Jusqu'à 1M IOPS par volume | Bases de données, index vectoriels, volumes de boot | $101 |
| Objet | Compatible S3, codage d'effacement | Plusieurs Go/s, durabilité 11 neufs | Data lake, registre de modèles, artefacts | $20 |
| Archive | Objet froid / passerelle bande | Récupération en minutes à heures | Rétention, conformité, corpus bruts | $6 |
Tarifs de liste indicatifs, hors taxes. Les systèmes de fichiers parallèles sont dimensionnés et chiffrés par cluster ; les chiffres de performance dépendent de la configuration déployée.
Trois plans, jamais la même mauvaise journée
- Plan de calcul : InfiniBand NVIDIA Quantum-X800 XDR 800G ou Quantum-2 NDR 400G, optimisé par rail, non bloquant 1:1, SHARP activé
- Alternative Ethernet : NVIDIA Spectrum-X avec RoCEv2, routage adaptatif, contrôle de congestion et déchargement DPU BlueField-3
- Plan de stockage : 200/400G dédiés afin que les écritures de checkpoint n'entrent jamais en collision avec l'all-reduce des gradients
- Plan de gestion : réseau BMC hors bande isolé, avec accès par rebond et audit complet
- Externe : transit 100G en double raccordement, mitigation DDoS, BYOIP et sessions BGP sur demande
- Interconnexion : liens privés vers AWS, Azure, Google Cloud et Oracle, plus fibre noire entre campus Velyrix
Topologie de référence pour un pod de 512 GPU. Les fabrics plus grands ajoutent un troisième niveau ; le principe d'optimisation par rail ne change pas.
Un NOC qui comprend NCCL, pas seulement le ping
NOC 24×7
Une astreinte 24×7 avec réponse P1 contractuelle en 15 minutes, des ingénieurs qui maîtrisent les GPU et une escalade directe vers l'équipe qui a construit votre cluster — pas un script de premier niveau.
Observabilité
DCGM, node exporter, compteurs de fabric et télémétrie de jobs dans Prometheus et Grafana, avec attribution par job et export vers votre propre SIEM.
Santé proactive
Contrôles de santé automatisés entre les jobs, analyse de tendance XID et ECC, et drainage et remplacement préventifs avant qu'une campagne soit perdue.
Gestion du cycle de vie
Mises à jour de firmware, de pilotes et de moteurs validées d'abord sur un pod de préproduction, puis déployées en production dans des fenêtres convenues.
Exploitation de l'ordonnanceur
Réglage de Slurm et Kubernetes, politique de files et de quotas, configuration fair-share et reporting d'utilisation par équipe ou centre de coût.
Reporting SLA
Rapports mensuels de disponibilité, d'incidents et de capacité mesurés par rapport au contrat, avec avoirs appliqués automatiquement lorsque les objectifs ne sont pas atteints.
Un isolement que vous pouvez prouver
- Location : hôtes physiques mono-locataires, VLAN/VRF dédiés et partitions InfiniBand dédiées
- Identité : authentification unique SAML/OIDC, provisionnement SCIM, MFA matérielle, clés d'API à portée limitée et accès basé sur les rôles
- Clés : clés de chiffrement gérées par le client avec adossement HSM ; Velyrix ne peut pas lire les volumes locataires
- Données au repos : AES-256 sur les niveaux bloc, objet et stockage parallèle
- Données en transit : TLS 1.3 à l'extérieur, MACsec et IPsec en option sur les liens privés
- Intégrité du firmware : démarrage sécurisé, lignes de base firmware signées et attestation à chaque provisionnement
- Mise hors service : purge NIST SP 800-88 avec certificat d'effacement, ou destruction en présence du client
- Journalisation : piste d'audit inaltérable de chaque accès console, API et physique
provider "velyrix" { region = "us-east-1" } resource "velyrix_cluster" "training" { name = "acme-pretrain" node_type = "hgx-h200-8g" node_count = 64 fabric = "infiniband-ndr" scheduler = "slurm" storage { parallel_fs_tb = 800 object_tb = 2000 } # 512 GPUs, one apply, validated on delivery }
Les GPU sont à vous. Nous les exploitons.
Achetez vos serveurs NVIDIA auprès de l'OEM ou du distributeur de votre choix, expédiez-les vers un centre de données Velyrix et nous nous occupons du reste : déploiement, réseau, refroidissement, supervision et support. Ou louez les nôtres. Dans les deux cas, vous recevez un plan sous un jour ouvré.
Questions fréquentes
Quel stockage utiliser pour de grands entraînements ?
Un système de fichiers parallèle performant — WEKA ou VAST sur NVMe — pour les jeux de données actifs et les checkpoints, adossé à du stockage objet compatible S3 pour le data lake, avec du NVMe local sur chaque nœud comme espace de shuffle. Velyrix dimensionne le niveau performant à partir de la taille et de l'intervalle de vos checkpoints, afin que ceux-ci ne dominent jamais le temps par étape.
Prenez-vous en charge l'Ethernet plutôt que l'InfiniBand ?
Oui. NVIDIA Spectrum-X avec RoCEv2, routage adaptatif et contrôle de congestion est disponible lorsqu'un modèle d'exploitation tout-Ethernet est préféré. L'InfiniBand reste le choix par défaut pour les plus grands fabrics d'entraînement, en raison de la réduction SHARP dans le réseau et de la maturité de la gestion de sous-réseau.
Pouvons-nous relier un cluster Velyrix à notre environnement cloud existant ?
Oui, via des interconnexions privées vers AWS, Azure, Google Cloud et Oracle Cloud, des liens protégés par IPsec ou MACsec vers vos propres centres de données, et des cross-connects dans nos salles de brassage neutres.
Qui exploite le cluster au quotidien ?
Vous pouvez l'exploiter vous-même avec un accès root et BMC complet, ou confier l'exploitation à Velyrix dans le cadre d'un service infogéré couvrant la supervision, la réponse aux incidents, le cycle de vie firmware et pilotes, la politique d'ordonnancement et le reporting SLA.