Accueil/Cloud GPU
Cloud GPU et supercalcul IACloud GPU NVIDIA, d'un nœud à 4 096 GPU
Provisionnez des accélérateurs NVIDIA mono-locataires à la seconde, ou réservez un cluster entier connecté en InfiniBand pour toute la durée de votre campagne d'entraînement. Même matériel, même fabric, mêmes ingénieurs, quel que soit votre mode d'achat.
Choisissez votre accélérateur
Chaque SKU est disponible en instance bare metal mono-locataire ou en instance virtualisée avec passthrough GPU. Les SKU multinœuds incluent l'InfiniBand optimisé par rail en standard.
| GPU | Architecture | Mémoire / bande passante | Interconnexion | Idéal pour | À partir de (GPU-heure) |
|---|---|---|---|---|---|
| GB300 NVL72 | Blackwell Ultra | 288 GB HBM3e · 8 TB/s | NVLink 5 rack-scale + XDR 800G | Entraînement à mille milliards de paramètres, inférence à contexte long | $8.91 |
| B300 SXM (HGX) | Blackwell Ultra | 288 GB HBM3e · 8 TB/s | NVLink 5 + XDR 800G | Pré-entraînement de frontière, fine-tuning MoE | $8.34 |
| B200 SXM (HGX) | Blackwell | 180 GB HBM3e · 8 TB/s | NVLink 5 + NDR/XDR | Entraînement à grande échelle, inférence FP4 | $6.61 |
| H200 SXM (HGX) | Hopper | 141 GB HBM3e · 4.8 TB/s | NVLink 4 + NDR 400G | Entraînement 70B–400B et service à haut débit | $3.79 |
| H100 SXM (HGX) | Hopper | 80 GB HBM3 · 3.35 TB/s | NVLink 4 + NDR 400G | Entraînement, fine-tuning et inférence courants | $3.10 |
| H100 NVL / PCIe | Hopper | 94 / 80 GB · 3.9 TB/s | NVLink bridge + 200G | Densité d'inférence, charges mixtes | $2.70 |
| A100 SXM 80GB | Ampere | 80 GB HBM2e · 2.0 TB/s | NVLink 3 + HDR 200G | Entraînement et inférence par lots à coût optimisé | $1.90 |
| A100 SXM 40GB | Ampere | 40 GB HBM2 · 1.6 TB/s | NVLink 3 + HDR 200G | Entraînement et inférence par lots à coût optimisé | $1.47 |
| RTX PRO 6000 Blackwell | Blackwell | 96 GB GDDR7 · 1.8 TB/s | PCIe Gen5 · 200G | Inférence, simulation, graphismes et Omniverse | $2.18 |
| L40S | Ada Lovelace | 48 GB GDDR6 · 864 GB/s | PCIe Gen4 · 100G | Inférence, rendu, vidéo, VDI | $1.35 |
| RTX 5090 | Blackwell | 32 GB GDDR7 · 1.8 TB/s | PCIe Gen5 · 100G | Recherche, diffusion, clusters de développement | $0.75 |
Tarifs de liste indicatifs à la demande en USD par GPU-heure, hors taxes. Les durées réservées et engagées sont remisées ; voir tarifs pour les tableaux par durée.
Achetez du calcul comme votre projet est financé
À la demande
Facturation à la seconde, sans engagement. Idéal pour l'expérimentation, les bancs d'évaluation et le fine-tuning ponctuel.
- 1 à 8 GPU par instance
- Provisionnement instantané par API ou console
- Instantanés et reprise
- Aucun frais de sortie
Clusters réservés
Pods dédiés connectés en InfiniBand réservés de 1 à 36 mois, avec capacité nominative et tarif fixe sur la durée.
- 16 à 4 096 GPU, fabric non bloquant
- Slurm ou Kubernetes infogérés
- Jusqu'à 55% sous le tarif à la demande
- Garantie de capacité au contrat
Cloud IA privé
Une salle, un fabric et un stockage physiquement isolés, exploités par Velyrix selon votre nomenclature, vos politiques et votre régime d'audit.
- Cage ou salle dédiée
- Clés de chiffrement gérées par le client
- Option isolée du réseau
- SLA et gestion du changement sur mesure
Un réseau optimisé par rail qui garde les GPU occupés
Un cluster d'entraînement ne va pas plus vite que son all-reduce le plus lent. Velyrix construit chaque pod multinœud sur un fat-tree non bloquant optimisé par rail, avec des plans de stockage et de gestion dédiés.
- Plan de calcul : InfiniBand NVIDIA Quantum-2 NDR 400G ou Quantum-X800 XDR 800G, souscription 1:1
- Option Ethernet : NVIDIA Spectrum-X avec RoCEv2, routage adaptatif et contrôle de congestion
- Calcul dans le réseau : agrégation SHARP pour réduire la latence d'all-reduce sur les grands collectifs
- Plan de stockage : réseau 200/400G distinct afin que les checkpoints n'entrent jamais en concurrence avec les gradients
- Plan de gestion : réseau BMC hors bande, isolé du trafic locataire
- Validation : bande passante de bus NCCL et latence d'all-reduce communiquées avant la livraison
# 512x NVIDIA H200 SXM — XDR 800G rail-optimised nccl-tests/all_reduce_perf -b 8 -e 8G -f 2 -g 8 size busbw algbw status 1.00 GB 372.4 GB/s 198.1 GB/s PASS 4.00 GB 381.9 GB/s 203.7 GB/s PASS 8.00 GB 384.6 GB/s 205.1 GB/s PASS fabric : 1:1 non-blocking, 0 link errors / 72h gpu_burnin : 72h @ 100% — 0 XID, 0 ECC row remaps sustained : 48.9% MFU, Llama-class 70B reference run
Chiffres représentatifs d'une recette Velyrix. Les résultats varient selon la topologie, le modèle, la taille de lot et la pile logicielle ; votre cluster est mesuré et documenté individuellement.
Arrivez avec votre pile, pas avec un projet de migration
Slurm infogéré
Slurm préconfiguré avec Pyxis/Enroot, comptabilité fair-share, ordonnancement conscient de la topologie et points d'accroche checkpoint-restart pour les longues campagnes de pré-entraînement.
Kubernetes infogéré
Clusters conformes CNCF avec NVIDIA GPU Operator, Network Operator, profils MIG, KubeRay et Kueue pour l'ordonnancement multi-locataire.
API bare metal
Provider Terraform et API REST pour le déploiement d'images, le démarrage iPXE, le contrôle BMC et le partitionnement du fabric — construisez votre propre plan de contrôle par-dessus.
Registre de conteneurs
Registre et cache locaux par région pour NGC, Docker Hub et les images privées, afin que des téléchargements de 40 Go ne bloquent pas le lancement d'un job de 512 GPU.
Observabilité
DCGM, Prometheus et Grafana avec utilisation GPU par job, consommation, températures, événements XID et compteurs de fabric — exportables vers votre propre SIEM.
Frameworks
Images validées pour PyTorch, JAX, NeMo, Megatron-LM, DeepSpeed, TorchTitan, vLLM, SGLang et TensorRT-LLM, actualisées chaque mois.
Ce que vous obtenez avant le premier job
Système de fichiers parallèle haute performance (WEKA ou VAST) dimensionné à votre budget de tokens, plus du stockage objet compatible S3 pour les jeux de données et les checkpoints. 10 To de NVMe local inclus par nœud.
Fabric de calcul InfiniBand ou Spectrum-X non bloquant, double transit internet 100G, interconnexion privée vers AWS, Azure, GCP et Oracle, et options de transit BGP/IP. Aucun frais de sortie sur les offres standard.
Hôtes mono-locataires, VLAN/VRF et partitions de fabric isolés, attestation de firmware avec démarrage sécurisé, clés gérées par le client et effacement vérifié à la mise hors service (purge NIST SP 800-88).
NOC 24×7, architecte solutions attitré, réponse P1 en 15 minutes, objectif de remplacement matériel en quatre heures sur site et rapports SLA mensuels par rapport à la disponibilité contractuelle.
Avant la livraison : burn-in GPU de 72 heures, validation mémoire et ECC, tests de bande passante NCCL, balayage d'erreurs du fabric et un rapport de recette signé que vous pouvez remettre à vos auditeurs.
Les GPU sont à vous. Nous les exploitons.
Achetez vos serveurs NVIDIA auprès de l'OEM ou du distributeur de votre choix, expédiez-les vers un centre de données Velyrix et nous nous occupons du reste : déploiement, réseau, refroidissement, supervision et support. Ou louez les nôtres. Dans les deux cas, vous recevez un plan sous un jour ouvré.
Questions fréquentes
Comment le cloud GPU Velyrix est-il facturé ?
Les instances à la demande sont facturées à la seconde, sans durée minimale ni frais de sortie de données sur les offres standard. Les clusters réservés sont facturés mensuellement à un tarif contractuel fixe pour des durées de un à trente-six mois. Les clouds privés d'entreprise font l'objet d'un forfait plateforme mensuel fixe plus la capacité.
Est-ce du bare metal ou des machines virtuelles ?
Les deux sont disponibles. Le défaut pour l'entraînement multinœud est le bare metal mono-locataire avec accès direct aux GPU, aux NIC et aux NVMe. Les instances virtualisées avec passthrough GPU sont proposées lorsque les instantanés et la réinstallation rapide comptent plus que les derniers pourcents de performance.
Quel réseau utilisent les clusters d'entraînement multinœuds ?
De l'InfiniBand non bloquant optimisé par rail — NVIDIA Quantum-2 NDR à 400G ou Quantum-X800 XDR à 800G par GPU — avec réduction SHARP dans le réseau. NVIDIA Spectrum-X Ethernet avec RoCEv2 est disponible lorsqu'un modèle d'exploitation tout-Ethernet est requis.
Puis-je faire tourner Slurm et Kubernetes sur le même cluster ?
Oui. Velyrix partitionne couramment un cluster réservé pour qu'une partition Slurm exécute les longs entraînements tandis qu'une partition Kubernetes sert l'inférence, avec un système de fichiers parallèle partagé entre les deux. La taille des partitions peut être ajustée en cours de contrat.
Existe-t-il un engagement minimum pour les grands clusters ?
Les clusters de plus de 256 GPU sont normalement contractés pour trois mois minimum en raison des travaux de construction et de câblage du fabric. Des fenêtres plus courtes sont possibles dans les salles où un pod équivalent est déjà construit et libre.