Inicio/Nube GPU

Nube GPU y supercomputación de IA

Nube GPU NVIDIA, desde un nodo hasta 4.096 GPU

Aprovisiona aceleradores NVIDIA de un solo inquilino por segundos, o reserva un clúster completo conectado por InfiniBand durante toda tu campaña de entrenamiento. El mismo hardware, el mismo fabric, los mismos ingenieros, compres como compres.

Aprovisionamiento
< 90 segundos
Facturación
Por segundo, sin coste de salida
Fabric
400G / 800G sin bloqueo
Clúster máximo
4.096 GPU en un solo fabric
SLA de disponibilidad
99,99% de infraestructura
Catálogo de GPU

Elige tu acelerador

Cada SKU está disponible como instancia bare metal de un solo inquilino o como instancia virtualizada con paso a través de GPU. Las SKU multinodo incluyen InfiniBand optimizado por rail de serie.

GPUArquitecturaMemoria / ancho de bandaInterconexiónIdeal paraDesde (GPU-hora)
GB300 NVL72Blackwell Ultra288 GB HBM3e · 8 TB/sNVLink 5 rack-scale + XDR 800GEntrenamiento de billones de parámetros, inferencia de contexto largo$8.91
B300 SXM (HGX)Blackwell Ultra288 GB HBM3e · 8 TB/sNVLink 5 + XDR 800GPreentrenamiento de frontera, ajuste fino MoE$8.34
B200 SXM (HGX)Blackwell180 GB HBM3e · 8 TB/sNVLink 5 + NDR/XDREntrenamiento a gran escala, inferencia FP4$6.61
H200 SXM (HGX)Hopper141 GB HBM3e · 4.8 TB/sNVLink 4 + NDR 400GEntrenamiento 70B–400B y servicio de alto rendimiento$3.79
H100 SXM (HGX)Hopper80 GB HBM3 · 3.35 TB/sNVLink 4 + NDR 400GEntrenamiento, ajuste fino e inferencia generales$3.10
H100 NVL / PCIeHopper94 / 80 GB · 3.9 TB/sNVLink bridge + 200GDensidad de inferencia, cargas mixtas$2.70
A100 SXM 80GBAmpere80 GB HBM2e · 2.0 TB/sNVLink 3 + HDR 200GEntrenamiento e inferencia por lotes con coste optimizado$1.90
A100 SXM 40GBAmpere40 GB HBM2 · 1.6 TB/sNVLink 3 + HDR 200GEntrenamiento e inferencia por lotes con coste optimizado$1.47
RTX PRO 6000 BlackwellBlackwell96 GB GDDR7 · 1.8 TB/sPCIe Gen5 · 200GInferencia, simulación, gráficos y Omniverse$2.18
L40SAda Lovelace48 GB GDDR6 · 864 GB/sPCIe Gen4 · 100GInferencia, renderizado, vídeo, VDI$1.35
RTX 5090Blackwell32 GB GDDR7 · 1.8 TB/sPCIe Gen5 · 100GInvestigación, difusión, clústeres de desarrollo$0.75

Precios de lista indicativos bajo demanda en USD por GPU-hora, sin impuestos. Los plazos reservados y comprometidos tienen descuento; consulta precios para ver las tablas por plazo.

Modelos de consumo

Compra cómputo como se financia tu proyecto

Elástico

Bajo demanda

Facturación por segundo, sin compromiso. Ideal para experimentación, bancos de evaluación y fine-tuning puntual.

  • 1–8 GPU por instancia
  • Aprovisionamiento instantáneo por API o consola
  • Instantáneas y reanudación
  • Sin cargos de salida
Más popular

Clústeres reservados

Pods dedicados conectados por InfiniBand reservados de 1 a 36 meses, con capacidad nominada y tarifa fija durante el plazo.

  • 16–4.096 GPU, fabric sin bloqueo
  • Slurm o Kubernetes gestionados
  • Hasta un 55% por debajo de bajo demanda
  • Garantía de capacidad en contrato
Empresa

Nube de IA privada

Una sala, un fabric y un almacén físicamente aislados, operados por Velyrix bajo tu nomenclatura, tus políticas y tu régimen de auditoría.

  • Jaula o sala dedicada
  • Claves de cifrado gestionadas por el cliente
  • Opción aislada de la red
  • SLA y control de cambios a medida
Fabric del clúster

Red optimizada por rail que mantiene ocupadas a las GPU

Un clúster de entrenamiento es tan rápido como su all-reduce más lento. Velyrix construye cada pod multinodo sobre un fat-tree sin bloqueo optimizado por rail, con planos de almacenamiento y gestión dedicados.

  • Plano de cómputo: InfiniBand NVIDIA Quantum-2 NDR 400G o Quantum-X800 XDR 800G, suscripción 1:1
  • Opción Ethernet: NVIDIA Spectrum-X con RoCEv2, enrutamiento adaptativo y control de congestión
  • Cómputo en red: agregación SHARP para reducir la latencia de all-reduce en colectivos grandes
  • Plano de almacenamiento: red independiente de 200/400G para que los checkpoints nunca compitan con los gradientes
  • Plano de gestión: red BMC fuera de banda, aislada del tráfico del inquilino
  • Validación: ancho de banda de bus NCCL y latencia de all-reduce reportados antes de la entrega
acceptance-report.txt
# 512x NVIDIA H200 SXM — XDR 800G rail-optimised
nccl-tests/all_reduce_perf -b 8 -e 8G -f 2 -g 8

size        busbw       algbw      status
1.00 GB     372.4 GB/s  198.1 GB/s  PASS
4.00 GB     381.9 GB/s  203.7 GB/s  PASS
8.00 GB     384.6 GB/s  205.1 GB/s  PASS

fabric      : 1:1 non-blocking, 0 link errors / 72h
gpu_burnin  : 72h @ 100% — 0 XID, 0 ECC row remaps
sustained   : 48.9% MFU, Llama-class 70B reference run

Cifras representativas de una prueba de aceptación de Velyrix. Los resultados varían según topología, modelo, tamaño de lote y pila de software; tu clúster se mide y documenta individualmente.

Orquestación y software

Ven con tu pila, no con un proyecto de migración

Slurm gestionado

Slurm preconfigurado con Pyxis/Enroot, contabilidad fair-share, planificación con conocimiento de topología y ganchos de checkpoint-restart para campañas largas de preentrenamiento.

Kubernetes gestionado

Clústeres conformes a CNCF con NVIDIA GPU Operator, Network Operator, perfiles MIG, KubeRay y Kueue para planificación multiinquilino.

API de bare metal

Proveedor de Terraform y API REST para despliegue de imágenes, arranque iPXE, control BMC y particionado de fabric: construye tu propio plano de control encima.

📦

Registro de contenedores

Registro y caché locales por región para NGC, Docker Hub e imágenes privadas, de modo que descargas de 40 GB no bloqueen el arranque de un trabajo de 512 GPU.

📈

Observabilidad

DCGM, Prometheus y Grafana con utilización de GPU por trabajo, consumo, temperaturas, eventos XID y contadores de fabric, exportables a tu propio SIEM.

🔧

Frameworks

Imágenes validadas para PyTorch, JAX, NeMo, Megatron-LM, DeepSpeed, TorchTitan, vLLM, SGLang y TensorRT-LLM, actualizadas mensualmente.

Incluido en cada clúster

Lo que recibes antes de que corra el primer trabajo

Almacenamiento

Sistema de ficheros paralelo de alto rendimiento (WEKA o VAST) dimensionado a tu presupuesto de tokens, más almacenamiento de objetos compatible con S3 para conjuntos de datos y checkpoints. Incluye 10 TB de NVMe local por nodo.

Redes

Fabric de cómputo InfiniBand o Spectrum-X sin bloqueo, doble tránsito de internet de 100G, interconexión privada con AWS, Azure, GCP y Oracle, y opciones de tránsito BGP/IP. Sin cargos de salida en los planes estándar.

Seguridad

Hosts de un solo inquilino, VLAN/VRF y particiones de fabric aisladas, atestación de firmware con arranque seguro, claves gestionadas por el cliente y borrado verificado en la baja (purga NIST SP 800-88).

Soporte

NOC 24×7, arquitecto de soluciones asignado, respuesta P1 en 15 minutos, objetivo de sustitución de hardware en cuatro horas in situ e informes mensuales de SLA frente a la disponibilidad contratada.

Aceptación

Antes de la entrega: burn-in de GPU de 72 horas, validación de memoria y ECC, pruebas de ancho de banda NCCL, barrido de errores de fabric y un informe de aceptación firmado que puedes entregar a tus auditores.

Hable con un arquitecto de infraestructura de IA

Las GPU son suyas. Nosotros las operamos.

Compre sus servidores NVIDIA al OEM o distribuidor que prefiera, envíelos a un centro de datos de Velyrix y nosotros nos ocupamos del resto: despliegue, red, refrigeración, monitorización y soporte. O alquile los nuestros. En cualquier caso, recibirá un plan en un día hábil.

Preguntas frecuentes

¿Cómo se factura la nube GPU de Velyrix?

Las instancias bajo demanda se facturan por segundo, sin plazo mínimo ni cargos por salida de datos en los planes estándar. Los clústeres reservados se facturan mensualmente a una tarifa contratada fija para plazos de uno a treinta y seis meses. Las nubes privadas empresariales se presupuestan como una cuota mensual fija de plataforma más la capacidad.

¿Recibo bare metal o máquinas virtuales?

Ambos están disponibles. El valor por defecto para entrenamiento multinodo es bare metal de un solo inquilino con acceso directo a las GPU, las NIC y los NVMe. Las instancias virtualizadas con paso a través de GPU se ofrecen cuando las instantáneas y la reinstalación rápida importan más que el último porcentaje de rendimiento.

¿Qué red usan los clústeres de entrenamiento multinodo?

InfiniBand sin bloqueo optimizado por rail: NVIDIA Quantum-2 NDR a 400G o Quantum-X800 XDR a 800G por GPU, con reducción SHARP en red. NVIDIA Spectrum-X Ethernet con RoCEv2 está disponible cuando se requiere un modelo operativo únicamente Ethernet.

¿Puedo ejecutar Slurm y Kubernetes en el mismo clúster?

Sí. Velyrix suele particionar un clúster reservado para que una partición Slurm ejecute entrenamientos largos mientras una partición Kubernetes sirve inferencia, con un sistema de ficheros paralelo compartido entre ambas. Los tamaños de partición pueden ajustarse durante el plazo.

¿Hay un compromiso mínimo para clústeres grandes?

Los clústeres de más de 256 GPU se contratan normalmente por un mínimo de tres meses debido al trabajo de construcción y cableado del fabric. Se pueden acomodar ventanas más cortas en salas donde ya hay un pod equivalente construido y libre.