Início/Nuvem GPU
Nuvem GPU e supercomputação de IANuvem GPU NVIDIA, de um nó a 4.096 GPUs
Provisione aceleradores NVIDIA de inquilino único por segundo, ou reserve um cluster inteiro conectado por InfiniBand pela duração da sua campanha de treinamento. Mesmo hardware, mesmo fabric, mesmos engenheiros — qualquer que seja a forma de compra.
Escolha seu acelerador
Cada SKU está disponível como instância bare metal de inquilino único ou como instância virtualizada com passthrough de GPU. As SKUs multinó incluem InfiniBand otimizado por rail como padrão.
| GPU | Arquitetura | Memória / banda | Interconexão | Ideal para | A partir de (GPU-hora) |
|---|---|---|---|---|---|
| GB300 NVL72 | Blackwell Ultra | 288 GB HBM3e · 8 TB/s | NVLink 5 rack-scale + XDR 800G | Treinamento de trilhões de parâmetros, inferência de contexto longo | $8.91 |
| B300 SXM (HGX) | Blackwell Ultra | 288 GB HBM3e · 8 TB/s | NVLink 5 + XDR 800G | Pré-treinamento de fronteira, fine-tuning MoE | $8.34 |
| B200 SXM (HGX) | Blackwell | 180 GB HBM3e · 8 TB/s | NVLink 5 + NDR/XDR | Treinamento em larga escala, inferência FP4 | $6.61 |
| H200 SXM (HGX) | Hopper | 141 GB HBM3e · 4.8 TB/s | NVLink 4 + NDR 400G | Treinamento 70B–400B e serving de alto throughput | $3.79 |
| H100 SXM (HGX) | Hopper | 80 GB HBM3 · 3.35 TB/s | NVLink 4 + NDR 400G | Treinamento, fine-tuning e inferência gerais | $3.10 |
| H100 NVL / PCIe | Hopper | 94 / 80 GB · 3.9 TB/s | NVLink bridge + 200G | Densidade de inferência, cargas mistas | $2.70 |
| A100 SXM 80GB | Ampere | 80 GB HBM2e · 2.0 TB/s | NVLink 3 + HDR 200G | Treinamento e inferência em lote com custo otimizado | $1.90 |
| A100 SXM 40GB | Ampere | 40 GB HBM2 · 1.6 TB/s | NVLink 3 + HDR 200G | Treinamento e inferência em lote com custo otimizado | $1.47 |
| RTX PRO 6000 Blackwell | Blackwell | 96 GB GDDR7 · 1.8 TB/s | PCIe Gen5 · 200G | Inferência, simulação, gráficos e Omniverse | $2.18 |
| L40S | Ada Lovelace | 48 GB GDDR6 · 864 GB/s | PCIe Gen4 · 100G | Inferência, renderização, vídeo, VDI | $1.35 |
| RTX 5090 | Blackwell | 32 GB GDDR7 · 1.8 TB/s | PCIe Gen5 · 100G | Pesquisa, difusão, clusters de desenvolvimento | $0.75 |
Preços de tabela indicativos sob demanda em USD por GPU-hora, sem impostos. Prazos reservados e comprometidos têm desconto; veja preços para as tabelas por prazo.
Compre computação do jeito que seu projeto é financiado
Sob demanda
Cobrança por segundo, sem compromisso. Ideal para experimentação, bancadas de avaliação e fine-tuning pontual.
- 1 a 8 GPUs por instância
- Provisionamento instantâneo por API ou console
- Snapshot e retomada
- Sem cobrança de saída
Clusters reservados
Pods dedicados conectados por InfiniBand reservados de 1 a 36 meses, com capacidade nominada e tarifa fixa pelo prazo.
- 16 a 4.096 GPUs, fabric sem bloqueio
- Slurm ou Kubernetes gerenciados
- Até 55% abaixo do sob demanda
- Garantia de capacidade em contrato
Nuvem de IA privada
Uma sala, um fabric e um armazenamento fisicamente isolados, operados pela Velyrix sob sua nomenclatura, suas políticas e seu regime de auditoria.
- Jaula ou sala dedicada
- Chaves de criptografia gerenciadas pelo cliente
- Opção isolada da rede
- SLA e controle de mudanças sob medida
Rede otimizada por rail que mantém as GPUs ocupadas
Um cluster de treinamento é tão rápido quanto seu all-reduce mais lento. A Velyrix constrói cada pod multinó sobre uma fat-tree sem bloqueio otimizada por rail, com planos de armazenamento e gerenciamento dedicados.
- Plano de computação: InfiniBand NVIDIA Quantum-2 NDR 400G ou Quantum-X800 XDR 800G, subscrição 1:1
- Opção Ethernet: NVIDIA Spectrum-X com RoCEv2, roteamento adaptativo e controle de congestionamento
- Computação na rede: agregação SHARP para reduzir a latência de all-reduce em coletivos grandes
- Plano de armazenamento: rede separada de 200/400G para que os checkpoints nunca disputem com os gradientes
- Plano de gerenciamento: rede BMC fora de banda, isolada do tráfego do inquilino
- Validação: banda de barramento NCCL e latência de all-reduce informadas antes da entrega
# 512x NVIDIA H200 SXM — XDR 800G rail-optimised nccl-tests/all_reduce_perf -b 8 -e 8G -f 2 -g 8 size busbw algbw status 1.00 GB 372.4 GB/s 198.1 GB/s PASS 4.00 GB 381.9 GB/s 203.7 GB/s PASS 8.00 GB 384.6 GB/s 205.1 GB/s PASS fabric : 1:1 non-blocking, 0 link errors / 72h gpu_burnin : 72h @ 100% — 0 XID, 0 ECC row remaps sustained : 48.9% MFU, Llama-class 70B reference run
Números representativos de um teste de aceitação da Velyrix. Os resultados variam conforme topologia, modelo, tamanho de lote e pilha de software; seu cluster é medido e documentado individualmente.
Chegue com sua pilha, não com um projeto de migração
Slurm gerenciado
Slurm pré-configurado com Pyxis/Enroot, contabilidade fair-share, escalonamento ciente de topologia e ganchos de checkpoint-restart para longas campanhas de pré-treinamento.
Kubernetes gerenciado
Clusters conformes à CNCF com NVIDIA GPU Operator, Network Operator, perfis MIG, KubeRay e Kueue para escalonamento multi-inquilino.
API bare metal
Provider Terraform e API REST para implantação de imagens, boot iPXE, controle de BMC e particionamento de fabric — construa seu próprio plano de controle por cima.
Registro de contêineres
Registro e cache locais por região para NGC, Docker Hub e imagens privadas, para que downloads de 40 GB não travem o início de um job de 512 GPUs.
Observabilidade
DCGM, Prometheus e Grafana com utilização de GPU por job, consumo, temperaturas, eventos XID e contadores de fabric — exportáveis para seu próprio SIEM.
Frameworks
Imagens validadas para PyTorch, JAX, NeMo, Megatron-LM, DeepSpeed, TorchTitan, vLLM, SGLang e TensorRT-LLM, atualizadas mensalmente.
O que você recebe antes do primeiro job
Sistema de arquivos paralelo de alto desempenho (WEKA ou VAST) dimensionado ao seu orçamento de tokens, mais armazenamento de objetos compatível com S3 para datasets e checkpoints. 10 TB de NVMe local incluídos por nó.
Fabric de computação InfiniBand ou Spectrum-X sem bloqueio, trânsito de internet duplo de 100G, interconexão privada com AWS, Azure, GCP e Oracle, e opções de trânsito BGP/IP. Sem cobrança de saída nos planos padrão.
Hosts de inquilino único, VLAN/VRF e partições de fabric isoladas, atestação de firmware com boot seguro, chaves gerenciadas pelo cliente e apagamento verificado no descomissionamento (purga NIST SP 800-88).
NOC 24×7, arquiteto de soluções dedicado, resposta P1 em 15 minutos, meta de substituição de hardware em quatro horas no local e relatórios mensais de SLA frente à disponibilidade contratada.
Antes da entrega: burn-in de GPU de 72 horas, validação de memória e ECC, testes de banda NCCL, varredura de erros do fabric e um relatório de aceitação assinado que você pode entregar aos seus auditores.
As GPUs são suas. Nós operamos.
Compre seus servidores NVIDIA do OEM ou distribuidor que preferir, envie-os para um data center da Velyrix e cuidamos do resto: implantação, rede, refrigeração, monitoramento e suporte. Ou alugue os nossos. De qualquer forma, você recebe um plano em um dia útil.
Perguntas frequentes
Como a nuvem GPU da Velyrix é cobrada?
Instâncias sob demanda são cobradas por segundo, sem prazo mínimo nem cobrança de saída de dados nos planos padrão. Clusters reservados são cobrados mensalmente a uma tarifa contratada fixa para prazos de um a trinta e seis meses. Nuvens privadas corporativas são orçadas como uma taxa mensal fixa de plataforma mais a capacidade.
Recebo bare metal ou máquinas virtuais?
Ambos estão disponíveis. O padrão para treinamento multinó é bare metal de inquilino único com acesso direto às GPUs, NICs e NVMe. Instâncias virtualizadas com passthrough de GPU são oferecidas quando snapshots e reinstalação rápida importam mais do que os últimos pontos percentuais de desempenho.
Qual rede os clusters de treinamento multinó usam?
InfiniBand sem bloqueio otimizado por rail — NVIDIA Quantum-2 NDR a 400G ou Quantum-X800 XDR a 800G por GPU — com redução SHARP na rede. NVIDIA Spectrum-X Ethernet com RoCEv2 está disponível quando se exige um modelo operacional apenas Ethernet.
Posso rodar Slurm e Kubernetes no mesmo cluster?
Sim. A Velyrix costuma particionar um cluster reservado para que uma partição Slurm execute treinamentos longos enquanto uma partição Kubernetes atende inferência, com um sistema de arquivos paralelo compartilhado entre as duas. Os tamanhos das partições podem ser ajustados durante o prazo.
Existe compromisso mínimo para clusters grandes?
Clusters acima de 256 GPUs normalmente são contratados por no mínimo três meses, por causa do trabalho de construção e cabeamento do fabric. Janelas mais curtas podem ser acomodadas em salas onde já exista um pod equivalente construído e ocioso.