Início/Plataforma
Armazenamento, rede e operação gerenciadaA plataforma que mantém GPUs caras ocupadas
Os aceleradores são a parte fácil. A Velyrix constrói as camadas de armazenamento, fabric, escalonamento e observabilidade que decidem se o seu cluster roda a 30% ou a 55% de utilização — e opera tudo isso 24×7.
Alimente as GPUs, faça checkpoint sem travar
Um job de 512 GPUs escrevendo um checkpoint de vários terabytes vai expor qualquer fraqueza no caminho de armazenamento. A Velyrix dimensiona o armazenamento conforme seu intervalo de checkpoint e padrão de leitura de dados, e não conforme um número de capacidade em uma ordem de compra.
| Camada | Tecnologia | Desempenho típico | Caso de uso | A partir de (por TB/mês) |
|---|---|---|---|---|
| Scratch | NVMe local Gen4/Gen5 | Até 60 GB/s por nó | Espaço de shuffle, cache do dataloader, temporários | Incluído |
| FS paralelo — desempenho | WEKA ou VAST em NVMe | 1–10 TB/s de leitura agregada | Datasets de treinamento, checkpoints | $42 |
| FS paralelo — capacidade | Camada híbrida NVMe + HDD | 200–800 GB/s | Épocas frias, arquivo de datasets | $22 |
| Bloco | NVMe-oF replicado | Até 1M IOPS por volume | Bancos de dados, vetores, volumes de boot | $101 |
| Objeto | Compatível com S3, erasure coding | Vários GB/s, durabilidade de 11 noves | Data lake, registro de modelos, artefatos | $20 |
| Arquivo | Objeto frio / gateway de fita | Recuperação em minutos a horas | Retenção, conformidade, corpora bruta | $6 |
Preços de tabela indicativos, sem impostos. Sistemas de arquivos paralelos são dimensionados e orçados por cluster; os números de desempenho dependem da configuração implantada.
Três planos que nunca compartilham um dia ruim
- Plano de computação: InfiniBand NVIDIA Quantum-X800 XDR 800G ou Quantum-2 NDR 400G, otimizado por rail, 1:1 sem bloqueio, com SHARP habilitado
- Alternativa Ethernet: NVIDIA Spectrum-X com RoCEv2, roteamento adaptativo, controle de congestionamento e offload em DPU BlueField-3
- Plano de armazenamento: 200/400G dedicados para que escritas de checkpoint nunca colidam com o all-reduce de gradientes
- Plano de gerenciamento: rede BMC fora de banda isolada, com acesso por jump host e auditoria completa
- Externo: trânsito de 100G com dupla conexão, mitigação de DDoS, BYOIP e sessões BGP sob consulta
- Interconexão: links privados para AWS, Azure, Google Cloud e Oracle, além de fibra apagada entre campi Velyrix
Topologia de referência para um pod de 512 GPUs. Fabrics maiores acrescentam um terceiro nível; o princípio de otimização por rail não muda.
Um NOC que entende NCCL, e não apenas ping
NOC 24×7
Uma escala de plantão 24×7 com resposta P1 contratual em 15 minutos, engenheiros que entendem de GPU e escalonamento direto para a equipe que construiu seu cluster — e não um roteiro de primeiro nível.
Observabilidade
DCGM, node exporter, contadores de fabric e telemetria de jobs em Prometheus e Grafana, com atribuição por job e exportação para seu SIEM.
Saúde proativa
Verificações automáticas de saúde dos nós entre jobs, análise de tendência de XID e ECC, e drenagem e substituição preventivas antes que uma execução se perca.
Gestão de ciclo de vida
Atualizações de firmware, drivers e motores validadas primeiro em um pod de staging e depois aplicadas em produção em janelas acordadas.
Operação do escalonador
Ajuste de Slurm e Kubernetes, política de filas e cotas, configuração de fair-share e relatórios de utilização por equipe ou centro de custo.
Relatórios de SLA
Relatórios mensais de disponibilidade, incidentes e capacidade medidos frente ao contrato, com créditos aplicados automaticamente quando as metas não são atingidas.
Isolamento que você pode comprovar
- Tenancy: hosts físicos de inquilino único, VLAN/VRF dedicada e partições InfiniBand dedicadas
- Identidade: single sign-on SAML/OIDC, provisionamento SCIM, MFA por hardware, chaves de API com escopo e acesso baseado em papéis
- Chaves: chaves de criptografia gerenciadas pelo cliente com respaldo em HSM; a Velyrix não consegue ler volumes do inquilino
- Dados em repouso: AES-256 nas camadas de bloco, objeto e armazenamento paralelo
- Dados em trânsito: TLS 1.3 externamente, MACsec e IPsec opcionais em links privados
- Integridade de firmware: boot seguro, linhas de base de firmware assinadas e atestação a cada provisionamento
- Descomissionamento: purga NIST SP 800-88 com certificado de sanitização, ou destruição testemunhada pelo cliente
- Registro: trilha de auditoria imutável de cada evento de console, API e acesso físico
provider "velyrix" { region = "us-east-1" } resource "velyrix_cluster" "training" { name = "acme-pretrain" node_type = "hgx-h200-8g" node_count = 64 fabric = "infiniband-ndr" scheduler = "slurm" storage { parallel_fs_tb = 800 object_tb = 2000 } # 512 GPUs, one apply, validated on delivery }
As GPUs são suas. Nós operamos.
Compre seus servidores NVIDIA do OEM ou distribuidor que preferir, envie-os para um data center da Velyrix e cuidamos do resto: implantação, rede, refrigeração, monitoramento e suporte. Ou alugue os nossos. De qualquer forma, você recebe um plano em um dia útil.
Perguntas frequentes
Que armazenamento devemos usar para grandes treinamentos?
Um sistema de arquivos paralelo de desempenho - WEKA ou VAST em NVMe - para datasets ativos e checkpoints, apoiado por armazenamento de objetos compatível com S3 para o data lake mais amplo, com NVMe local de scratch em cada nó para espaço de shuffle. A Velyrix dimensiona a camada de desempenho a partir do tamanho e do intervalo do seu checkpoint, para que o checkpointing nunca domine o tempo de passo.
Vocês suportam Ethernet em vez de InfiniBand?
Sim. NVIDIA Spectrum-X com RoCEv2, roteamento adaptativo e controle de congestionamento está disponível quando se prefere um modelo operacional apenas Ethernet. O InfiniBand continua sendo o padrão para os maiores fabrics de treinamento, por causa da redução SHARP na rede e do gerenciamento de sub-rede maduro.
Podemos conectar um cluster Velyrix ao nosso ambiente de nuvem atual?
Sim, por meio de interconexões privadas com AWS, Azure, Google Cloud e Oracle Cloud, links protegidos por IPsec ou MACsec até seus próprios data centers e cross-connects em nossas salas meet-me neutras.
Quem opera o cluster no dia a dia?
Você pode operá-lo por conta própria, com acesso root e BMC completos, ou entregar a operação à Velyrix sob um serviço gerenciado que cobre monitoramento, resposta a incidentes, ciclo de vida de firmware e drivers, política do escalonador e relatórios de SLA.