Início/Plataforma

Armazenamento, rede e operação gerenciada

A plataforma que mantém GPUs caras ocupadas

Os aceleradores são a parte fácil. A Velyrix constrói as camadas de armazenamento, fabric, escalonamento e observabilidade que decidem se o seu cluster roda a 30% ou a 55% de utilização — e opera tudo isso 24×7.

Armazenamento

Alimente as GPUs, faça checkpoint sem travar

Um job de 512 GPUs escrevendo um checkpoint de vários terabytes vai expor qualquer fraqueza no caminho de armazenamento. A Velyrix dimensiona o armazenamento conforme seu intervalo de checkpoint e padrão de leitura de dados, e não conforme um número de capacidade em uma ordem de compra.

CamadaTecnologiaDesempenho típicoCaso de usoA partir de (por TB/mês)
ScratchNVMe local Gen4/Gen5Até 60 GB/s por nóEspaço de shuffle, cache do dataloader, temporáriosIncluído
FS paralelo — desempenhoWEKA ou VAST em NVMe1–10 TB/s de leitura agregadaDatasets de treinamento, checkpoints$42
FS paralelo — capacidadeCamada híbrida NVMe + HDD200–800 GB/sÉpocas frias, arquivo de datasets$22
BlocoNVMe-oF replicadoAté 1M IOPS por volumeBancos de dados, vetores, volumes de boot$101
ObjetoCompatível com S3, erasure codingVários GB/s, durabilidade de 11 novesData lake, registro de modelos, artefatos$20
ArquivoObjeto frio / gateway de fitaRecuperação em minutos a horasRetenção, conformidade, corpora bruta$6

Preços de tabela indicativos, sem impostos. Sistemas de arquivos paralelos são dimensionados e orçados por cluster; os números de desempenho dependem da configuração implantada.

Rede

Três planos que nunca compartilham um dia ruim

  • Plano de computação: InfiniBand NVIDIA Quantum-X800 XDR 800G ou Quantum-2 NDR 400G, otimizado por rail, 1:1 sem bloqueio, com SHARP habilitado
  • Alternativa Ethernet: NVIDIA Spectrum-X com RoCEv2, roteamento adaptativo, controle de congestionamento e offload em DPU BlueField-3
  • Plano de armazenamento: 200/400G dedicados para que escritas de checkpoint nunca colidam com o all-reduce de gradientes
  • Plano de gerenciamento: rede BMC fora de banda isolada, com acesso por jump host e auditoria completa
  • Externo: trânsito de 100G com dupla conexão, mitigação de DDoS, BYOIP e sessões BGP sob consulta
  • Interconexão: links privados para AWS, Azure, Google Cloud e Oracle, além de fibra apagada entre campi Velyrix
Spine — Quantum-X800 XDR×8
Leaf — rail 0–7×32
Leaf de armazenamento — Spectrum-X SN5600×4
Roteadores de borda / trânsito2N
Gerenciamento fora de bandaIsolado
On-ramp de nuvem — 4×10GPrivado
Gerenciador de sub-rede — par HAAtivo/em espera

Topologia de referência para um pod de 512 GPUs. Fabrics maiores acrescentam um terceiro nível; o princípio de otimização por rail não muda.

Operação gerenciada

Um NOC que entende NCCL, e não apenas ping

NOC 24×7

Uma escala de plantão 24×7 com resposta P1 contratual em 15 minutos, engenheiros que entendem de GPU e escalonamento direto para a equipe que construiu seu cluster — e não um roteiro de primeiro nível.

📊

Observabilidade

DCGM, node exporter, contadores de fabric e telemetria de jobs em Prometheus e Grafana, com atribuição por job e exportação para seu SIEM.

🛡

Saúde proativa

Verificações automáticas de saúde dos nós entre jobs, análise de tendência de XID e ECC, e drenagem e substituição preventivas antes que uma execução se perca.

🔄

Gestão de ciclo de vida

Atualizações de firmware, drivers e motores validadas primeiro em um pod de staging e depois aplicadas em produção em janelas acordadas.

📦

Operação do escalonador

Ajuste de Slurm e Kubernetes, política de filas e cotas, configuração de fair-share e relatórios de utilização por equipe ou centro de custo.

📝

Relatórios de SLA

Relatórios mensais de disponibilidade, incidentes e capacidade medidos frente ao contrato, com créditos aplicados automaticamente quando as metas não são atingidas.

Arquitetura de segurança

Isolamento que você pode comprovar

  • Tenancy: hosts físicos de inquilino único, VLAN/VRF dedicada e partições InfiniBand dedicadas
  • Identidade: single sign-on SAML/OIDC, provisionamento SCIM, MFA por hardware, chaves de API com escopo e acesso baseado em papéis
  • Chaves: chaves de criptografia gerenciadas pelo cliente com respaldo em HSM; a Velyrix não consegue ler volumes do inquilino
  • Dados em repouso: AES-256 nas camadas de bloco, objeto e armazenamento paralelo
  • Dados em trânsito: TLS 1.3 externamente, MACsec e IPsec opcionais em links privados
  • Integridade de firmware: boot seguro, linhas de base de firmware assinadas e atestação a cada provisionamento
  • Descomissionamento: purga NIST SP 800-88 com certificado de sanitização, ou destruição testemunhada pelo cliente
  • Registro: trilha de auditoria imutável de cada evento de console, API e acesso físico
main.tf
provider "velyrix" {
  region = "us-east-1"
}

resource "velyrix_cluster" "training" {
  name          = "acme-pretrain"
  node_type     = "hgx-h200-8g"
  node_count    = 64
  fabric        = "infiniband-ndr"
  scheduler     = "slurm"

  storage {
    parallel_fs_tb = 800
    object_tb      = 2000
  }

  # 512 GPUs, one apply, validated on delivery
}
Fale com um arquiteto de infraestrutura de IA

As GPUs são suas. Nós operamos.

Compre seus servidores NVIDIA do OEM ou distribuidor que preferir, envie-os para um data center da Velyrix e cuidamos do resto: implantação, rede, refrigeração, monitoramento e suporte. Ou alugue os nossos. De qualquer forma, você recebe um plano em um dia útil.

Perguntas frequentes

Que armazenamento devemos usar para grandes treinamentos?

Um sistema de arquivos paralelo de desempenho - WEKA ou VAST em NVMe - para datasets ativos e checkpoints, apoiado por armazenamento de objetos compatível com S3 para o data lake mais amplo, com NVMe local de scratch em cada nó para espaço de shuffle. A Velyrix dimensiona a camada de desempenho a partir do tamanho e do intervalo do seu checkpoint, para que o checkpointing nunca domine o tempo de passo.

Vocês suportam Ethernet em vez de InfiniBand?

Sim. NVIDIA Spectrum-X com RoCEv2, roteamento adaptativo e controle de congestionamento está disponível quando se prefere um modelo operacional apenas Ethernet. O InfiniBand continua sendo o padrão para os maiores fabrics de treinamento, por causa da redução SHARP na rede e do gerenciamento de sub-rede maduro.

Podemos conectar um cluster Velyrix ao nosso ambiente de nuvem atual?

Sim, por meio de interconexões privadas com AWS, Azure, Google Cloud e Oracle Cloud, links protegidos por IPsec ou MACsec até seus próprios data centers e cross-connects em nossas salas meet-me neutras.

Quem opera o cluster no dia a dia?

Você pode operá-lo por conta própria, com acesso root e BMC completos, ou entregar a operação à Velyrix sob um serviço gerenciado que cobre monitoramento, resposta a incidentes, ciclo de vida de firmware e drivers, política do escalonador e relatórios de SLA.