Início/Implantação de IA

Implantação e comissionamento de infraestrutura de IA

Dos paletes na doca a um cluster validado

Os engenheiros de implantação da Velyrix constroem fábricas de IA para operadores, empresas e governos — em nossas salas ou nas suas. Todo projeto termina do mesmo jeito: um cluster com burn-in, benchmark e documentação, e um relatório de aceitação assinado que seus auditores podem ler.

Construção greenfield
12 – 20 semanas
Pod de expansão
3 – 6 semanas
Escala de cluster suportada
8 – 4,096 GPUs
Burn-in
Mínimo de 72 horas
Entrega
Relatório de aceitação assinado
Escopo

Tudo entre a ordem de compra e o primeiro job de treinamento

A maioria dos projetos de GPU não falha no silício. Falha nos circuitos de líquido, num rail mal cabeado, na divergência de firmware entre oito nós, ou porque ninguém jamais mediu o que o fabric realmente faz.

📐

Projeto e engenharia

Topologia do cluster, elevações de rack, planos de energia, projeto do circuito de líquido, peso e carga de piso, plano de cabeamento do fabric e lista de materiais.

🚚

Logística e recebimento

Coordenação de frete, apoio à documentação aduaneira, recebimento seguro, captura de ativos, registro de números de série e remoção de embalagens.

🔨

Rack & stack

Instalação mecânica de sistemas HGX, DGX, MGX e ORv3, kits de trilho, tubulação de CDU e manifold, fixação com torque controlado e manuseio com controle de ESD.

Energia e refrigeração

Terminação de busway e whips por eletricistas licenciados, balanceamento de alimentação A/B, enchimento de líquido e teste de pressão, comissionamento da detecção de vazamento.

📡

Construção do fabric

Cabeamento InfiniBand ou Spectrum-X otimizado por rail, etiquetagem conforme o plano, assentamento de ópticas, treinamento de link, varredura de taxa de erro e verificação de topologia.

💾

Padronização de firmware

BIOS, BMC, CPLD, NIC, NVSwitch e VBIOS de GPU alinhados a uma única linha de base validada em todos os nós, com relatório de divergência.

💻

Pilha de software

Imagem do SO, driver NVIDIA, CUDA, Fabric Manager, DCGM, runtime de contêineres, Slurm ou Kubernetes, clientes de armazenamento e agentes de monitoramento.

🔥

Burn-in e validação

Estresse sustentado de 72 horas, saturação térmica, monitoramento de ECC e XID, verificação de remapeamento de linhas de memória, testes de throughput de armazenamento e fabric.

📋

Aceitação e entrega

Resultados documentados do teste de aceitação, desenhos as-built, registro de ativos, runbooks, matriz de escalonamento e treinamento de operadores.

Programa

O método de implantação da Velyrix

Um programa repetível de nove estágios, com gerente de projeto nomeado, relatório semanal e um gate documentado ao fim de cada estágio.

Descoberta e revisão de projeto

Perfil de carga, tamanhos de modelo, orçamento de tokens e curva de crescimento traduzidos em topologia de cluster, envelope de potência e dimensionamento de armazenamento. Entregável: documento de projeto e BOM.

Avaliação de prontidão do site

Capacidade elétrica, carga de piso, disponibilidade de líquido, acesso para entrega, supressão de incêndio e caminhos de fabric avaliados contra o projeto. Entregável: relatório de prontidão com lista de lacunas.

Apoio a compras e logística

Acompanhamento de prazos do OEM, plano de staging, apoio à documentação de exportação e importação, e verificação do usuário final antes do envio de qualquer hardware controlado. Entregável: cronograma de entrega.

Instalação mecânica

Racks nivelados e aterrados, sistemas instalados, manifolds e placas frias conectados, líquido preenchido e testado sob pressão, gerenciamento de cabos conforme o plano. Entregável: elevações as-built.

Comissionamento elétrico

Terminação de circuitos, balanceamento de fases, coordenação de disjuntores e verificação de medição por eletricistas licenciados trabalhando sob procedimentos documentados. Entregável: aprovação elétrica.

Construção e verificação do fabric

Cabeamento otimizado por rail instalado e etiquetado, cada link treinado na taxa plena, varredura de taxa de erro de bit, mapa de topologia comparado ao projeto. Entregável: relatório de links e topologia.

Software e subida do cluster

Implantação da imagem golden, aplicação da linha de base de firmware, configuração do escalonador, montagens de armazenamento, integração de monitoramento e alertas. Entregável: linha de base de configuração.

Burn-in e validação de desempenho

Estresse de 72 horas em plena potência, benchmarks NCCL all-reduce e all-gather, throughput de armazenamento e um treinamento de modelo de referência na escala alvo. Entregável: resultados de benchmark.

Aceitação e entrega operacional

Relatório de teste de aceitação revisado e assinado, runbooks e caminhos de escalonamento entregues, treinamento de operadores realizado, transição opcional para operação gerenciada Velyrix. Entregável: ATP assinado.

Protocolo de teste de aceitação

O que medimos antes de considerar concluído

Os critérios de aprovação são acordados por escrito na fase de projeto e testados na entrega. Tudo o que falhar é corrigido e retestado por conta da Velyrix em contratos de preço fechado.

TesteMétodoCritério típico de aprovaçãoEvidência
Inventário e saúde das GPUsnvidia-smi, DCGM diagnostics level 3100% das GPUs enumeradas, zero ECC incorrigível, zero remapeamentos de linha pendentesRelatório DCGM por nó
Burn-in sustentado72 h de estresse combinado de GPU, CPU, memória e NVMeZero erros XID, zero eventos de throttling térmico, clocks estáveisExportação de telemetria em série temporal
NVLink / NVSwitchnvbandwidth, teste de latência e banda p2pDentro de 5% da banda de referência da plataforma em cada parMatriz de banda
Qualidade dos links do fabricTreinamento de link, varredura de BER, contadores de erro de portaTodos os links na taxa plena, taxa de erro de símbolo abaixo do limite do fornecedor, zero flaps em 72 hRelatório de saúde do fabric
Desempenho de coletivosNCCL all-reduce e all-gather, 8 MB – 8 GBBanda de barramento dentro de 10% da referência de topologia em escala plenanccl-tests output
Throughput de armazenamentofio e IOR contra o sistema de arquivos paraleloLeitura/escrita agregada e tempo de checkpoint contratados atingidosLog de benchmark
Treinamento de referênciaModelo de referência classe Llama no número de nós alvoUtilização de FLOPs do modelo e tempo de passo contratados atingidosLog de treinamento e cálculo de MFU
Failover e resiliênciaCorte de energia A/B, remoção de switch leaf, failover de bomba de CDUSem perda de job em caminhos redundantes, tempo de recuperação documentadoFolha de testemunho do teste
Térmica e energiaSaturação em plena carga com telemetria de entrada, saída e líquidoTodos os componentes dentro da especificação do OEM na temperatura ambiente de projetoLevantamento térmico
Linha de base de segurançaBoot seguro, endurecimento de BMC, rotação de credenciais, segmentação de redeLinha de base aplicada em 100% dos nós, sem credenciais padrãoAuditoria de configuração
Como trabalhamos com segurança

Feito para sobreviver a uma auditoria de OEM e de seguradora

O trabalho de implantação toca garantias de terceiros, salas de terceiros e instalações elétricas energizadas. A Velyrix conduz o projeto de acordo.

  • Procedimentos e avaliações de risco emitidos e aprovados antes de qualquer trabalho em piso energizado
  • Eletricistas licenciados para toda terminação elétrica, conforme código local e prática de arc-flash
  • Manuseio com controle de ESD alinhado à ANSI/ESD S20.20 para proteger as condições de garantia do OEM
  • Orientações de instalação do OEM seguidas para que a garantia do fabricante e os direitos de suporte permaneçam intactos
  • Cadeia de custódia da doca ao rack, com captura de ativos no nível de número de série e registros fotográficos
  • Controle de mudanças com janelas de trabalho documentadas, planos de rollback e aprovação do cliente
  • Engenheiros segurados e verificados, com checagem de antecedentes e autorização de acesso por site
  • Verificação de controle de exportação concluída antes do envio ou da instalação de hardware controlado

Modelos de contratação

Construção por preço fechado

Escopo acordado, critérios de aceitação acordados, preço acordado. O modelo mais comum para clusters greenfield.

Tempo e materiais

Diárias de engenheiro para expansões, correções, migrações e diagnóstico de um parque existente.

Residência

Engenheiros Velyrix alocados no seu site por um período definido, para construir capacidade junto à sua equipe.

Construir e operar

Nós construímos e depois operamos sob um serviço gerenciado com SLA de disponibilidade e desempenho.

As taxas de implantação por preço fechado vão de cerca de US$ 2.300 por nó em uma expansão simples refrigerada a ar até US$ 4.600–US$ 10.900 por nó em sistemas refrigerados a líquido em escala de rack, incluindo construção de fabric, validação e documentação. Todo projeto é orçado após a revisão de projeto.

Para OEMs, distribuidores e revendedores

Também somos a bancada de serviços de campo por trás dos negócios de outros

Estamos estruturados para entregar trabalho de implantação para fabricantes de hardware e seus parceiros — sob nossa marca ou, mais útil para você, sob a deles.

  • Entrega white-label — sua marca no plano do projeto e no relatório de aceitação
  • Manuais validados para plataformas Dell, Supermicro, GIGABYTE, HPE, Lenovo e NVIDIA DGX
  • Suporte L1–L3 com caminho de escalonamento documentado até o fabricante
  • Coordenação de RMA e depósitos de peças dimensionados à frota implantada
  • Registro de oportunidade e uma política escrita de neutralidade de canal

Preserva a garantia por construção

Toda plataforma que implantamos tem um manual Velyrix derivado das orientações de instalação publicadas pelo fabricante.

  • Manuseio ESD alinhado à ANSI/ESD S20.20
  • Especificações de torque e procedimentos de kit de trilho seguidos
  • Linhas de base de firmware correspondentes à pilha validada do fornecedor
  • Registros por número de série e evidência fotográfica retidos
  • Evidência de falha empacotada no formato exigido pelo fornecedor

Resultado: a garantia do fabricante e os direitos de suporte permanecem intactos, e disputas de RMA sobre prática de instalação simplesmente não acontecem.

Também disponível

Serviços de implantação além da primeira construção

Migração e realocação

Mova um parque GPU em produção entre salas ou provedores com plano de cutover em fases, mínima interrupção de treinamento e reconciliação completa de ativos.

🔍

Auditoria de saúde do cluster

Avaliação independente de um cluster existente: erros de fabric, divergência de firmware, folga térmica, eficiência do escalonador e MFU realizada, com plano de correção priorizado.

🔁

Ciclo de vida e renovação

Planejamento de capacidade, renovação escalonada de hardware, descomissionamento com sanitização de mídia NIST SP 800-88 e apoio ao descarte certificado ou revenda.

👥

Operação gerenciada

Monitoramento 24×7, resposta a incidentes, ciclo de vida de firmware e drivers, gestão de peças e relatórios de capacidade frente ao seu SLA.

Fale com um arquiteto de infraestrutura de IA

As GPUs são suas. Nós operamos.

Compre seus servidores NVIDIA do OEM ou distribuidor que preferir, envie-os para um data center da Velyrix e cuidamos do resto: implantação, rede, refrigeração, monitoramento e suporte. Ou alugue os nossos. De qualquer forma, você recebe um plano em um dia útil.

Perguntas frequentes

O que o comissionamento de infraestrutura de IA inclui de fato?

Comissionamento é o processo formal de provar que um cluster funciona conforme a especificação antes da entrega: padronização de firmware, burn-in de 72 horas, verificações de saúde de GPU e NVLink, varreduras de qualidade de link do fabric, benchmarks de coletivos NCCL, testes de throughput de armazenamento, um treinamento de referência, testes de failover e um levantamento térmico - tudo registrado em um relatório de teste de aceitação assinado.

A Velyrix pode implantar no nosso próprio data center em vez do de vocês?

Sim. Boa parte do que fazemos é em sites de clientes ou de terceiros - data centers corporativos, instalações governamentais e salas de colocation de outros operadores. Trabalhamos conforme as regras de acesso, segurança e controle de mudanças do site anfitrião, e podemos atuar como subcontratados do seu integrador atual, se isso for mais simples.

Quanto tempo leva para entregar um cluster GPU greenfield?

Com o hardware no local, uma construção típica leva de três a seis semanas por pod. De ponta a ponta - projeto, obras no site, prazo de entrega do OEM, construção e comissionamento - uma fábrica de IA greenfield leva normalmente de 12 a 20 semanas, sendo o prazo do OEM a maior variável.

O trabalho de implantação por terceiros anula a garantia do nosso hardware OEM?

Não, quando o trabalho segue as orientações de instalação publicadas pelo fabricante. Os engenheiros da Velyrix trabalham conforme os procedimentos do OEM, com manuseio controlado de ESD, especificações de torque e registros documentados por número de série, de modo que a garantia do fabricante e os direitos de suporte permanecem intactos.

O que acontece se o cluster não passar em um teste de aceitação?

Em um contrato de preço fechado, a Velyrix corrige e reteste por nossa conta até que os critérios acordados sejam atendidos. Falhas atribuídas a hardware defeituoso são abertas junto ao OEM em garantia, e conduzimos esse processo em seu nome.

Vocês suportam sistemas refrigerados a líquido e em escala de rack, como o GB300 NVL72?

Sim. Implantações refrigeradas a líquido incluem instalação de manifold e placas frias, enchimento e teste de pressão do líquido, comissionamento de CDU, validação da detecção de vazamento e teste de failover de bombas, além do protocolo padrão de aceitação de computação e fabric.