Início/LLM privado

Implantação e otimização de LLM privados

Seu modelo, seu hardware, seu limite de dados

A Velyrix instala, quantiza, avalia e opera modelos de pesos abertos de fronteira em GPUs dedicadas — na nuvem Velyrix, na sua área de colocation ou totalmente isolado em suas instalações. Você recebe um endpoint compatível com OpenAI, com throughput, latência e disponibilidade contratados.

Famílias de modelos
10 suportadas
Motores de serviço
vLLM · SGLang · TensorRT-LLM
Tempo até o primeiro token
Metas abaixo de 250 ms
Implantação
Nuvem · colo · isolado
API
Compatível com OpenAI
Por que auto-hospedar

APIs públicas são convenientes até que os dados sejam seus

Dados regulados, código-fonte proprietário, prontuários, posições de mercado e cargas soberanas raramente pertencem à fila de inferência de outra pessoa. Modelos de pesos abertos agora suficientemente próximos da qualidade de fronteira tornam a implantação privada o padrão para cargas sérias.

  • Os dados nunca saem do seu limite — sem retenção por terceiros, sem treinamento com seus prompts
  • Economia unitária previsível — custo fixo de GPU em vez de cobrança por token que cresce com o sucesso
  • Estabilidade de versão — o modelo que você validou continua sendo o modelo que você serve, até que decida o contrário
  • Latência sob seu controle — endpoint na mesma região, ou no mesmo prédio, que a aplicação
  • Personalização profunda — adaptadores LoRA, fine-tunes de domínio, esquemas de ferramentas e guardrails próprios
  • Auditabilidade — registro completo de requisições no seu próprio SIEM, com sua própria política de retenção
migração direta
# Before — public API
client = OpenAI(api_key="sk-...")

# After — your Velyrix private endpoint
client = OpenAI(
    base_url="https://llm.internal.acme.com/v1",
    api_key=os.environ["VELYRIX_KEY"],
)

resp = client.chat.completions.create(
    model="qwen3-235b-a22b-fp8",
    messages=[{"role": "user", "content": prompt}],
    tools=tools, stream=True,
)

# Same SDK. Same schema. Your VPC, your logs, your keys.
Catálogo de modelos

Dez famílias de modelos de pesos abertos, implantadas e suportadas

A Velyrix mantém receitas de serviço validadas, perfis de quantização e linhas de base de benchmark para cada família, atualizados conforme novos checkpoints são lançados.

DeepSeek

Modelos MoE esparsos de topo e modelos de raciocínio, incluindo variantes densas destiladas para serviço sensível a custo.

MoEraciocínioFP8 nativo8×H200

Qwen

Séries densas e MoE da Alibaba, com fortes variantes multilíngues, de programação e de visão-linguagem, de 0,6B a 235B+.

densa + MoEmultilíngueVLcodificação

Llama

A família de pesos abertos mais adotada da Meta — o padrão mais seguro para ferramentas, adaptadores e harnesses de avaliação do ecossistema.

8B–405Bvariantes MoEecossistema enorme

OpenAI gpt-oss

Lançamento de pesos abertos da OpenAI, MoE com esforço de raciocínio configurável e forte uso de ferramentas com poucas GPUs.

120b / 20bMXFP4agêntico

Mistral

Modelos europeus com licenciamento permissivo em muitos checkpoints — densos, MoE, de código e pequenas variantes de borda.

Nível Apacheorigem UEcódigoborda

GLM

Família MoE bilíngue da Zhipu, com forte desempenho agêntico e de programação, além de checkpoints mais leves da classe air.

MoEbilíngueagêntico

Kimi

Modelos MoE esparsos da classe de um trilhão de parâmetros da Moonshot AI, feitos para contexto longo e agentes que chamam ferramentas.

MoE classe 1Tcontexto longoagentes

MiniMax

Arquiteturas MoE de atenção eficiente voltadas a janelas de contexto muito longas com custo de serviço competitivo.

MoEcontexto de 1Matenção eficiente

Gemma

Modelos abertos leves do Google — excelente qualidade por GPU para on-premise, borda e classificação de alto volume.

1B–27Bmultimodalpronto para borda

NVIDIA Nemotron

Família de modelos abertos otimizada da NVIDIA, ajustada para throughput em aceleradores NVIDIA e fluxos de agentes corporativos.

Nano / Super / UltraTensorRT-LLMNIM

Os nomes de modelos são marcas de seus respectivos proprietários. A Velyrix é um provedor de infraestrutura independente, não afiliado nem endossado por esses publicadores de modelos. Cada modelo é implantado sob sua própria licença, que revisamos com você antes da implantação — veja licenciamento de modelos.

Dimensionamento

O que é preciso para servir cada classe de modelo

Dimensionamento indicativo de réplica única para serviço em produção, com espaço para cache KV em concorrência realista. O dimensionamento final vem do seu comprimento de contexto, concorrência e metas de latência.

Classe de modeloPrecisãoGPUs mínimasRecomendadoThroughput indicativoInfraestrutura mensal a partir de
Denso pequeno (1B – 9B)BF16 / FP81× L40S2× L40S / 1× H1002,500 – 6,000 tok/s$1,640
Denso médio (12B – 32B)FP8 / AWQ-INT41× H100 80GB2× H100 / 2× H2001,800 – 4,500 tok/s$3,300
Denso grande (70B – 123B)FP82× H2004× H200 / 8× H1001,400 – 3,200 tok/s$10,400
Denso muito grande (405B)FP88× H2008× B200900 – 2,100 tok/s$23,900
MoE esparso (100B – 250B total)FP84× H2008× H2003,000 – 9,000 tok/s$18,400
MoE esparso (400B – 700B total)FP8 / FP48× H2008× B200 / 16× H2004,000 – 14,000 tok/s$23,900
MoE esparso (classe 1T total)FP8 / FP416× H2008× B300 / GB300 partition6,000 – 20,000 tok/s$44,800
Visão-linguagem (qualquer tamanho)BF16 / FP8+1 GPU para a torre de visãoRéplica de encoder dedicadaDepende da cargaSob consulta

O throughput é o total de tokens de saída por segundo em requisições concorrentes, medido em hardware de referência Velyrix com prompts representativos de produção. Seus números são medidos na sua carga antes do contrato, e o valor acordado passa a ser uma meta de nível de serviço.

Otimização

A diferença entre rodar um modelo e rodá-lo bem

Um contêiner padrão em oito GPUs costuma deixar de duas a cinco vezes o throughput na mesa. Os projetos de otimização da Velyrix ajustam todo o caminho, do tokenizador à NIC.

Quantização

Perfis FP8, NVFP4/MXFP4, AWQ, GPTQ e SmoothQuant com teste de regressão de acurácia contra o seu próprio conjunto de avaliação antes de qualquer coisa entrar no ar.

Estratégia de paralelismo

Layouts de paralelismo de tensor, pipeline, especialista e dados escolhidos por modelo e topologia de GPU, incluindo posicionamento de especialistas ciente de NVLink para MoE.

🔄

Batching contínuo

Atenção paginada, prefill em blocos e ajuste do escalonador para manter alta ocupação de GPU sem violar sua meta de tempo até o primeiro token.

🔁

Desagregação de prefill e decode

Pools separados de prefill e decode com transferência de KV, para que prompts longos deixem de bloquear a decodificação interativa em hardware compartilhado.

🏃

Decodificação especulativa

Modelos rascunho, especulação estilo EAGLE e n-grama ajustados à sua taxa de aceitação — comumente 1,5–2,5× em cargas interativas.

💾

Engenharia de cache KV

Cache de prefixo e radix, descarga de cache para memória do host ou NVMe, e KV quantizado para estender o contexto sem GPUs adicionais.

📈

Autoescala e roteamento

Roteamento multi-réplica com balanceamento ciente de cache, autoescala por profundidade de fila e classes de prioridade para tráfego interativo versus em lote.

🧪

Harness de avaliação

Seu próprio conjunto golden integrado ao CI, para que toda atualização de modelo, quantização ou motor seja avaliada por qualidade, e não apenas por velocidade.

🔨

Seleção de motor

vLLM, SGLang, TensorRT-LLM ou NVIDIA Dynamo escolhidos por carga e comparados lado a lado no seu tráfego antes de assumirmos compromisso.

Topologias de implantação

Três formas de traçar o limite dos seus dados

Mais rápido de começar

Na nuvem GPU Velyrix

GPUs de inquilino único em uma região Velyrix, rede privada até sua VPC ou on-ramp, pilha operada pela Velyrix.

  • No ar em dias
  • Escala elástica de réplicas
  • Operação Velyrix 24×7
  • Residência regional de dados
Equilibrado

Na sua área de colocation

Seu hardware, sua jaula, implantados e operados pela Velyrix sob contrato de serviço gerenciado.

  • Os ativos são seus
  • A Velyrix opera a pilha
  • Modelo de capex
  • Controle físico total
Mais restrito

On-premises e isolado

Implantação totalmente desconectada, com espelhos offline de modelos e contêineres e sem telemetria de saída.

  • Sem dependência de internet
  • Registro e atualizações offline
  • Pronto para dados classificados / regulados
  • Treinamento de entrega no local
Além do serviço

Adaptação, recuperação e agentes

  • Pré-treinamento continuado em corpora de domínio, onde vocabulário e estilo importam mais que o seguimento de instruções
  • Fine-tuning supervisionado e LoRA com serviço multi-adaptador, para que um modelo base hospede dezenas de adaptadores de tarefa
  • Otimização por preferência — fluxos DPO, GRPO e de modelo de recompensa sobre seus próprios dados avaliados
  • Destilação de um professor grande para um aluno pequeno, reduzindo o custo de serviço em uma ordem de grandeza
  • Aumento por recuperação com busca vetorial e híbrida, estratégia de chunking, reranking e citação obrigatória
  • Infraestrutura de agentes — esquemas de ferramentas, saída estruturada, execução em sandbox e servidores de ferramentas compatíveis com MCP
  • Guardrails — classificação de entrada e saída, redação de PII, detecção de jailbreak e registro completo de auditoria de prompts

Licenciamento e governança de modelos

Pesos abertos não significam uso irrestrito. Antes da implantação, a Velyrix revisa a licença de cada modelo que você pretende executar e documenta as obrigações associadas.

  • Classificação da licença — permissiva, comunitária ou termos específicos
  • Restrições de uso aceitável e de campo de aplicação
  • Obrigações de atribuição, nomenclatura e redistribuição
  • Limiares de uso comercial e condições sobre obras derivadas
  • Registro de procedência de cada checkpoint e de sua origem

A Velyrix fornece infraestrutura e serviços de engenharia e não concede direitos sobre qualquer modelo de terceiros. O cliente permanece licenciado dos modelos que escolher implantar e é responsável pela conformidade com essas licenças e com a regulação de IA aplicável, incluindo o AI Act da UE quando cabível. A Velyrix apoia esse processo com documentação e controles técnicos.

Pacotes de contratação

Como funciona um programa de LLM privado

Piloto

2–3 semanas

  • Workshop de seleção de modelo
  • Implantação de réplica única
  • Benchmark contra seu conjunto de avaliação
  • Modelo de custo e dimensionamento
  • Relatório de go / no-go

a partir de US$ 27.000

Mais escolhido

Implantação em produção

6–10 semanas

  • Arquitetura HA multi-réplica
  • Quantização e ajuste de motor
  • Gateway, autenticação, cotas, registro
  • Guardrails e CI de avaliação
  • Runbooks e treinamento da equipe

a partir de US$ 83.500

Serviço de LLM gerenciado

Contínuo

  • Operação do endpoint 24×7
  • SLA de throughput e latência
  • Atualizações de modelo e motor
  • Relatórios de capacidade e custo
  • Revisão trimestral de otimização

a partir de US$ 10.500 / mês

Honorários indicativos de serviços profissionais, sem infraestrutura de GPU e sem impostos. O escopo é confirmado após uma sessão de descoberta.

Fale com um arquiteto de infraestrutura de IA

As GPUs são suas. Nós operamos.

Compre seus servidores NVIDIA do OEM ou distribuidor que preferir, envie-os para um data center da Velyrix e cuidamos do resto: implantação, rede, refrigeração, monitoramento e suporte. Ou alugue os nossos. De qualquer forma, você recebe um plano em um dia útil.

Perguntas frequentes

Quais LLMs a Velyrix pode implantar para nós?

A Velyrix mantém receitas de implantação validadas para dez famílias de pesos abertos: DeepSeek, Qwen, Llama, OpenAI gpt-oss, Mistral, GLM, Kimi, MiniMax, Gemma e NVIDIA Nemotron, incluindo suas variantes de visão-linguagem, programação e raciocínio. Outros modelos de pesos abertos podem ser incorporados sob consulta.

Quantas GPUs precisamos para rodar um LLM privado?

Um modelo de 7B-9B roda confortavelmente em uma única L40S ou H100. Um modelo denso de 70B costuma exigir duas a quatro H200 em FP8. Modelos MoE esparsos grandes, na faixa de 400B-700B, precisam de cerca de oito H200 ou oito B200, e modelos da classe 1T normalmente são servidos em partições B300 ou GB300. O dimensionamento final depende do comprimento de contexto, da concorrência e das metas de latência.

A quantização prejudica a qualidade do modelo?

FP8 é em geral praticamente sem perdas em checkpoints modernos, e NVFP4/MXFP4 e quantização de pesos em 4 bits trocam uma pequena perda de qualidade por grandes ganhos de throughput e memória. A Velyrix sempre mede a diferença contra o seu próprio conjunto de avaliação e a reporta antes que qualquer build quantizado vá para produção.

A implantação pode ser totalmente isolada da rede?

Sim. Implantações isoladas chegam com pesos de modelo offline, registro interno de contêineres, espelhos de pacotes offline e sem telemetria de saída. As atualizações são entregues como mídia assinada e verificada por meio do seu processo de controle de mudanças.

Vocês suportam fine-tuning além de inferência?

Sim - pré-treinamento continuado, fine-tuning supervisionado, adaptadores LoRA com serviço multi-adaptador, otimização por preferência como DPO e GRPO, e destilação de um modelo professor grande para um aluno menor, com serviço mais barato.

Quem é responsável pela licença do modelo?

O cliente é o licenciado de qualquer modelo de terceiros que escolher implantar. A Velyrix fornece infraestrutura e serviços de engenharia, revisa com você os termos de licença de cada modelo antes da implantação e documenta as obrigações resultantes, mas não concede direitos sobre modelos de terceiros.

Que desempenho vocês se comprometem a entregar?

Após uma fase de benchmark no seu próprio tráfego, a Velyrix contrata números específicos de throughput agregado em tokens por segundo, tempo até o primeiro token no p95, latência entre tokens no p95 e disponibilidade mensal do endpoint. Esses números são reverificados após cada atualização.