Inicio/LLM privado

Despliegue y optimización de LLM privados

Tu modelo, tu hardware, tu frontera de datos

Velyrix instala, cuantiza, mide y opera modelos de pesos abiertos de frontera sobre GPU dedicadas: en la nube de Velyrix, en tu propio espacio de colocation o totalmente aislado en tus instalaciones, con un endpoint compatible con OpenAI y objetivos contratados de rendimiento, latencia y disponibilidad.

Familias de modelos
10 soportadas
Motores de inferencia
vLLM · SGLang · TensorRT-LLM
Tiempo hasta el primer token
Objetivos por debajo de 250 ms
Despliegue
Nube · colocation · aislado
API
Compatible con OpenAI
Por qué autoalojar

Las API públicas son cómodas hasta que los datos son tuyos

Los datos regulados, el código propietario, los historiales clínicos, las posiciones de mercado y las cargas soberanas rara vez deberían estar en la cola de inferencia de otro. Con modelos de pesos abiertos ya lo bastante cerca de la calidad de frontera, el despliegue privado se ha convertido en la opción por defecto para cargas serias.

  • Los datos nunca salen de tu perímetro — sin retención por terceros, sin entrenamiento con tus prompts
  • Economía unitaria predecible — coste fijo de GPU en lugar de facturación por token que crece con el éxito
  • Estabilidad de versión — el modelo que validaste sigue siendo el que sirves, hasta que tú decidas otra cosa
  • Latencia bajo tu control — endpoint en la misma región, o en el mismo edificio, que la aplicación
  • Personalización profunda — adaptadores LoRA, fine-tunes de dominio, esquemas de herramientas propios y guardarraíles
  • Auditabilidad — registro completo de peticiones en tu propio SIEM, con tu política de retención
migración directa
# Before — public API
client = OpenAI(api_key="sk-...")

# After — your Velyrix private endpoint
client = OpenAI(
    base_url="https://llm.internal.acme.com/v1",
    api_key=os.environ["VELYRIX_KEY"],
)

resp = client.chat.completions.create(
    model="qwen3-235b-a22b-fp8",
    messages=[{"role": "user", "content": prompt}],
    tools=tools, stream=True,
)

# Same SDK. Same schema. Your VPC, your logs, your keys.
Catálogo de modelos

Diez familias de modelos de pesos abiertos, desplegadas y soportadas

Velyrix mantiene recetas de inferencia validadas, perfiles de cuantización y líneas base de benchmark para cada familia, actualizadas conforme se publican nuevos checkpoints.

DeepSeek

Modelos MoE dispersos insignia y modelos de razonamiento, incluidas variantes densas destiladas para inferencia sensible al coste.

MoErazonamientoFP8 nativo8×H200

Qwen

Series densas y MoE de Alibaba con fuertes variantes multilingües, de programación y visión-lenguaje, de 0,6B a más de 235B.

densa + MoEmultilingüeVLprogramación

Llama

La familia de pesos abiertos más adoptada de Meta: la opción por defecto más segura para herramientas, adaptadores y bancos de evaluación.

8B–405Bvariantes MoEecosistema enorme

OpenAI gpt-oss

La versión de pesos abiertos de OpenAI, MoE con esfuerzo de razonamiento configurable y buen uso de herramientas con pocas GPU.

120b / 20bMXFP4agéntico

Mistral

Modelos europeos con licencia permisiva en muchos checkpoints: densos, MoE, de código y variantes pequeñas para el borde.

nivel Apacheorigen UEcódigoborde

GLM

Familia MoE bilingüe de Zhipu con fuerte rendimiento agéntico y de programación, además de checkpoints más ligeros.

MoEbilingüeagéntico

Kimi

Modelos MoE dispersos de clase billón de parámetros de Moonshot AI, diseñados para contexto largo y agentes con llamada a herramientas.

MoE de clase 1Tcontexto largoagentes

MiniMax

Arquitecturas MoE de atención eficiente orientadas a ventanas de contexto muy largas con un coste de inferencia competitivo.

MoEcontexto de 1Matención eficiente

Gemma

Modelos abiertos ligeros de Google: excelente calidad por GPU para on-premise, borde y clasificación de alto volumen.

1B–27Bmultimodallisto para el borde

NVIDIA Nemotron

Familia de modelos abiertos optimizada por NVIDIA, ajustada para rendimiento en aceleradores NVIDIA y flujos de agentes empresariales.

Nano / Super / UltraTensorRT-LLMNIM

Los nombres de modelo son marcas de sus respectivos propietarios. Velyrix es un proveedor de infraestructura independiente y no está afiliado ni respaldado por estos editores de modelos. Cada modelo se despliega bajo su propia licencia, que revisamos contigo antes del despliegue: consulta licencias de modelo.

Dimensionado

Lo que hace falta para servir cada clase de modelo

Dimensionado indicativo de una sola réplica para servicio en producción, con margen para la caché KV a concurrencia realista. El dimensionado final depende de tu longitud de contexto, tu concurrencia y tus objetivos de latencia.

Clase de modeloPrecisiónGPU mínimasRecomendadoRendimiento indicativoInfraestructura mensual desde
Denso pequeño (1B – 9B)BF16 / FP81× L40S2× L40S / 1× H1002,500 – 6,000 tok/s$1,640
Denso medio (12B – 32B)FP8 / AWQ-INT41× H100 80GB2× H100 / 2× H2001,800 – 4,500 tok/s$3,300
Denso grande (70B – 123B)FP82× H2004× H200 / 8× H1001,400 – 3,200 tok/s$10,400
Denso muy grande (405B)FP88× H2008× B200900 – 2,100 tok/s$23,900
MoE disperso (100B – 250B total)FP84× H2008× H2003,000 – 9,000 tok/s$18,400
MoE disperso (400B – 700B total)FP8 / FP48× H2008× B200 / 16× H2004,000 – 14,000 tok/s$23,900
MoE disperso (clase 1T total)FP8 / FP416× H2008× B300 / GB300 partition6,000 – 20,000 tok/s$44,800
Visión-lenguaje (cualquier tamaño)BF16 / FP8+1 GPU para la torre de visiónRéplica de codificador dedicadaSegún la cargaA consultar

El rendimiento es el total de tokens de salida por segundo entre peticiones concurrentes, medido en hardware de referencia de Velyrix con prompts representativos de producción. Tus cifras se miden con tu propia carga antes del contrato, y la cifra acordada pasa a ser un objetivo de nivel de servicio.

Optimización

La diferencia entre ejecutar un modelo y ejecutarlo bien

Un contenedor por defecto en ocho GPU suele dejar entre dos y cinco veces el rendimiento sobre la mesa. Los proyectos de optimización de Velyrix ajustan toda la ruta, del tokenizador a la NIC.

Cuantización

Perfiles FP8, NVFP4/MXFP4, AWQ, GPTQ y SmoothQuant con pruebas de regresión de precisión frente a tu propio conjunto de evaluación antes de pasar a producción.

Estrategia de paralelismo

Disposiciones de paralelismo tensorial, de pipeline, de expertos y de datos elegidas por modelo y topología de GPU, incluida la colocación de expertos consciente de NVLink para MoE.

🔄

Batching continuo

Atención paginada, prefill por bloques y ajuste del planificador para mantener alta ocupación de GPU sin incumplir tu objetivo de tiempo hasta el primer token.

🔁

Desagregación prefill / decode

Grupos separados de prefill y decode con transferencia de KV, para que los prompts largos dejen de bloquear la decodificación interactiva en hardware compartido.

🏃

Decodificación especulativa

Modelos borrador, especulación tipo EAGLE y n-gramas ajustados a tu tasa de aceptación: habitualmente 1,5–2,5× en cargas interactivas.

💾

Ingeniería de caché KV

Caché de prefijos y radix, descarga de caché a memoria del host o NVMe y KV cuantizado para ampliar el contexto sin GPU adicionales.

📈

Autoescalado y enrutamiento

Enrutamiento multi-réplica con balanceo consciente de caché, autoescalado por profundidad de cola y clases de prioridad para tráfico interactivo frente a por lotes.

🧪

Banco de evaluación

Tu propio conjunto de referencia integrado en CI para que cada modelo, cuantización o actualización de motor pase por un control de calidad, no solo de velocidad.

🔨

Selección de motor

vLLM, SGLang, TensorRT-LLM o NVIDIA Dynamo elegidos por carga y comparados cara a cara con tu tráfico antes de comprometernos.

Topologías de despliegue

Tres formas de trazar tu frontera de datos

Más rápido de arrancar

En la nube GPU de Velyrix

GPU de un solo inquilino en una región de Velyrix, red privada hacia tu VPC o punto de interconexión, pila operada por Velyrix.

  • Operativo en días
  • Escalado elástico de réplicas
  • Operación Velyrix 24×7
  • Residencia de datos regional
Equilibrado

En tu espacio de colocation

Tu hardware, tu jaula, desplegado y operado por Velyrix bajo un acuerdo de servicio gestionado.

  • Tú eres propietario de los activos
  • Velyrix opera la pila
  • Modelo de capex
  • Control físico total
Más estricto

On-premise y aislado de la red

Despliegue totalmente desconectado con espejos offline de modelos y contenedores, y sin telemetría saliente.

  • Sin dependencia de internet
  • Registro y actualizaciones offline
  • Apto para entornos clasificados o regulados
  • Formación presencial en la entrega
Más allá de la inferencia

Adaptación, recuperación y agentes

  • Preentrenamiento continuado sobre corpus de dominio donde el vocabulario y el estilo importan más que el seguimiento de instrucciones
  • Fine-tuning supervisado y LoRA con servicio multiadaptador, para que un solo modelo base aloje decenas de adaptadores de tarea
  • Optimización por preferencias — flujos DPO, GRPO y de modelo de recompensa sobre tus propios datos valorados
  • Destilación de un profesor grande a un alumno pequeño, reduciendo el coste de inferencia en un orden de magnitud
  • Generación aumentada por recuperación con búsqueda vectorial e híbrida, estrategia de fragmentación, reordenación y citas obligatorias
  • Infraestructura de agentes — esquemas de herramientas, salida estructurada, ejecución en sandbox y servidores de herramientas compatibles con MCP
  • Guardarraíles — clasificación de entrada y salida, redacción de PII, detección de jailbreak y registro completo de auditoría de prompts

Licencias y gobernanza de modelos

Pesos abiertos no significa uso sin restricciones. Antes del despliegue, Velyrix revisa la licencia de cada modelo que pretendes ejecutar y documenta las obligaciones que conlleva.

  • Clasificación de licencia: permisiva, comunitaria o de términos propios
  • Restricciones de uso aceptable y de campo de aplicación
  • Obligaciones de atribución, denominación y redistribución
  • Umbrales de uso comercial y condiciones sobre obras derivadas
  • Registro de procedencia de cada checkpoint y su origen

Velyrix presta servicios de infraestructura e ingeniería y no otorga derechos sobre ningún modelo de terceros. El cliente sigue siendo el licenciatario de los modelos que decide desplegar y es responsable del cumplimiento de esas licencias y de la normativa de IA aplicable, incluida la Ley de IA de la UE cuando corresponda. Velyrix apoya ese proceso con documentación y controles técnicos.

Paquetes de servicio

Cómo se desarrolla un programa de LLM privado

Piloto

2–3 semanas

  • Taller de selección de modelo
  • Despliegue de una sola réplica
  • Benchmark frente a tu conjunto de evaluación
  • Modelo de coste y dimensionado
  • Informe de continuidad

desde 27.000 $

Más habitual

Despliegue en producción

6–10 semanas

  • Arquitectura HA multi-réplica
  • Cuantización y ajuste del motor
  • Gateway, autenticación, cuotas y registro
  • Guardarraíles y CI de evaluación
  • Runbooks y formación del equipo

desde 83.500 $

Servicio LLM gestionado

Continuo

  • Operación del endpoint 24×7
  • SLA de rendimiento y latencia
  • Actualizaciones de modelo y motor
  • Informes de capacidad y coste
  • Revisión trimestral de optimización

desde 10.500 $ / mes

Honorarios indicativos de servicios profesionales, sin incluir la infraestructura GPU ni impuestos. El alcance se confirma tras una sesión de descubrimiento.

Hable con un arquitecto de infraestructura de IA

Las GPU son suyas. Nosotros las operamos.

Compre sus servidores NVIDIA al OEM o distribuidor que prefiera, envíelos a un centro de datos de Velyrix y nosotros nos ocupamos del resto: despliegue, red, refrigeración, monitorización y soporte. O alquile los nuestros. En cualquier caso, recibirá un plan en un día hábil.

Preguntas frecuentes

¿Qué LLM puede desplegar Velyrix por nosotros?

Velyrix mantiene recetas de despliegue validadas para diez familias de pesos abiertos: DeepSeek, Qwen, Llama, OpenAI gpt-oss, Mistral, GLM, Kimi, MiniMax, Gemma y NVIDIA Nemotron, incluidas sus variantes de visión-lenguaje, programación y razonamiento. Otros modelos de pesos abiertos pueden incorporarse bajo petición.

¿Cuántas GPU necesitamos para ejecutar un LLM privado?

Un modelo de 7B-9B se sirve cómodamente en una sola L40S o H100. Un modelo denso de 70B suele necesitar de dos a cuatro H200 en FP8. Los grandes MoE dispersos de 400B-700B requieren unas ocho H200 u ocho B200, y los modelos de clase 1T se sirven normalmente en particiones B300 o GB300. El dimensionado final depende de la longitud de contexto, la concurrencia y los objetivos de latencia.

¿La cuantización perjudica la calidad del modelo?

FP8 suele ser prácticamente sin pérdida en checkpoints modernos, y NVFP4/MXFP4 y la cuantización de pesos de 4 bits intercambian algo de calidad por grandes ganancias de rendimiento y memoria. Velyrix siempre mide la diferencia frente a tu propio conjunto de evaluación y la reporta antes de que una versión cuantizada pase a producción.

¿Puede el despliegue estar totalmente aislado de la red?

Sí. Los despliegues aislados incluyen pesos de modelo offline, un registro de contenedores interno, espejos de paquetes offline y ninguna telemetría saliente. Las actualizaciones se entregan como soportes firmados y verificados a través de tu proceso de control de cambios.

¿Ofrecéis fine-tuning además de inferencia?

Sí: preentrenamiento continuado, fine-tuning supervisado, adaptadores LoRA con servicio multiadaptador, optimización por preferencias como DPO y GRPO, y destilación de un modelo profesor grande a un alumno más pequeño para abaratar la inferencia.

¿Quién es responsable de la licencia del modelo?

El cliente es el licenciatario de cualquier modelo de terceros que decida desplegar. Velyrix presta servicios de infraestructura e ingeniería, revisa contigo los términos de licencia de cada modelo antes del despliegue y documenta las obligaciones resultantes, pero no otorga derechos sobre modelos de terceros.

¿A qué rendimiento os comprometéis?

Tras una fase de benchmarking con tu propio tráfico, Velyrix contrata cifras concretas de rendimiento agregado en tokens por segundo, tiempo p95 hasta el primer token, latencia p95 entre tokens y disponibilidad mensual del endpoint. Esas cifras se vuelven a verificar tras cada actualización.