Inicio/LLM privado
Despliegue y optimización de LLM privadosTu modelo, tu hardware, tu frontera de datos
Velyrix instala, cuantiza, mide y opera modelos de pesos abiertos de frontera sobre GPU dedicadas: en la nube de Velyrix, en tu propio espacio de colocation o totalmente aislado en tus instalaciones, con un endpoint compatible con OpenAI y objetivos contratados de rendimiento, latencia y disponibilidad.
Las API públicas son cómodas hasta que los datos son tuyos
Los datos regulados, el código propietario, los historiales clínicos, las posiciones de mercado y las cargas soberanas rara vez deberían estar en la cola de inferencia de otro. Con modelos de pesos abiertos ya lo bastante cerca de la calidad de frontera, el despliegue privado se ha convertido en la opción por defecto para cargas serias.
- Los datos nunca salen de tu perímetro — sin retención por terceros, sin entrenamiento con tus prompts
- Economía unitaria predecible — coste fijo de GPU en lugar de facturación por token que crece con el éxito
- Estabilidad de versión — el modelo que validaste sigue siendo el que sirves, hasta que tú decidas otra cosa
- Latencia bajo tu control — endpoint en la misma región, o en el mismo edificio, que la aplicación
- Personalización profunda — adaptadores LoRA, fine-tunes de dominio, esquemas de herramientas propios y guardarraíles
- Auditabilidad — registro completo de peticiones en tu propio SIEM, con tu política de retención
# Before — public API client = OpenAI(api_key="sk-...") # After — your Velyrix private endpoint client = OpenAI( base_url="https://llm.internal.acme.com/v1", api_key=os.environ["VELYRIX_KEY"], ) resp = client.chat.completions.create( model="qwen3-235b-a22b-fp8", messages=[{"role": "user", "content": prompt}], tools=tools, stream=True, ) # Same SDK. Same schema. Your VPC, your logs, your keys.
Diez familias de modelos de pesos abiertos, desplegadas y soportadas
Velyrix mantiene recetas de inferencia validadas, perfiles de cuantización y líneas base de benchmark para cada familia, actualizadas conforme se publican nuevos checkpoints.
DeepSeek
Modelos MoE dispersos insignia y modelos de razonamiento, incluidas variantes densas destiladas para inferencia sensible al coste.
Qwen
Series densas y MoE de Alibaba con fuertes variantes multilingües, de programación y visión-lenguaje, de 0,6B a más de 235B.
Llama
La familia de pesos abiertos más adoptada de Meta: la opción por defecto más segura para herramientas, adaptadores y bancos de evaluación.
OpenAI gpt-oss
La versión de pesos abiertos de OpenAI, MoE con esfuerzo de razonamiento configurable y buen uso de herramientas con pocas GPU.
Mistral
Modelos europeos con licencia permisiva en muchos checkpoints: densos, MoE, de código y variantes pequeñas para el borde.
GLM
Familia MoE bilingüe de Zhipu con fuerte rendimiento agéntico y de programación, además de checkpoints más ligeros.
Kimi
Modelos MoE dispersos de clase billón de parámetros de Moonshot AI, diseñados para contexto largo y agentes con llamada a herramientas.
MiniMax
Arquitecturas MoE de atención eficiente orientadas a ventanas de contexto muy largas con un coste de inferencia competitivo.
Gemma
Modelos abiertos ligeros de Google: excelente calidad por GPU para on-premise, borde y clasificación de alto volumen.
NVIDIA Nemotron
Familia de modelos abiertos optimizada por NVIDIA, ajustada para rendimiento en aceleradores NVIDIA y flujos de agentes empresariales.
Los nombres de modelo son marcas de sus respectivos propietarios. Velyrix es un proveedor de infraestructura independiente y no está afiliado ni respaldado por estos editores de modelos. Cada modelo se despliega bajo su propia licencia, que revisamos contigo antes del despliegue: consulta licencias de modelo.
Lo que hace falta para servir cada clase de modelo
Dimensionado indicativo de una sola réplica para servicio en producción, con margen para la caché KV a concurrencia realista. El dimensionado final depende de tu longitud de contexto, tu concurrencia y tus objetivos de latencia.
| Clase de modelo | Precisión | GPU mínimas | Recomendado | Rendimiento indicativo | Infraestructura mensual desde |
|---|---|---|---|---|---|
| Denso pequeño (1B – 9B) | BF16 / FP8 | 1× L40S | 2× L40S / 1× H100 | 2,500 – 6,000 tok/s | $1,640 |
| Denso medio (12B – 32B) | FP8 / AWQ-INT4 | 1× H100 80GB | 2× H100 / 2× H200 | 1,800 – 4,500 tok/s | $3,300 |
| Denso grande (70B – 123B) | FP8 | 2× H200 | 4× H200 / 8× H100 | 1,400 – 3,200 tok/s | $10,400 |
| Denso muy grande (405B) | FP8 | 8× H200 | 8× B200 | 900 – 2,100 tok/s | $23,900 |
| MoE disperso (100B – 250B total) | FP8 | 4× H200 | 8× H200 | 3,000 – 9,000 tok/s | $18,400 |
| MoE disperso (400B – 700B total) | FP8 / FP4 | 8× H200 | 8× B200 / 16× H200 | 4,000 – 14,000 tok/s | $23,900 |
| MoE disperso (clase 1T total) | FP8 / FP4 | 16× H200 | 8× B300 / GB300 partition | 6,000 – 20,000 tok/s | $44,800 |
| Visión-lenguaje (cualquier tamaño) | BF16 / FP8 | +1 GPU para la torre de visión | Réplica de codificador dedicada | Según la carga | A consultar |
El rendimiento es el total de tokens de salida por segundo entre peticiones concurrentes, medido en hardware de referencia de Velyrix con prompts representativos de producción. Tus cifras se miden con tu propia carga antes del contrato, y la cifra acordada pasa a ser un objetivo de nivel de servicio.
La diferencia entre ejecutar un modelo y ejecutarlo bien
Un contenedor por defecto en ocho GPU suele dejar entre dos y cinco veces el rendimiento sobre la mesa. Los proyectos de optimización de Velyrix ajustan toda la ruta, del tokenizador a la NIC.
Cuantización
Perfiles FP8, NVFP4/MXFP4, AWQ, GPTQ y SmoothQuant con pruebas de regresión de precisión frente a tu propio conjunto de evaluación antes de pasar a producción.
Estrategia de paralelismo
Disposiciones de paralelismo tensorial, de pipeline, de expertos y de datos elegidas por modelo y topología de GPU, incluida la colocación de expertos consciente de NVLink para MoE.
Batching continuo
Atención paginada, prefill por bloques y ajuste del planificador para mantener alta ocupación de GPU sin incumplir tu objetivo de tiempo hasta el primer token.
Desagregación prefill / decode
Grupos separados de prefill y decode con transferencia de KV, para que los prompts largos dejen de bloquear la decodificación interactiva en hardware compartido.
Decodificación especulativa
Modelos borrador, especulación tipo EAGLE y n-gramas ajustados a tu tasa de aceptación: habitualmente 1,5–2,5× en cargas interactivas.
Ingeniería de caché KV
Caché de prefijos y radix, descarga de caché a memoria del host o NVMe y KV cuantizado para ampliar el contexto sin GPU adicionales.
Autoescalado y enrutamiento
Enrutamiento multi-réplica con balanceo consciente de caché, autoescalado por profundidad de cola y clases de prioridad para tráfico interactivo frente a por lotes.
Banco de evaluación
Tu propio conjunto de referencia integrado en CI para que cada modelo, cuantización o actualización de motor pase por un control de calidad, no solo de velocidad.
Selección de motor
vLLM, SGLang, TensorRT-LLM o NVIDIA Dynamo elegidos por carga y comparados cara a cara con tu tráfico antes de comprometernos.
Tres formas de trazar tu frontera de datos
En la nube GPU de Velyrix
GPU de un solo inquilino en una región de Velyrix, red privada hacia tu VPC o punto de interconexión, pila operada por Velyrix.
- Operativo en días
- Escalado elástico de réplicas
- Operación Velyrix 24×7
- Residencia de datos regional
En tu espacio de colocation
Tu hardware, tu jaula, desplegado y operado por Velyrix bajo un acuerdo de servicio gestionado.
- Tú eres propietario de los activos
- Velyrix opera la pila
- Modelo de capex
- Control físico total
On-premise y aislado de la red
Despliegue totalmente desconectado con espejos offline de modelos y contenedores, y sin telemetría saliente.
- Sin dependencia de internet
- Registro y actualizaciones offline
- Apto para entornos clasificados o regulados
- Formación presencial en la entrega
Adaptación, recuperación y agentes
- Preentrenamiento continuado sobre corpus de dominio donde el vocabulario y el estilo importan más que el seguimiento de instrucciones
- Fine-tuning supervisado y LoRA con servicio multiadaptador, para que un solo modelo base aloje decenas de adaptadores de tarea
- Optimización por preferencias — flujos DPO, GRPO y de modelo de recompensa sobre tus propios datos valorados
- Destilación de un profesor grande a un alumno pequeño, reduciendo el coste de inferencia en un orden de magnitud
- Generación aumentada por recuperación con búsqueda vectorial e híbrida, estrategia de fragmentación, reordenación y citas obligatorias
- Infraestructura de agentes — esquemas de herramientas, salida estructurada, ejecución en sandbox y servidores de herramientas compatibles con MCP
- Guardarraíles — clasificación de entrada y salida, redacción de PII, detección de jailbreak y registro completo de auditoría de prompts
Licencias y gobernanza de modelos
Pesos abiertos no significa uso sin restricciones. Antes del despliegue, Velyrix revisa la licencia de cada modelo que pretendes ejecutar y documenta las obligaciones que conlleva.
- Clasificación de licencia: permisiva, comunitaria o de términos propios
- Restricciones de uso aceptable y de campo de aplicación
- Obligaciones de atribución, denominación y redistribución
- Umbrales de uso comercial y condiciones sobre obras derivadas
- Registro de procedencia de cada checkpoint y su origen
Velyrix presta servicios de infraestructura e ingeniería y no otorga derechos sobre ningún modelo de terceros. El cliente sigue siendo el licenciatario de los modelos que decide desplegar y es responsable del cumplimiento de esas licencias y de la normativa de IA aplicable, incluida la Ley de IA de la UE cuando corresponda. Velyrix apoya ese proceso con documentación y controles técnicos.
Cómo se desarrolla un programa de LLM privado
Piloto
2–3 semanas
- Taller de selección de modelo
- Despliegue de una sola réplica
- Benchmark frente a tu conjunto de evaluación
- Modelo de coste y dimensionado
- Informe de continuidad
desde 27.000 $
Despliegue en producción
6–10 semanas
- Arquitectura HA multi-réplica
- Cuantización y ajuste del motor
- Gateway, autenticación, cuotas y registro
- Guardarraíles y CI de evaluación
- Runbooks y formación del equipo
desde 83.500 $
Servicio LLM gestionado
Continuo
- Operación del endpoint 24×7
- SLA de rendimiento y latencia
- Actualizaciones de modelo y motor
- Informes de capacidad y coste
- Revisión trimestral de optimización
desde 10.500 $ / mes
Honorarios indicativos de servicios profesionales, sin incluir la infraestructura GPU ni impuestos. El alcance se confirma tras una sesión de descubrimiento.
Las GPU son suyas. Nosotros las operamos.
Compre sus servidores NVIDIA al OEM o distribuidor que prefiera, envíelos a un centro de datos de Velyrix y nosotros nos ocupamos del resto: despliegue, red, refrigeración, monitorización y soporte. O alquile los nuestros. En cualquier caso, recibirá un plan en un día hábil.
Preguntas frecuentes
¿Qué LLM puede desplegar Velyrix por nosotros?
Velyrix mantiene recetas de despliegue validadas para diez familias de pesos abiertos: DeepSeek, Qwen, Llama, OpenAI gpt-oss, Mistral, GLM, Kimi, MiniMax, Gemma y NVIDIA Nemotron, incluidas sus variantes de visión-lenguaje, programación y razonamiento. Otros modelos de pesos abiertos pueden incorporarse bajo petición.
¿Cuántas GPU necesitamos para ejecutar un LLM privado?
Un modelo de 7B-9B se sirve cómodamente en una sola L40S o H100. Un modelo denso de 70B suele necesitar de dos a cuatro H200 en FP8. Los grandes MoE dispersos de 400B-700B requieren unas ocho H200 u ocho B200, y los modelos de clase 1T se sirven normalmente en particiones B300 o GB300. El dimensionado final depende de la longitud de contexto, la concurrencia y los objetivos de latencia.
¿La cuantización perjudica la calidad del modelo?
FP8 suele ser prácticamente sin pérdida en checkpoints modernos, y NVFP4/MXFP4 y la cuantización de pesos de 4 bits intercambian algo de calidad por grandes ganancias de rendimiento y memoria. Velyrix siempre mide la diferencia frente a tu propio conjunto de evaluación y la reporta antes de que una versión cuantizada pase a producción.
¿Puede el despliegue estar totalmente aislado de la red?
Sí. Los despliegues aislados incluyen pesos de modelo offline, un registro de contenedores interno, espejos de paquetes offline y ninguna telemetría saliente. Las actualizaciones se entregan como soportes firmados y verificados a través de tu proceso de control de cambios.
¿Ofrecéis fine-tuning además de inferencia?
Sí: preentrenamiento continuado, fine-tuning supervisado, adaptadores LoRA con servicio multiadaptador, optimización por preferencias como DPO y GRPO, y destilación de un modelo profesor grande a un alumno más pequeño para abaratar la inferencia.
¿Quién es responsable de la licencia del modelo?
El cliente es el licenciatario de cualquier modelo de terceros que decida desplegar. Velyrix presta servicios de infraestructura e ingeniería, revisa contigo los términos de licencia de cada modelo antes del despliegue y documenta las obligaciones resultantes, pero no otorga derechos sobre modelos de terceros.
¿A qué rendimiento os comprometéis?
Tras una fase de benchmarking con tu propio tráfico, Velyrix contrata cifras concretas de rendimiento agregado en tokens por segundo, tiempo p95 hasta el primer token, latencia p95 entre tokens y disponibilidad mensual del endpoint. Esas cifras se vuelven a verificar tras cada actualización.