Accueil/LLM privé
Déploiement et optimisation de LLM privésVotre modèle, votre matériel, votre frontière de données
Velyrix installe, quantifie, mesure et exploite des modèles à poids ouverts de frontière sur des GPU dédiés — dans le cloud Velyrix, dans votre propre espace de colocation, ou totalement isolé sur site — avec un endpoint compatible OpenAI et des objectifs contractuels de débit, de latence et de disponibilité.
Les API publiques sont pratiques jusqu'à ce que les données soient les vôtres
Données réglementées, code source propriétaire, dossiers patients, positions de marché et charges souveraines n'ont généralement pas leur place dans la file d'inférence de quelqu'un d'autre. Les modèles à poids ouverts étant désormais assez proches de la qualité de frontière, le déploiement privé devient le choix par défaut pour les charges sérieuses.
- Les données ne quittent jamais votre périmètre — aucune rétention par un tiers, aucun entraînement sur vos prompts
- Économie unitaire prévisible — coût GPU fixe au lieu d'une facturation au token qui croît avec le succès
- Stabilité de version — le modèle que vous avez validé reste celui que vous servez, jusqu'à ce que vous en décidiez autrement
- Une latence que vous maîtrisez — endpoint dans la même région, voire le même bâtiment, que l'application
- Personnalisation profonde — adaptateurs LoRA, fine-tunes métier, schémas d'outils propres et garde-fous
- Auditabilité — journalisation complète des requêtes dans votre propre SIEM, avec votre politique de rétention
# Before — public API client = OpenAI(api_key="sk-...") # After — your Velyrix private endpoint client = OpenAI( base_url="https://llm.internal.acme.com/v1", api_key=os.environ["VELYRIX_KEY"], ) resp = client.chat.completions.create( model="qwen3-235b-a22b-fp8", messages=[{"role": "user", "content": prompt}], tools=tools, stream=True, ) # Same SDK. Same schema. Your VPC, your logs, your keys.
Dix familles de modèles à poids ouverts, déployées et supportées
Velyrix maintient des recettes d'inférence validées, des profils de quantification et des lignes de base de benchmark pour chaque famille, actualisés à chaque nouveau checkpoint.
DeepSeek
Modèles phares MoE clairsemés et modèles de raisonnement, avec des variantes denses distillées pour une inférence sensible au coût.
Qwen
Séries denses et MoE d'Alibaba, avec de solides variantes multilingues, de code et vision-langage, de 0,6B à plus de 235B.
Llama
La famille à poids ouverts la plus adoptée de Meta — le choix par défaut le plus sûr pour l'outillage, les adaptateurs et les bancs d'évaluation.
OpenAI gpt-oss
La publication à poids ouverts d'OpenAI, MoE avec effort de raisonnement configurable et bon usage d'outils sur peu de GPU.
Mistral
Modèles européens avec licence permissive sur de nombreux checkpoints — denses, MoE, code et petites variantes edge.
GLM
Famille MoE bilingue de Zhipu, forte en agents et en code, avec des checkpoints plus légers.
Kimi
Modèles MoE clairsemés de classe mille milliards de paramètres de Moonshot AI, conçus pour le contexte long et les agents à outils.
MiniMax
Architectures MoE à attention efficace visées sur de très longues fenêtres de contexte avec un coût d'inférence compétitif.
Gemma
Modèles ouverts légers de Google — excellente qualité par GPU pour l'on-premise, l'edge et la classification à grand volume.
NVIDIA Nemotron
Famille de modèles ouverts optimisée par NVIDIA, réglée pour le débit sur accélérateurs NVIDIA et les workflows d'agents d'entreprise.
Les noms de modèles sont des marques de leurs propriétaires respectifs. Velyrix est un fournisseur d'infrastructure indépendant, ni affilié ni approuvé par ces éditeurs de modèles. Chaque modèle est déployé sous sa propre licence, que nous examinons avec vous avant le déploiement — voir licences de modèles.
Ce qu'il faut pour servir chaque classe de modèle
Dimensionnement indicatif d'une réplique unique pour un service en production, avec de la marge pour le cache KV à concurrence réaliste. Le dimensionnement final dépend de votre longueur de contexte, de votre concurrence et de vos objectifs de latence.
| Classe de modèle | Précision | GPU minimum | Recommandé | Débit indicatif | Infrastructure mensuelle à partir de |
|---|---|---|---|---|---|
| Dense petit (1B – 9B) | BF16 / FP8 | 1× L40S | 2× L40S / 1× H100 | 2,500 – 6,000 tok/s | $1,640 |
| Dense moyen (12B – 32B) | FP8 / AWQ-INT4 | 1× H100 80GB | 2× H100 / 2× H200 | 1,800 – 4,500 tok/s | $3,300 |
| Dense grand (70B – 123B) | FP8 | 2× H200 | 4× H200 / 8× H100 | 1,400 – 3,200 tok/s | $10,400 |
| Dense très grand (405B) | FP8 | 8× H200 | 8× B200 | 900 – 2,100 tok/s | $23,900 |
| MoE clairsemé (100B – 250B au total) | FP8 | 4× H200 | 8× H200 | 3,000 – 9,000 tok/s | $18,400 |
| MoE clairsemé (400B – 700B au total) | FP8 / FP4 | 8× H200 | 8× B200 / 16× H200 | 4,000 – 14,000 tok/s | $23,900 |
| MoE clairsemé (classe 1T au total) | FP8 / FP4 | 16× H200 | 8× B300 / GB300 partition | 6,000 – 20,000 tok/s | $44,800 |
| Vision-langage (toute taille) | BF16 / FP8 | +1 GPU pour la tour vision | Réplique d'encodeur dédiée | Selon la charge | Sur devis |
Le débit correspond au total de tokens de sortie par seconde sur des requêtes concurrentes, mesuré sur du matériel de référence Velyrix avec des prompts représentatifs de la production. Vos chiffres sont mesurés sur votre charge avant contrat, et le chiffre convenu devient un objectif de niveau de service.
La différence entre faire tourner un modèle et le faire tourner bien
Un conteneur par défaut sur huit GPU laisse généralement deux à cinq fois le débit sur la table. Les missions d'optimisation Velyrix règlent toute la chaîne, du tokenizer à la carte réseau.
Quantification
Profils FP8, NVFP4/MXFP4, AWQ, GPTQ et SmoothQuant avec tests de régression de précision sur votre propre jeu d'évaluation avant toute mise en production.
Stratégie de parallélisme
Dispositions de parallélisme tensoriel, pipeline, d'experts et de données choisies par modèle et par topologie GPU, y compris le placement d'experts conscient de NVLink pour les MoE.
Batching continu
Attention paginée, prefill par blocs et réglage de l'ordonnanceur pour maintenir une forte occupation GPU sans dépasser votre objectif de temps jusqu'au premier token.
Désagrégation prefill / decode
Pools de prefill et de decode séparés avec transfert de KV, afin que les longs prompts cessent de bloquer le décodage interactif sur du matériel partagé.
Décodage spéculatif
Modèles brouillons, spéculation de type EAGLE et n-grammes réglés sur votre taux d'acceptation — couramment 1,5 à 2,5× sur des charges interactives.
Ingénierie du cache KV
Cache de préfixes et radix, déchargement du cache vers la mémoire hôte ou le NVMe, et KV quantifié pour étendre le contexte sans GPU supplémentaires.
Autoscaling et routage
Routage multi-répliques avec équilibrage conscient du cache, autoscaling sur la profondeur de file et classes de priorité pour le trafic interactif face au batch.
Banc d'évaluation
Votre propre jeu de référence branché dans la CI, afin que chaque modèle, quantification ou mise à jour de moteur passe un contrôle de qualité, pas seulement de vitesse.
Choix du moteur
vLLM, SGLang, TensorRT-LLM ou NVIDIA Dynamo choisis par charge et comparés directement sur votre trafic avant tout engagement.
Trois façons de tracer votre frontière de données
Sur le cloud GPU Velyrix
GPU mono-locataires dans une région Velyrix, réseau privé vers votre VPC ou point d'interconnexion, pile exploitée par Velyrix.
- Opérationnel en quelques jours
- Mise à l'échelle élastique des répliques
- Exploitation Velyrix 24×7
- Résidence régionale des données
Dans votre espace de colocation
Votre matériel, votre cage, déployés et exploités par Velyrix dans le cadre d'un service infogéré.
- Vous possédez les actifs
- Velyrix exploite la pile
- Modèle capex
- Contrôle physique total
Sur site et isolé du réseau
Déploiement totalement déconnecté avec miroirs hors ligne des modèles et des conteneurs, et aucune télémétrie sortante.
- Aucune dépendance à internet
- Registre et mises à jour hors ligne
- Adapté aux environnements classifiés ou réglementés
- Formation sur site à la livraison
Adaptation, recherche et agents
- Pré-entraînement continu sur des corpus métier où le vocabulaire et le style comptent plus que le suivi d'instructions
- Fine-tuning supervisé et LoRA avec service multi-adaptateurs, pour qu'un seul modèle de base héberge des dizaines d'adaptateurs de tâche
- Optimisation par préférences — workflows DPO, GRPO et modèle de récompense sur vos propres données notées
- Distillation d'un grand modèle enseignant vers un petit modèle élève, divisant le coût d'inférence par un ordre de grandeur
- Recherche augmentée avec recherche vectorielle et hybride, stratégie de découpage, reclassement et citations obligatoires
- Infrastructure d'agents — schémas d'outils, sortie structurée, exécution en bac à sable et serveurs d'outils compatibles MCP
- Garde-fous — classification des entrées et sorties, expurgation des données personnelles, détection de jailbreak et journalisation complète des prompts
Licences et gouvernance des modèles
Poids ouverts ne signifie pas usage sans restriction. Avant le déploiement, Velyrix examine la licence de chaque modèle que vous comptez exécuter et documente les obligations qui en découlent.
- Classification de licence — permissive, communautaire ou termes spécifiques
- Restrictions d'usage acceptable et de domaine d'application
- Obligations d'attribution, de dénomination et de redistribution
- Seuils d'usage commercial et conditions sur les œuvres dérivées
- Traçabilité de provenance pour chaque checkpoint et sa source
Velyrix fournit des services d'infrastructure et d'ingénierie et n'accorde aucun droit sur un modèle tiers. Le client reste le licencié des modèles qu'il choisit de déployer et demeure responsable du respect de ces licences et de la réglementation IA applicable, y compris le règlement européen sur l'IA le cas échéant. Velyrix accompagne ce processus par de la documentation et des contrôles techniques.
Comment se déroule un programme de LLM privé
Pilote
2 à 3 semaines
- Atelier de sélection de modèle
- Déploiement d'une réplique
- Benchmark face à votre jeu d'évaluation
- Modèle de coût et de dimensionnement
- Rapport de décision
à partir de 27 000 $
Déploiement en production
6 à 10 semaines
- Architecture HA multi-répliques
- Quantification et réglage du moteur
- Passerelle, authentification, quotas, journalisation
- Garde-fous et CI d'évaluation
- Runbooks et formation des équipes
à partir de 83 500 $
Service LLM infogéré
En continu
- Exploitation de l'endpoint 24×7
- SLA de débit et de latence
- Mises à jour de modèle et de moteur
- Rapports de capacité et de coût
- Revue d'optimisation trimestrielle
à partir de 10 500 $ / mois
Honoraires indicatifs de services professionnels, hors infrastructure GPU et hors taxes. Le périmètre est confirmé après une session de cadrage.
Les GPU sont à vous. Nous les exploitons.
Achetez vos serveurs NVIDIA auprès de l'OEM ou du distributeur de votre choix, expédiez-les vers un centre de données Velyrix et nous nous occupons du reste : déploiement, réseau, refroidissement, supervision et support. Ou louez les nôtres. Dans les deux cas, vous recevez un plan sous un jour ouvré.
Questions fréquentes
Quels LLM Velyrix peut-il déployer pour nous ?
Velyrix maintient des recettes de déploiement validées pour dix familles à poids ouverts : DeepSeek, Qwen, Llama, OpenAI gpt-oss, Mistral, GLM, Kimi, MiniMax, Gemma et NVIDIA Nemotron, y compris leurs variantes vision-langage, code et raisonnement. D'autres modèles à poids ouverts peuvent être intégrés sur demande.
Combien de GPU faut-il pour exécuter un LLM privé ?
Un modèle de 7B à 9B tourne confortablement sur une seule L40S ou H100. Un modèle dense de 70B demande généralement deux à quatre H200 en FP8. Les grands MoE clairsemés de 400B à 700B nécessitent environ huit H200 ou huit B200, et les modèles de classe 1T sont servis sur des partitions B300 ou GB300. Le dimensionnement final dépend de la longueur de contexte, de la concurrence et des objectifs de latence.
La quantification dégrade-t-elle la qualité du modèle ?
Le FP8 est généralement quasi sans perte sur les checkpoints modernes, et NVFP4/MXFP4 ainsi que la quantification de poids sur 4 bits échangent un peu de qualité contre d'importants gains de débit et de mémoire. Velyrix mesure toujours l'écart sur votre propre jeu d'évaluation et le communique avant qu'une version quantifiée passe en production.
Le déploiement peut-il être totalement isolé du réseau ?
Oui. Les déploiements isolés sont livrés avec les poids de modèles hors ligne, un registre de conteneurs interne, des miroirs de paquets hors ligne et aucune télémétrie sortante. Les mises à jour sont livrées sur supports signés et vérifiés via votre processus de gestion du changement.
Proposez-vous du fine-tuning en plus de l'inférence ?
Oui — pré-entraînement continu, fine-tuning supervisé, adaptateurs LoRA avec service multi-adaptateurs, optimisation par préférences telle que DPO et GRPO, et distillation d'un grand modèle enseignant vers un élève plus petit pour réduire le coût d'inférence.
Qui est responsable de la licence du modèle ?
Le client est le licencié de tout modèle tiers qu'il choisit de déployer. Velyrix fournit des services d'infrastructure et d'ingénierie, examine avec vous les termes de licence de chaque modèle avant le déploiement et documente les obligations qui en découlent, mais n'accorde aucun droit sur des modèles tiers.
Sur quelles performances vous engagez-vous ?
Après une phase de benchmark sur votre propre trafic, Velyrix contractualise des chiffres précis de débit agrégé en tokens par seconde, de temps p95 jusqu'au premier token, de latence p95 entre tokens et de disponibilité mensuelle de l'endpoint. Ces chiffres sont revérifiés après chaque mise à jour.