Déployer Mistral on-premise : de l'installation à la mise en production
Déployer un modèle Mistral on-premise ou en cloud privé souverain, hébergé en France. Choix du modèle, dimensionnement GPU, API privée compatible OpenAI, sans lock-in.
Mistral est un modèle français à poids ouverts, ce qui en fait le choix naturel pour une IA souveraine : il est performant, sa licence permet l'usage commercial, et vous pouvez l'héberger vous-même.
Ce guide explique comment le déployer on-premise ou en cloud privé souverain chez France Nuage, sans envoyer le moindre prompt à une API tierce.
Quel modèle Mistral selon le besoin
La famille couvre plusieurs tailles. On choisit selon la tâche et le matériel disponible.
Mistral 7B : le point d'entrée. Excellent pour le résumé, la classification, l'extraction et un assistant interne. Tient sur un seul GPU, même quantifié sur du matériel modeste.
Mixtral (mélange d'experts) : meilleure qualité de raisonnement à coût d'inférence contenu, car seule une partie des paramètres s'active par requête.
Modèles plus grands : pour les tâches exigeantes (rédaction longue, raisonnement complexe), au prix de plus de VRAM et d'une latence supérieure.
Commencez petit. Un Mistral 7B bien intégré rend souvent plus de services qu'un gros modèle mal dimensionné qui répond lentement.
Déploiement on-premise ou cloud privé
Deux options, le même logiciel :
Cloud privé souverainGPU hébergé en FranceOn-premiseGPU dans vos locauxAPI privéeformat OpenAIVos applications
Dans les deux cas, l'API expose le format OpenAI. Vos bibliothèques et vos intégrations existantes pointent vers la nouvelle URL et continuent de fonctionner.
Dimensionner le GPU
Le modèle décide du matériel. Quelques repères pour Mistral 7B :
fp16 : environ 16 Go de VRAM. Un GPU de 24 Go laisse de la marge pour le contexte.
quantifié 8 bits : environ 8 à 10 Go.
quantifié 4 bits : environ 5 à 7 Go, jouable sur du matériel grand public.
Plus le contexte (la longueur des prompts) est long, plus il consomme de mémoire en plus du modèle. Si vous traitez de longs documents, prévoyez de la marge ou un GPU plus généreux.
Mettre en service
Le déroulé type est le même quel que soit le mode :
Choisir le modèle et la taille de GPU avec l'équipe France Nuage ou depuis la console.