IA souveraine et FinOps

Passerelle IA souveraine : une API, tous vos modèles, coûts centralisés

Un seul endpoint compatible OpenAI pour Mistral, Llama, Qwen, GLM et DeepSeek, un routage cost-aware et la gouvernance des coûts d'IA par équipe. C'est la couche qui fait tourner notre Private GPT.

Mis à jour le 4 août 2026

Une APIcompatible OpenAIRouteur IAcost-awareCoûts consolidésbudget par équipeFrance NuageMistralLlamaQwenGLMDeepSeek

La passerelle IA de France Nuage expose un endpoint unique, compatible avec le format OpenAI, qui route vos requêtes vers Mistral, Llama, Qwen, GLM ou DeepSeek selon la tâche. Chaque appel est rattaché à une équipe et à un budget : la consommation est centralisée. Le routage reste fail-closed. Si le modèle souverain ciblé tombe, la requête est refusée, jamais redirigée hors de France.

Une API unifiée, compatible OpenAI

La passerelle expose un seul endpoint, au format de l'API OpenAI. Vos applications lui parlent comme elles parleraient à OpenAI ; derrière, elle distribue les requêtes vers plusieurs modèles open source hébergés en France.

  • Mistral : un modèle français à poids ouverts, performant et à licence commerciale.
  • Llama, Qwen, GLM, DeepSeek : pour couvrir d'autres profils de tâches comme le raisonnement, le code, le contexte long ou le multilingue.
  • Un seul contrat d'API pour tous : vous changez de modèle en changeant un paramètre, sans réécrire votre code.

Vos outils existants (SDK OpenAI, bibliothèques, agents) fonctionnent sans adaptation : c'est l'URL de base et la clé qui changent ; votre code reste tel quel.

Routing multi-modèles, pensé pour le coût

Toutes les requêtes ne méritent pas le plus gros modèle. La passerelle applique un routage cost-aware : une tâche simple (classification, extraction, résumé court) part vers un petit modèle rapide et peu coûteux ; une tâche exigeante vers un modèle plus capable.

  • Distribution pondérée : vous répartissez le trafic entre plusieurs modèles selon des poids, par exemple pour tester un nouveau modèle sur une fraction des appels.
  • Failover local ↔ cloud UE : si le modèle souverain ciblé est indisponible, la requête peut basculer vers une autre instance souveraine, une autre région française ou un modèle hébergé dans l'Union européenne.
  • Un gain qui se mesure : bien réglé, ce routage peut réduire la latence et le volume de tokens facturés, selon le mix de vos requêtes. Le gain dépend de votre usage réel et se constate à la mesure, sans promesse chiffrée d'avance.

Gouvernance des coûts : le FinOps de l'IA

Sans garde-fous, une facture d'IA générative dérive vite, et personne ne sait quelle équipe consomme quoi. La passerelle centralise cette gouvernance.

  • Clés virtuelles : chaque équipe, projet ou application reçoit sa propre clé, sans exposer les identifiants des modèles sous-jacents.
  • Plafonds et budgets : vous fixez un budget mensuel ou un plafond de dépense par clé. Au-delà, les appels sont refusés plutôt que de laisser filer la facture.
  • Coûts consolidés : la consommation de tous les modèles est agrégée au même endroit, ventilée par équipe et par projet. Le DSI et le DAF voient une seule ligne de coût consolidée au lieu de dix factures éparses.

C'est ce qui transforme « on ne sait pas ce que l'IA nous coûte » en une donnée pilotable, à la manière du FinOps sur le cloud.

Sécurité in-path et posture fail-closed

La passerelle se trouve sur le chemin de chaque requête. Cette position permet d'appliquer des contrôles avant que le prompt n'atteigne un modèle.

  • Inspection in-path : les appels passent par un point unique où l'on peut journaliser, filtrer et appliquer des règles.
  • Fail-closed sur les données personnelles : la posture par défaut est de refuser plutôt que de laisser passer. Si une règle de routage ne peut pas être satisfaite en restant souverain, la requête est bloquée au lieu d'être redirigée hors de France.

C'est une posture de sécurité, un ensemble de règles configurées ; elle ne constitue pas une garantie absolue. Elle réduit la surface d'erreur ; elle ne remplace pas votre propre analyse de risque.

Souveraineté de bout en bout

Une passerelle ne vaut que par ce qu'elle route. Ici, la passerelle et les modèles qu'elle appelle restent en France ou dans l'Union européenne.

  • Le point d'entrée est hébergé sur une infrastructure française.
  • Les modèles cibles tournent sur du GPU hébergé en France ou dans l'UE, hors du champ du CLOUD Act américain.
  • Le failover reste borné à des instances souveraines, sans bascule silencieuse vers une API tierce hors UE.

Une passerelle IA souveraine contrôle le chemin de données de bout en bout, là où une passerelle générique s'arrête à l'entrée.

La couche qui propulse notre Private GPT

Cette passerelle est la couche de routing et de gouvernance de notre offre Private GPT, notre application de chat et de RAG, prête pour vos équipes.

Private GPT fournit l'interface (chat, RAG sur vos documents, gestion des accès) ; la passerelle apporte le multi-modèles, le routage cost-aware et la gouvernance des coûts en dessous. Vous pouvez aussi appeler la passerelle directement depuis vos propres applications.

Questions fréquentes

Qu'est-ce qu'une passerelle IA souveraine ?

Un point d'entrée unique, hébergé en France, qui reçoit vos requêtes d'IA et les route vers plusieurs modèles open source (Mistral, Llama, Qwen, GLM, DeepSeek) tournant eux aussi en France ou dans l'UE. « Souveraine » signifie que la passerelle et les modèles restent hors du champ des lois extraterritoriales américaines.

Comment centraliser et plafonner les coûts d'un LLM ?

Chaque équipe ou projet reçoit une clé virtuelle assortie d'un budget et d'un plafond. La consommation de tous les modèles est agrégée au même endroit, ventilée par équipe. Au-delà du plafond, les appels sont refusés plutôt que de laisser filer la facture.

Peut-on changer de modèle sans réécrire le code ?

Oui. L'API est au format OpenAI. Changer de modèle revient à changer un paramètre côté passerelle ou dans l'appel ; votre code, vos SDK et vos agents restent inchangés.

Que se passe-t-il si un modèle tombe ?

Le routage est fail-closed. Si le modèle souverain ciblé est indisponible, la requête peut basculer vers une autre instance souveraine (France ou UE) ; à défaut, elle est refusée. Elle n'est jamais redirigée en silence vers une API hors UE.

Mes données personnelles peuvent-elles partir vers un modèle tiers ?

La posture par défaut est fail-closed. Si une requête ne peut pas être traitée en restant souverain, elle est bloquée. C'est une posture de sécurité configurée qui ne constitue pas une garantie absolue ; elle réduit le risque de fuite, sans remplacer votre analyse RGPD.

Une passerelle IA souveraine pour vos équipes

Un endpoint compatible OpenAI, le multi-modèles souverain et la gouvernance des coûts. Parlons de votre cas.