IA souveraine en France : le guide chiffré (coût + conformité)
Le coût réel, du poste de travail au datacenter, et le volet conformité (RGPD/HDS/SNDS) que personne ne chiffre.
Juin 2026 — par Jérôme Jacq, conseil IA & FinOps · jeromejacq.com
On me pose partout la même question : « Peut-on faire tourner une IA performante chez nous, en France, sans envoyer nos données aux US ou en Chine ? » La réponse courte : oui, et moins cher qu'on ne le croit — mais le vrai sujet n'est ni le modèle ni le prix au token. Voici le guide complet, du poste de travail au datacenter, avec le volet conformité que personne ne chiffre.
1. Souverain ne veut pas dire en retard (ni neutre)
Le meilleur modèle ouvert de juin 2026, GLM-5.2 (Z.ai, licence MIT, poids téléchargeables), atteint de l'ordre de 85 % de la qualité de Claude Opus et dépasse Claude Sonnet sur l'indice Artificial Analysis. Mistral Large 3 (Apache 2.0, conçu en France) est juste derrière sur le code pur. Conclusion : la souveraineté ne coûte plus la moitié de la qualité.
Deux nuances qui changent la décision :
- Souveraineté des données ≠ souveraineté du modèle. Héberger GLM en France coupé d'Internet protège vos données ; mais son alignement (entraîné en Chine) est gravé dans les poids. Pour une neutralité pleine, c'est Mistral.
- Le modèle est une commodité ; le harnais ne l'est pas. Un bon agent (routage, mémoire, sous-agents, auto-vérification) sur GLM bat un mauvais harnais sur Opus. 80 % de la qualité perçue vient de l'ingénierie autour du modèle.
2. Le mur que personne n'anticipe : l'infrastructure
« On a déjà des serveurs, du Docker, du Kubernetes — on fera tourner le modèle dessus. » Non. La génération de texte est limitée par la bande passante mémoire, pas par le calcul. Un CPU plafonne à ~5 mots/seconde (une réponse en 1-2 min, pour un seul utilisateur) : inexploitable en interactif. Il faut des nœuds GPU dédiés (HBM à 2 000-4 800 Go/s). Votre infra orchestre l'inférence ; elle ne l'exécute pas à vitesse utile sans GPU.
3. Acheter, louer ou payer à l'usage — les ordres de grandeur
| Option | Coût (juin 2026) | Souveraineté | Recommandé pour |
|---|---|---|---|
| API souveraine à l'usage (ex. GLM-5.2 sur Scaleway, HDS) | ~30 €/mois en usage modéré | France, HDS | Démarrage, la plupart des cas |
| Nœud GPU managé dédié | ~2 500 €/mois (1 GPU) | France, HDS | Volume moyen constant |
| Louer 8 GPU (modèle complet) | ~16 000–26 000 €/mois | France, HDS/SecNumCloud | Gros volume + contrainte réglementaire |
| Acheter le serveur 8 GPU | 300 000–465 000 € + ~15 000 €/mois | Maximale (sur site) | Très gros volume constant |
La révélation : une « IA souveraine hébergée en France » existe déjà comme produit fini à ~30 €/mois, sans acheter ni louer la moindre machine. Le serveur à 300 k€ ne se justifie qu'à très gros volume constant ou sous certification stricte.
4. Le piège FinOps : « le moins cher au token » ≠ « le moins cher pour vous »
Au token, un modèle souverain est imbattable. Mais la plupart des gros utilisateurs de Claude sont sur un forfait plat (~186 €/mois), redoutablement compétitif au-delà de ~34 M de tokens de sortie/mois. Le prix unitaire ne décide de rien tant qu'on n'a pas modélisé votre volume et votre mode de facturation. Un usage agentique soutenu franchit ce seuil sans effort — et un agent consomme 5 à 10× les tokens d'une simple question-réponse.
5. Le vrai levier : le routage multi-modèle (et la souveraineté « à la carte »)
Un harnais moderne route chaque tâche vers le modèle qui la mérite :
| Type de tâche | Part du volume | Modèle |
|---|---|---|
| Mécanique (reformuler, extraire, classer, résumer) | ~70-80 % | GLM-5.2 / Mistral souverain, peu cher |
| Raisonnement difficile (architecture, analyse, code) | ~20-30 % | Modèle frontier, au prix fort mais seulement là |
Router 80 % des appels vers le souverain divise la facture par 2 à 3. Et le même routage règle la souveraineté sélective : les données sensibles restent sur le modèle souverain hébergé chez vous, seules les requêtes non confidentielles partent vers un modèle frontier. La souveraineté devient un curseur par tâche, pas un interrupteur tout-ou-rien.
6. Le volet que personne ne chiffre : la conformité
C'est ici que « souverain » cesse d'être un mot marketing. Selon la sensibilité, le cadre légal diffère radicalement :
- Donnée non personnelle / peu sensible : un LLM US est légal (encadrement CCT ou Data Privacy Framework). Le souverain devient un choix de coût/contrôle, pas d'obligation.
- Donnée personnelle : transfert hors-UE encadré ; pseudonymisation + analyse d'impact recommandées. Une API souveraine EU simplifie tout.
- Donnée de santé : régime strict. Hébergement HDS obligatoire (décret du 24 mars 2026 : stockage UE/EEE exclusif au 27 sept. 2026). Pour les données du SNDS, aucun transfert ni accès hors-UE n'est admis — même « anonymisé ». Et attention : masquer des identifiants = pseudonymisation (qui reste soumise au RGPD), pas anonymisation — le Conseil d'État a confirmé 1,8 M€ de sanctions en 2026 pour avoir confondu les deux.
Traduction opérationnelle : plus la donnée est sensible, plus la seule option licite est l'inférence 100 % on-premise sur infrastructure certifiée (HDS, voire SecNumCloud). C'est exactement là qu'un routage par sensibilité paie : frontier pour les 80 % anodins, souverain verrouillé pour les 20 % critiques.
7. La grille de décision
| Votre situation | Le bon choix |
|---|---|
| Usage variable, peu d'utilisateurs | API/abonnement frontier — zéro infra, qualité max |
| Gros volume agentique constant | Forfait frontier fixe, souvent déjà optimal |
| Coût et souveraineté à optimiser | Routage multi-modèle : souverain par défaut, frontier sur les tâches dures |
| Données sensibles / contrainte HDS | GLM-5.2 / Mistral souverain (API HDS, ou self-host SecNumCloud) |
| Souveraineté pleine (refus d'alignement extra-EU) | Mistral, hébergé en France |
| Très gros volume + réglementaire strict | Serveur GPU acheté, sur site |
En résumé : la souveraineté a un prix, mais ce n'est presque jamais 300 k€ de serveurs ni un compromis de qualité. C'est un arbitrage lucide coût × souveraineté × conformité, tâche par tâche — et il se modélise.
Vous arbitrez votre stack IA et voulez un avis chiffré sur votre cas précis (coût, souveraineté, conformité RGPD/HDS) ? Parlons-en →
Prix et benchmarks = état du marché juin 2026, secteur mouvant ; vérifiez au moment de décider.