Jérôme Jacq
Tous les articles
Guide

IA souveraine en France : le guide chiffré (coût + conformité)

Le coût réel, du poste de travail au datacenter, et le volet conformité (RGPD/HDS/SNDS) que personne ne chiffre.

Recevoir le guide + mes prochaines analyses
Zéro spam. Désinscription en un clic.

Juin 2026 — par Jérôme Jacq, conseil IA & FinOps · jeromejacq.com

On me pose partout la même question : « Peut-on faire tourner une IA performante chez nous, en France, sans envoyer nos données aux US ou en Chine ? » La réponse courte : oui, et moins cher qu'on ne le croit — mais le vrai sujet n'est ni le modèle ni le prix au token. Voici le guide complet, du poste de travail au datacenter, avec le volet conformité que personne ne chiffre.

1. Souverain ne veut pas dire en retard (ni neutre)

Le meilleur modèle ouvert de juin 2026, GLM-5.2 (Z.ai, licence MIT, poids téléchargeables), atteint de l'ordre de 85 % de la qualité de Claude Opus et dépasse Claude Sonnet sur l'indice Artificial Analysis. Mistral Large 3 (Apache 2.0, conçu en France) est juste derrière sur le code pur. Conclusion : la souveraineté ne coûte plus la moitié de la qualité.

Deux nuances qui changent la décision :

  • Souveraineté des données ≠ souveraineté du modèle. Héberger GLM en France coupé d'Internet protège vos données ; mais son alignement (entraîné en Chine) est gravé dans les poids. Pour une neutralité pleine, c'est Mistral.
  • Le modèle est une commodité ; le harnais ne l'est pas. Un bon agent (routage, mémoire, sous-agents, auto-vérification) sur GLM bat un mauvais harnais sur Opus. 80 % de la qualité perçue vient de l'ingénierie autour du modèle.

2. Le mur que personne n'anticipe : l'infrastructure

« On a déjà des serveurs, du Docker, du Kubernetes — on fera tourner le modèle dessus. » Non. La génération de texte est limitée par la bande passante mémoire, pas par le calcul. Un CPU plafonne à ~5 mots/seconde (une réponse en 1-2 min, pour un seul utilisateur) : inexploitable en interactif. Il faut des nœuds GPU dédiés (HBM à 2 000-4 800 Go/s). Votre infra orchestre l'inférence ; elle ne l'exécute pas à vitesse utile sans GPU.

3. Acheter, louer ou payer à l'usage — les ordres de grandeur

OptionCoût (juin 2026)SouverainetéRecommandé pour
API souveraine à l'usage (ex. GLM-5.2 sur Scaleway, HDS)~30 €/mois en usage modéréFrance, HDSDémarrage, la plupart des cas
Nœud GPU managé dédié~2 500 €/mois (1 GPU)France, HDSVolume moyen constant
Louer 8 GPU (modèle complet)~16 000–26 000 €/moisFrance, HDS/SecNumCloudGros volume + contrainte réglementaire
Acheter le serveur 8 GPU300 000–465 000 € + ~15 000 €/moisMaximale (sur site)Très gros volume constant

La révélation : une « IA souveraine hébergée en France » existe déjà comme produit fini à ~30 €/mois, sans acheter ni louer la moindre machine. Le serveur à 300 k€ ne se justifie qu'à très gros volume constant ou sous certification stricte.

4. Le piège FinOps : « le moins cher au token » ≠ « le moins cher pour vous »

Au token, un modèle souverain est imbattable. Mais la plupart des gros utilisateurs de Claude sont sur un forfait plat (~186 €/mois), redoutablement compétitif au-delà de ~34 M de tokens de sortie/mois. Le prix unitaire ne décide de rien tant qu'on n'a pas modélisé votre volume et votre mode de facturation. Un usage agentique soutenu franchit ce seuil sans effort — et un agent consomme 5 à 10× les tokens d'une simple question-réponse.

5. Le vrai levier : le routage multi-modèle (et la souveraineté « à la carte »)

Un harnais moderne route chaque tâche vers le modèle qui la mérite :

Type de tâchePart du volumeModèle
Mécanique (reformuler, extraire, classer, résumer)~70-80 %GLM-5.2 / Mistral souverain, peu cher
Raisonnement difficile (architecture, analyse, code)~20-30 %Modèle frontier, au prix fort mais seulement là

Router 80 % des appels vers le souverain divise la facture par 2 à 3. Et le même routage règle la souveraineté sélective : les données sensibles restent sur le modèle souverain hébergé chez vous, seules les requêtes non confidentielles partent vers un modèle frontier. La souveraineté devient un curseur par tâche, pas un interrupteur tout-ou-rien.

6. Le volet que personne ne chiffre : la conformité

C'est ici que « souverain » cesse d'être un mot marketing. Selon la sensibilité, le cadre légal diffère radicalement :

  • Donnée non personnelle / peu sensible : un LLM US est légal (encadrement CCT ou Data Privacy Framework). Le souverain devient un choix de coût/contrôle, pas d'obligation.
  • Donnée personnelle : transfert hors-UE encadré ; pseudonymisation + analyse d'impact recommandées. Une API souveraine EU simplifie tout.
  • Donnée de santé : régime strict. Hébergement HDS obligatoire (décret du 24 mars 2026 : stockage UE/EEE exclusif au 27 sept. 2026). Pour les données du SNDS, aucun transfert ni accès hors-UE n'est admis — même « anonymisé ». Et attention : masquer des identifiants = pseudonymisation (qui reste soumise au RGPD), pas anonymisation — le Conseil d'État a confirmé 1,8 M€ de sanctions en 2026 pour avoir confondu les deux.

Traduction opérationnelle : plus la donnée est sensible, plus la seule option licite est l'inférence 100 % on-premise sur infrastructure certifiée (HDS, voire SecNumCloud). C'est exactement là qu'un routage par sensibilité paie : frontier pour les 80 % anodins, souverain verrouillé pour les 20 % critiques.

7. La grille de décision

Votre situationLe bon choix
Usage variable, peu d'utilisateursAPI/abonnement frontier — zéro infra, qualité max
Gros volume agentique constantForfait frontier fixe, souvent déjà optimal
Coût et souveraineté à optimiserRoutage multi-modèle : souverain par défaut, frontier sur les tâches dures
Données sensibles / contrainte HDSGLM-5.2 / Mistral souverain (API HDS, ou self-host SecNumCloud)
Souveraineté pleine (refus d'alignement extra-EU)Mistral, hébergé en France
Très gros volume + réglementaire strictServeur GPU acheté, sur site

En résumé : la souveraineté a un prix, mais ce n'est presque jamais 300 k€ de serveurs ni un compromis de qualité. C'est un arbitrage lucide coût × souveraineté × conformité, tâche par tâche — et il se modélise.

Vous arbitrez votre stack IA et voulez un avis chiffré sur votre cas précis (coût, souveraineté, conformité RGPD/HDS) ? Parlons-en →

Prix et benchmarks = état du marché juin 2026, secteur mouvant ; vérifiez au moment de décider.

Recevoir le guide + mes prochaines analyses
Zéro spam. Désinscription en un clic.