FinOps de l'IA : 6 leviers pour diviser votre facture LLM (sans perdre en qualité)
Une facture LLM explose rarement à cause de l'usage : elle explose par négligence. Six leviers FinOps concrets — routage de modèles, cache de prompt, batch, maîtrise des tokens — pour réduire vos coûts d'IA de 50 à 90 % sans rogner la qualité.
Quand une équipe me montre une facture d'IA qui dérape, le problème n'est presque jamais « on utilise trop l'IA ». C'est presque toujours « on l'utilise mal » : le modèle le plus cher pour des tâches triviales, le même contexte renvoyé mille fois, des réponses trois fois trop longues, et aucune mesure pour s'en rendre compte.
Le FinOps — discipline qui consiste à piloter la dépense cloud comme une donnée de gestion — s'applique mot pour mot aux LLM. Voici les six leviers que j'actionne en premier. Pris ensemble, ils réduisent une facture d'IA de 50 à 90 % selon les cas, sans toucher à la qualité perçue.
1. Le bon modèle pour la bonne tâche
C'est le levier numéro un, et le plus négligé. Tout faire passer par le modèle le plus puissant revient à prendre un taxi pour aller chercher le pain. Les données parlent d'elles-mêmes (Artificial Analysis, juillet 2026) :
| Modèle | Intelligence | Entrée €/M | Sortie €/M | Vitesse (tok/s) |
|---|---|---|---|---|
| Claude Fable 5 | 60 | 9,30 € | 46,50 € | 70 |
| Claude Opus 4.8 | 56 | 4,65 € | 23,25 € | 58 |
| GLM-5.2 | 51 | 1,30 € | 4,10 € | 207 |
| DeepSeek V4 Pro | 44 | 0,40 € | 0,81 € | 65 |
| Kimi K2.5 | 38 | 0,56 € | 2,79 € | 71 |
| Qwen3 Max | 24 | 1,12 € | 5,58 € | — |
Indice d'intelligence et vitesse (tokens de sortie par seconde) selon Artificial Analysis. Prix officiels API en euros (les prix via OpenRouter sont souvent inférieurs). GLM-5.2 est 3 fois plus rapide que Fable 5.
Fable 5 fait le buzz en ce moment, et à raison. C'est le nouveau modèle phare d'Anthropic — et à partir du 8 juillet 2026, c'est le seul modèle disponible dans le forfait Max. Il est aussi deux fois plus cher qu'Opus au token (46,50 € vs 23,25 € en sortie), pour un gain de qualité qui ne justifie pas forcément le surcoût sur la majorité des tâches. Sur le papier, Fable 5 est impressionnant ; en pratique, la question reste : en avez-vous besoin pour chaque appel API ?
La sortie de Fable coûte 57 fois celle de DeepSeek V4 Pro. Or une bonne partie des appels d'une application — classer un message, extraire un champ, router une requête, reformuler — n'a aucun besoin du haut de gamme.
La règle : un modèle économique (DeepSeek, Kimi) pour le tri, l'extraction et le routage ; un modèle moyen (GLM-5.2) par défaut ; le grand modèle (Fable) réservé au raisonnement réellement difficile. Ce simple aiguillage fait souvent −70 % sur la facture, sans que l'utilisateur voie la différence.
Mais en 2026, le vrai levier va plus loin : changer de fournisseur. Les modèles d'Anthropic — Fable, Opus, Sonnet — sont excellents, mais ce ne sont plus les seuls capables de faire le travail. GLM-5.2, DeepSeek V4-Pro, Kimi K2.5 : des modèles non américains qui rivalisent avec Sonnet pour 6 à 15 fois moins cher au token. La question n'est plus seulement « quel modèle Anthropic pour quelle tâche ? » mais « faut-il payer du Anthropic pour cette tâche ? ». C'est exactement ce que j'ai fait en migrant de Claude Max vers Hermes Agent avec GLM-5.2 — récit complet dans « De 200 € à 28 €/mois ».
Comment, concrètement ? On ne change pas le modèle à la main à chaque requête : on place un routeur (une passerelle) devant ses appels, configuré une seule fois. Trois façons de décider — par règles (selon la tâche, la feature appelante ou la longueur du prompt), par routage sémantique (selon l'intention détectée, sans appel supplémentaire), ou par routeur appris (un petit modèle prédit si le gros est nécessaire). Pour rester maître de ses données, plusieurs de ces briques sont open-source et auto-hébergeables — par exemple LiteLLM (passerelle avec règles et bascules de secours) ou RouteLLM. On commence simple avec des règles, on raffine ensuite.
2. Le prompt caching : payer une fois le contexte stable
Dans un agent ou un assistant, une grande partie du prompt ne change pas d'un appel à l'autre : le system prompt, les instructions, les exemples, un document de référence. Le renvoyer entier à chaque fois, c'est le payer plein tarif à chaque fois.
Le cache de prompt met en mémoire ce préfixe stable : les appels suivants relisent la partie cachée à environ un dixième du prix (≈ −90 % sur cette portion). Sur un assistant RAG avec un gros contexte répété, c'est le levier le plus rentable après le routage.
3. L'API batch : −50 % sur tout ce qui n'est pas temps réel
Tout n'a pas besoin d'une réponse en deux secondes. L'enrichissement d'une base, la classification de masse, la génération de contenus en lot, l'indexation nocturne : ces traitements tolèrent un délai. L'API batch des principaux fournisseurs les facture moitié prix en échange d'un traitement asynchrone (typiquement sous 24 h). Séparer le temps réel du différé, c'est diviser par deux le coût de tout le différé.
4. Maîtriser les tokens de sortie
Regardez à nouveau le tableau : la sortie coûte 4 à 5 fois l'entrée. C'est le poste le plus cher, et le plus facile à laisser filer. Un modèle à qui on ne dit rien répond volontiers par un roman.
Quelques réflexes : fixer un max_tokens réaliste, demander explicitement une réponse concise (« réponds en trois puces »), imposer un format structuré (JSON court) plutôt qu'une prose libre, et ne pas faire reformuler au modèle ce qu'on peut afficher soi-même. On coupe souvent 30 à 60 % des tokens de sortie sans rien perdre d'utile.
5. Réduire le contexte d'entrée
Le réflexe inverse, côté entrée : ne pas tout envoyer « au cas où ». Balancer un document de 40 pages quand la réponse tient dans deux paragraphes, c'est payer 40 pages.
Un RAG ciblé (on récupère seulement les passages pertinents) bat presque toujours le « tout le document ». Pour une conversation longue, une fenêtre glissante ou un résumé de l'historique évite de re-payer tout le fil à chaque tour. Moins de contexte, c'est moins cher et souvent plus précis — le modèle se noie moins.
6. Mesurer : pas de FinOps sans observabilité
Les cinq leviers précédents sont aveugles sans le sixième. Si vous ne savez pas quelle fonctionnalité coûte quoi, vous optimisez au hasard. Taguer les appels (par feature, par client, par modèle), suivre le coût par requête et le coût par utilisateur, repérer les 20 % d'usages qui font 80 % de la facture : c'est ce qui transforme l'optimisation en pilotage. On ne réduit durablement que ce qu'on mesure.
En résumé
| Levier | Gain typique | Quand l'appliquer |
|---|---|---|
| Routage de modèle | jusqu'à −70 % | tâches simples vs raisonnement difficile |
| Prompt caching | −90 % sur le contexte répété | RAG, agents, gros system prompt |
| API batch | −50 % | traitements non temps réel |
| Tokens de sortie | −30 à −60 % | partout |
| Contexte d'entrée | variable, souvent fort | RAG, conversations longues |
| Mesure | rend les cinq autres possibles | en permanence |
Le coût et la souveraineté finissent d'ailleurs par se rejoindre : choisir le bon modèle pour la bonne tâche, c'est parfois choisir un modèle ouvert hébergé chez soi — un arbitrage que j'ai détaillé dans « IA souveraine ou Claude : le vrai coût ». Et pour aller plus loin encore, j'ai raconté dans « De 200 $ à 31 $/mois » comment j'ai moi-même appliqué ces leviers en migrant de Claude Max vers Hermes Agent + GLM-5.2 — divisant ma facture IA par 6 au passage.
Tarifs indicatifs à juillet 2026, susceptibles d'évoluer. Vous voulez savoir lesquels de ces leviers s'appliquent à votre cas — et combien ils vous feraient économiser ? Parlons-en.
IA souveraine ou Claude : le vrai coût chiffré (GLM-5.2, Mistral, 2026)
GLM-5.2, Mistral, Claude : combien coûte vraiment une IA souveraine hébergée en France, et pourquoi « le moins cher au token » n'est presque jamais le moins cher pour vous. Le calcul d'un consultant IA, du poste de travail au datacenter.
De 200 € à 20 € par mois : comment j'ai migré de Claude Max à Hermes Agent sans perdre en productivité
Facture d'IA divisée par 10 en migrant de Claude Max (200 €/mois) vers Hermes Agent + abonnement Nous Research (20 €/mois). GLM-5.2, DeepSeek et Kimi en modèles de repli. Récit chiffré d'un solo entrepreneur.
Un arbitrage IA à trancher ? Parlons-en.
Conseil, audit et conception de produits IA — pour entreprises et particuliers, depuis Angers.