La plupart des gens regardent le prix par token et pensent avoir compris le coût du GenAI.
Ils ont tort.
Le vrai coût caché le plus important s’appelle le Context Window Creep.
La majorité des LLM sont stateless : ils n’ont aucune mémoire. À chaque nouveau message dans une conversation, votre application doit renvoyer tout l’historique précédent.
Exemple concret avec un simple chatbot SAV :
- Turn 1 (Utilisateur): “Quelle est votre politique de retour ?” (6 tokens)
- Turn 2 (Bot): “Vous pouvez retourner vos articles dans les 30 jours suivant la réception, à condition qu’ils soient en parfait état, dans leur emballage d’origine et avec l’étiquette. Le remboursement sera effectué sous 5 à 7 jours après réception du colis.” (52 tokens)
- Turn 3 (Utilisateur): “Et pour les commandes internationales ?” (7 tokens)
Pour traiter le tour 3, vous n’envoyez pas 7 tokens… vous en envoyez 65 [6 + 52 +7 ]. Et ça ne fait qu’empirer à mesure que la conversation avance.
Ce phénomène, c’est le Context Window Creep. Et il fait exploser silencieusement votre facture GenAI.
Le plus intéressant ? Ce n’est pas une fatalité.
Il existe des leviers concrets et souvent sous-exploités :
- Prompt Caching (implicit et explicit)
- Semantic Caching
- Batch Processing
- Choix intelligent du modèle en fonction du use case réel (et non du prix par token)
Parce que le modèle le moins cher n’est presque jamais le plus économique une fois qu’on regarde le TCO complet.
Le vrai travail de FinOps sur le GenAI ne consiste plus seulement à compter des tokens. Il consiste à comprendre l’économie unitaire de chaque use case et à aligner profondément les équipes techniques et financières.
C’est exactement ce que je fais avec mes clients : identifier ces coûts cachés, les rendre visibles, et les corriger durablement.
Si vous avez l’impression que vos dépenses GenAI sont plus élevées que ce que vous aviez anticipé, ou que vous ne comprenez pas vraiment d’où vient la facture, je suis là pour regarder ça avec vous.
Pas de bullshit. Pas de slide magique. Juste du concret.
Si ça vous parle, envoyez-moi un message. Je prends toujours le temps d’échanger.