Savoir qu'OpenAI facture 2,50 $ par million de tokens d'input ne vous dit rien de ce que vous paierez à la fin du mois. Ce qui compte, c'est le nombre de tokens que consomme votre cas d'usage précis, à quel volume, et quel modèle vous choisissez. Deux projets avec le même budget en tokens peuvent avoir des factures qui varient du simple au décuple, uniquement à cause de la nature de la tâche.
Cet article reprend les prix actuels d'OpenAI, d'Anthropic et de Google et fait le calcul pour quatre scénarios métier réels : pas des grilles de prix par token, mais ce que chacun coûte par mois.
Les quatre scénarios
Pour chacun, nous retenons un cas moyen réaliste, pas le meilleur scénario possible :
- Chatbot de support client. 400 tokens d'input (question + instructions système) et 250 d'output par conversation. Volume : 200 000 conversations/mois.
- Agent de code. 3 000 tokens d'input (contexte de fichiers + instructions) et 800 d'output par appel. Volume : 10 000 appels/mois, soit une petite équipe qui l'utilise tout au long de la journée.
- Analyse de documents. 8 000 tokens d'input (un document type) et 400 d'output (le résumé ou l'extraction). Volume : 2 000 documents/mois.
- Génération de contenu marketing. 600 tokens d'input (brief) et 1 200 d'output (le texte généré). Volume : 1 000 contenus/mois.
Combien coûte chacun par mois
Prix de septembre 2026, avec un modèle de gamme intermédiaire de chaque fournisseur (Claude Sonnet 5, GPT-5.4 et Gemini 3.5 Flash), avant remises de caching ou de batch.
| Scénario | Appels/mois | Claude Sonnet 5 | GPT-5.4 | Gemini 3.5 Flash |
|---|---|---|---|---|
| Chatbot de support | 200 000 | 660 $ | 950 $ | 570 $ |
| Agent de code | 10 000 | 140 $ | 195 $ | 117 $ |
| Analyse de documents | 2 000 | 40 $ | 52 $ | 31 $ |
| Génération de contenu | 1 000 | 13 $ | 20 $ | 12 $ |
Ce que montre le tableau
C'est le volume qui domine, pas la complexité par appel. Le chatbot est le plus simple des quatre cas, avec peu de tokens par interaction, mais c'est de loin le plus cher, simplement parce qu'il compte 20 fois plus d'appels que l'agent de code. Avant d'optimiser le modèle, il faut comprendre où se trouve le volume réel.
L'écart entre fournisseurs reste proportionnel dans tous les scénarios. À ce niveau de gamme, Gemini se situe toujours environ 15 à 40 % sous Claude, et OpenAI toujours environ 30 à 40 % au-dessus. C'est cohérent avec ce que nous avons montré dans le comparatif des prix par token : le classement des fournisseurs ne change pas selon le cas d'usage, seule l'ampleur de l'enjeu varie.
L'analyse de documents et le contenu restent bon marché, même à des volumes conséquents. Avec un output court et un nombre d'appels modéré, aucun des deux ne dépasse 50 $/mois dans ces exemples. Ce sont le chatbot à fort volume et l'agent de code à large contexte qui méritent une attention budgétaire.
L'effet du choix de la gamme de modèle
Le tableau ci-dessus utilise la gamme intermédiaire des trois fournisseurs. Mais pour le chatbot de support, la plus grosse facture des quatre scénarios, la tâche est généralement assez simple pour un modèle économique. En refaisant le calcul avec la gamme la moins chère de chaque fournisseur :
| Fournisseur | Modèle économique | Coût/mois (chatbot) | Économie vs gamme intermédiaire |
|---|---|---|---|
| Anthropic | Claude Haiku 4.5 | 330 $ | 50 % |
| Gemini 3.5 Flash-Lite | 149 $ | 74 % | |
| OpenAI | GPT-5.4-nano | 78,50 $ | 92 % |
OpenAI est le cas le plus extrême : remplacer GPT-5.4 par GPT-5.4-nano sur le même chatbot fait passer la facture de 950 $ à moins de 80 $, soit plus de dix fois moins, pour une tâche qui, dans la plupart des cas, n'a même pas besoin du grand modèle. C'est le même constat que dans l'article sur comment calculer le coût d'un projet d'IA : le choix du modèle pèse davantage sur le budget que le choix du fournisseur.
Où intervient le caching
Le scénario d'analyse de documents est celui qui profite le plus du prompt caching, car l'input (8 000 tokens) comprend généralement des instructions et un format de sortie identiques pour tous les documents ; seul le contenu du document change. Les trois fournisseurs accordent une remise sur les tokens d'input répétés : Anthropic lit les tokens en cache avec 95 % de remise, OpenAI et Google avec jusqu'à 90 %. Dans un scénario où la moitié de l'input se répète d'un appel à l'autre, cela peut retrancher une part significative des 31 à 52 $ mensuels de ce cas d'usage, et la proportion ne fait que croître avec le volume.
Comment l'appliquer à votre cas
- Mesurez les tokens réels d'un appel type, pas du meilleur cas. Utilisez la console du fournisseur ou un compteur de tokens.
- Multipliez par le volume mensuel attendu. C'est là que des scénarios avec peu de tokens par appel peuvent finir plus chers que des scénarios « lourds » à faible volume.
- Testez d'abord la gamme économique, surtout pour les tâches à fort volume comme le chatbot de cet article ; l'écart peut atteindre un ordre de grandeur.
- Réservez la gamme intermédiaire ou haut de gamme aux tâches où la qualité de la réponse compte plus que le coût : code complexe, décisions métier, contenu final sans relecture.
Pour faire ce calcul avec vos propres chiffres, utilisez le calculateur de coût d'IA en tokens. Le guide des coûts de l'IA réunit le reste du sujet au même endroit.
Conclusion
Le prix par token est un point de départ, pas la réponse. Ce qui détermine la facture à la fin du mois, c'est la combinaison du volume, des tokens par appel et de la gamme de modèle retenue, et comme le montre cet article, cette combinaison peut faire coûter le même fournisseur dix fois plus ou moins selon la décision. Avant de choisir un fournisseur, faites le calcul pour votre cas d'usage réel, pas pour la grille tarifaire.
Les valeurs utilisées datent de septembre 2026, avant remises de caching et de batch. Vérifiez toujours les prix officiels avant d'arrêter une architecture.
Sources
Écrit sur l'IA appliquée, l'opération, le GEO/SEO et comment transformer les entreprises en machines qui continuent à tourner même quand personne ne regarde.
