Coût par million de jetons : sur site vs cloud
Il existe trois manières légitimes d'acquérir des capacités d'inférence LLM en 2026 : utiliser un point d'accès hébergé par un tiers et payer au jeton (API LLM cloud), louer un GPU à l'heure et exécuter son propre modèle (location de GPU cloud), ou acheter un serveur et l'exécuter sur son propre réseau (sur site). Le prix d'un million de jetons varie considérablement selon ces trois options, et pas dans l'ordre que la plupart des acheteurs imaginent.
Cet article présente les calculs en euros hors TVA. Public cible : personnes devant choisir entre continuer à payer l’abonnement mensuel à OpenAI, passer à un fournisseur de modèles ouverts hébergé, louer un H100 ou acheter un serveur 4/8 GPU. Nous indiquons les prix de mai 2026 et proposons un processus de décision en cinq minutes. Références croisées : T01 : coût total de possession par GPU ; W07 : sélection de cartes ; I04 : caractéristiques techniques.
Les trois plateformes
API Cloud LLM. OpenAI, Anthropic, Google, Together, Fireworks. Paiement au token entrant et sortant. Aucun coût d'inactivité, aucun investissement initial, aucune opération. Choix de modèle limité au catalogue, pas de LoRa, aucun contrôle quantitatif.
Location de GPU dans le cloud. AWS p5/p5e/p6, Azure ND H200/B200, GCP A3 Ultra, et clouds spécialisés (Lambda, CoreWeave, Nebius, RunPod). Louez une instance GPU à l'heure et exécutez tout ce que vous souhaitez. Vous fournissez le modèle, la pile de service et les opérations. Le prix est le même, que vous serviez un seul jeton ou un milliard dans l'heure.
Installation sur site. Achetez un boîtier 4 ou 8 GPU. Installez-le dans votre bâtiment ou dans un centre de données. Vous gérez l'alimentation électrique, le refroidissement, le réseau et l'exploitation. Amortissez l'investissement sur trois ans. Le coût marginal est l'électricité. Les coûts fixes correspondent à tout ce que vous avez déjà payé.
Trois profils de coûts différents — purement variables, purement fixes avec seuil, capex plus coûts marginaux — qui s'équilibrent à différents points de l'axe de débit.
Tarification de l'API Cloud LLM
USD par million de jetons, pages de tarification publiques, mai 2026. EUR à EUR/USD ≈ 1.08.
| Provider | Modèle | Saisie $/Mtok | Production $/Mtok | Entrée €/Mtok | Production €/Mtok |
|---|---|---|---|---|---|
| OpenAI | GPT-5 | 1.25 | 10.00 | 1.16 | 9.26 |
| OpenAI | GPT-5 mini | 0.25 | 2.00 | 0.23 | 1.85 |
| OpenAI | GPT-5 nano | 0.05 | 0.40 | 0.05 | 0.37 |
| OpenAI | GPT-4.1 / o3 | 2.00 | 8.00 | 1.85 | 7.41 |
| Anthropique | Claude Opus 4.7 | 15.00 | 75.00 | 13.89 | 69.44 |
| Anthropique | Claude Sonnet 4.6 | 3.00 | 15.00 | 2.78 | 13.89 |
| Anthropique | Claude Haïku 4.5 | 1.00 | 5.00 | 0.93 | 4.63 |
| Gémeaux 2.5 Pro | 1.25 | 10.00 | 1.16 | 9.26 | |
| Gémeaux 2.5 Flash | 0.30 | 2.50 | 0.28 | 2.31 | |
| Gemini 2.5 Flash Lite | 0.10 | 0.40 | 0.09 | 0.37 | |
| ensemble | Lama 3.3 70B | 0.88 | 0.88 | 0.81 | 0.81 |
| ensemble | Qwen2.5 72B | 1.20 | 1.20 | 1.11 | 1.11 |
| ensemble | DeepSeek-V3 | 1.25 | 1.25 | 1.16 | 1.16 |
| ensemble | Lama 3.1 405B | 3.50 | 3.50 | 3.24 | 3.24 |
| Socle AWS | Lama 3.3 70B | 0.72 | 0.72 | 0.67 | 0.67 |
| Azure | Lama 3.3 70B | 0.59 | 0.79 | 0.55 | 0.73 |
Deux analyses pertinentes. Les modèles fermés de Frontier (Claude Opus 4.7, GPT-5, Gemini 2.5 Pro) sont nettement plus chers que les API de modèles ouverts hébergées, comme Llama 70B ou DeepSeek-V3 : c’est le prix de la « solution la plus performante à court terme » par rapport aux « meilleures pondérations disponibles sur le marché ». Pour la plupart des charges de travail en production (RAG, étapes d’agent, code, classification), Sonnet 4.6 ou GPT-5 mini constituent le point d’exploitation courant, et non la solution phare. Le coût des jetons de sortie est trois à sept fois supérieur à celui des jetons d’entrée chez les fournisseurs de modèles fermés, et à peu près équivalent chez les hébergeurs de modèles ouverts. Les offres de modèles ouverts des hyperscalers (Bedrock, Azure) facturent une prime de 30 à 80 % par rapport à Together ou Fireworks pour un même modèle : vous payez pour l’intégration IAM et une facture unique, et non pour des jetons moins chers.
Coût sur site par Mtok
Le coût par Mtok correspond au coût total sur trois ans divisé par le nombre de jetons distribués sur cette période. Le dénominateur dépend du taux d'utilisation ; le numérateur est approximativement fixe.
On-prem €/Mtok =
(capex + 3y electricity + 3y maintenance + 3y ops) /
(sustained tok/s × utilization × 3 × 8,760 × 3,600 / 1e6)
En intégrant le TCO par GPU de T01 à 60 % d'utilisation, 0.20 €/kWh, PUE 1.4 :
| Se construisent | 3 ans TCO € | tok/s soutenus | Jetons/3 ans (Mtok) | € / Mtok |
|---|---|---|---|---|
| 4× RTX 5090 (Llama 70B INT4 TP=4) | 27,000 | 1,800 | 102,000 | 0.26 |
| 4 × Pro 6000 BW SE (Lama 70B FP8 DP) | 58,000 | 1,920 | 109,000 | 0.53 |
| 4 × Pro 6000 BW SE (Qwen 32B INT4) | 58,000 | 2,400 | 136,000 | 0.43 |
| 8 × Pro 6000 BW SE (Lama 70B FP8 DP) | 115,000 | 3,800 | 215,000 | 0.53 |
| 8× L4 (Lama 8B FP8) | 36,000 | 5,200 | 295,000 | 0.12 |
Réduisez le taux d'utilisation à 30 % et tous les chiffres doublent. Portez-le à 80 % et le service L4 pour 8 milliards de dollars revient à 0.09 €/Mtok, moins cher que toutes les API cloud de cette catégorie. Le calcul devient absurde en dessous de 25 % d'utilisation, car le coût total de possession (TCO) est alors principalement déterminé par les dépenses d'investissement (capex) engagées, que l'utilisation soit effective ou non.
Le seuil de rentabilité
Superposez la courbe du nuage de points. Llama 70B à 100 millions de jetons/mois , équilibré à 50/50, sur Together : 100 × 0.81 € = 81 €/mois → 2 916 € sur trois ans. Face à une infrastructure sur site de 4 × 5090 à 27 000 €, Together l'emporte de 24 000 €. À 100 millions de jetons/mois, l'infrastructure sur site est totalement désavantageuse.
Objectif : 1 milliard de jetons par mois : 1 000 × 0.81 € = 810 €/mois → 29 160 € sur trois ans. Avec les 4 × 5 090, le total est inférieur à 2 000 €. À 1.5 milliard de jetons par mois, l’offre sur site est nettement plus avantageuse.
Le seuil de rentabilité pour l'inférence de 70 milliards de classes par rapport à l'API hébergée de modèle ouvert la moins chère se situe autour de 1.0 à 1.5 milliard de jetons par mois, avec un modèle 4× 5090. Pour les API fermées de pointe (Claude Sonnet 4.6 à 8.34 €/Mtok en moyenne, GPT-5 à 5.21 €/Mtok en moyenne), le seuil de rentabilité passe à 80-150 millions de jetons/mois — la courbe de rentabilité est beaucoup plus abrupte.
Le chiffre le plus important de cet article est le suivant : le seuil de rentabilité ne se résume pas à « 100 millions de jetons par mois pour tout ». Il est spécifique à la charge de travail et dépend entièrement de la solution cloud concurrente. Les acheteurs qui affirment « nous atteignons 50 millions de jetons, nous devrions passer à une solution sur site » se basent généralement sur Claude Opus, et ils ont raison. Ils oublient cependant qu’une migration de la charge de travail d’Opus vers Sonnet 4.6 leur permet d’économiser cinq fois plus qu’une migration de Sonnet vers une solution sur site pour un volume équivalent.
Location de GPU dans le cloud — l'option intermédiaire
Tarifs horaires par GPU, mai 2026 à la demande :
| Provider | Instance | GPU | $/h instance | $/GPU-h |
|---|---|---|---|---|
| AWS | p5.48xlarge | 8× H100 SXM | 55.18 | 6.90 |
| AWS | p5e.48xlarge | 8× H200 SXM | 30.00 | 3.75 |
| AWS | p6-b200 | 8× B200 | 74.88 | 9.36 |
| Azure | ND H200 v5 | 8× H200 | 31.00 | 3.88 |
| GCP | a3-ultragpu-8g | 8× H200 | 28.00 | 3.50 |
| Lambda | 8× H100 | 8× H100 | 16.00 | 2.00 |
| CoreWeave | 8× H100 | 8× H100 | 19.20 | 2.40 |
Les engagements d'un an bénéficient d'une réduction de 25 à 35 %. AWS p5 à la demande coûte environ trois fois plus cher que Lambda pour une même infrastructure H100. En termes de coût par jeton : 8 instances H100 sur Lambda exécutant Llama 3.3 (70 milliards de FP8) à environ 3 1 tok/s en continu → 16 $/h × 8 3,500 × 3 = 8,760 389,000 € sur 3 ans → 1.96 €/Mtok à 60 % d'utilisation. Cela représente quatre fois le coût d'une infrastructure sur site composée de 4 instances Pro 6000 SE (0.53 €/Mtok) et 2.5 fois le coût d'un simple appel à Together (0.81 €/Mtok).
Louer des H100 pour l'inférence de modèles ouverts est une solution peu avantageuse : le coût de location du matériel et les frais d'exploitation. Ce n'est rentable que si vous avez besoin d'un modèle spécifique non hébergé et que vous n'avez pas le volume nécessaire pour une infrastructure sur site. La location de GPU dans le cloud a toutefois un cas d'utilisation légitime : l'entraînement en rafale . Un réglage fin LoRa sur 8 H100 pendant 8 heures coûte environ 130 $ chez Lambda. Aucun coût total de possession (TCO) sur site n'est plus avantageux pour une opération ponctuelle. Ce raisonnement ne s'applique pas à l'inférence, qui est continue et s'exécute 24 h/24 et 7 j/7. Le piège du « spot » : les offres spot/préemptibles/communautaires proposent des réductions de 50 à 80 %, mais sont interruptibles. C'est acceptable pour les répliques d'inférence sans état. Pour un entraînement de 18 heures avec un point de contrôle à chaque étape, deux interruptions doublent le coût par étape et l'offre n'est plus plus économique que l'option à la demande.
Des coûts cachés que personne ne mentionne
Cloud : les frais de sortie (0.05 à 0.09 $/Go) s'appliquent lors de l'envoi d'images, d'audio ou de vidéo. La journalisation ajoute 5 à 10 % de ces frais à grande échelle. La facturation répétée du contexte est particulièrement problématique : chaque API facture l'intégralité du coût de l'invite à chaque appel. Ainsi, un contexte d'agent de 50 000 jetons coûte 50 000 jetons d'entrée par étape d'une boucle de 20 étapes. La mise en cache des invites (prise en charge par Anthropic, OpenAI et Google) réduit ces frais de 50 à 90 % sur les préfixes mis en cache, à condition d'avoir une architecture adaptée. Les limites de débit en production commencent entre 30 000 et 500 000 TPM et nécessitent un historique d'utilisation ; les nouveaux clients ne peuvent pas exploiter pleinement le système dès le premier jour. Les références pour la région UE sont 10 à 20 % plus chères que celles de la région Est des États-Unis, avec une disponibilité moindre.
Sur site : le temps d'exploitation (0.1 à 0.3 ETP par serveur) coûte entre 8 000 € et 24 000 € par an, hors calcul par Mtok. Toute interruption de service nécessite une infrastructure redondante ou une migration sécurisée vers le cloud. Le prix de l'électricité n'est pas de 0.20 €/kWh partout : dans l'UE, pour le secteur industriel en 2026, il varie de 0.09 €/kWh (Suède, Norvège hydroélectrique) à 0.35 €/kWh (Italie, Irlande). En Allemagne, il se situe entre 0.18 € et 0.22 €/kWh pour le secteur industriel subventionné, et en République tchèque entre 0.18 € et 0.25 €/kWh pour le secteur commercial ouvert. En Italie et en Irlande, chaque tranche du plan T01 entraîne une augmentation de 50 % du prix de l'électricité. Un rack en colocation coûte entre 100 € et 300 € par mois pour 4U, soit entre 3 600 € et 10 800 € sur trois ans, en plus du matériel.
Le prix affiché pour le cloud est environ 1.2 à 1.5 fois supérieur à la facture réelle ; le coût total de possession (TCO) publié pour une solution sur site est environ 1.2 à 1.5 fois supérieur au prix catalogue. Les coefficients multiplicateurs s’annulent pour faciliter la comparaison.
Facteurs non liés aux coûts
Pour les vrais acheteurs, trois éléments priment sur le coût par Mtok.
Souveraineté des données. La principale raison pour laquelle les acheteurs européens privilégieront les solutions sur site en 2026 est le RGPD, associé aux réglementations sectorielles (DORA, NIS2, AI Act, MDR). L'envoi de messages de production contenant des données personnelles, des dossiers médicaux ou des secrets industriels vers un terminal hébergé aux États-Unis pose un problème contractuel, quel qu'en soit le prix. Les références produits pour l'UE ne signifient pas nécessairement un contrôle européen. Pour un acheteur soumis à la réglementation, le surcoût lié aux solutions sur site n'est pas une dépense, mais le prix à payer pour être légalement autorisé à les déployer.
Latence minimale. La connexion WAN au point de terminaison hébergé le plus proche ajoute 15 à 40 ms de RTT au sein de l'UE et 80 à 120 ms à travers l'Atlantique. Sur site, sur un réseau local 10 GbE, la latence est inférieure à la milliseconde. Pour une conversation interactive, l'impact de la connexion WAN est négligeable par rapport à un TTFT de 800 ms. En revanche, pour une boucle de contrôle robotique ( I01 ) ou un agent vocal avec un temps de réponse inférieur à 300 ms, la connexion WAN est un facteur critique.
Personnalisation. Les API cloud fournissent le modèle et la quantification choisis par le fournisseur. Sur site, vous choisissez le modèle, la quantification, la pile de déploiement (vLLM, SGLang, llama.cpp), les adaptateurs LoRa et le décodeur spéculatif. Pour les laboratoires de recherche ou les produits spécialisés, c'est ce que vous achetez ; le coût par Mtok est secondaire.
Si aucune de ces conditions ne s'applique, l'acheteur se situe en dessous du seuil de rentabilité. L'achat d'un serveur n'est pas forcément judicieux pour tous les prospects.
Décision prise : charge de travail de classe 70B sur deux volumes
Profil client : SaaS effectuant la classification et la synthèse de documents, entrée/sortie 70/30, modèle de classe à pondération ouverte 70B.
| Option | À 100 M tok/mois (3 ans) | À 2 B tok/mois (3 ans) |
|---|---|---|
| Ensemble (Llama 3.3 70B) | €2,916 | €58,320 |
| AWS Bedrock (Llama 3.3 70B) | €2,412 | €48,240 |
| Claude Sonnet 4.6 (référence à la frontière) | €21,996 | €439,920 |
| Sur site 4× 5090 (amorti) | €27,000 | €27,000 |
| Lambda 8× H100 auto-hébergé | €389,000 | €389,000 |
Avec 100 millions de jetons par mois, Bedrock surpasse largement l'infrastructure sur site ; le client n'a pas encore justifié son investissement. À 2 milliards de jetons par mois, l'infrastructure sur site l'emporte nettement, avec un gain de 1.8 à 2.2 fois, même par rapport à l'alternative hébergée la moins chère. Le seuil de rentabilité pour cette charge de travail se situe entre 800 millions et 1.2 milliard de jetons par mois. En dessous, il est préférable de louer. Au-dessus, il est conseillé d'investir.
Matrice de décision
| Volume / mois | Modèle 8B–13B | modèle 32B | modèle 70B | Frontière (Claude / GPT-5) |
|---|---|---|---|---|
| < 100 M tok | API cloud | API cloud | API cloud | API cloud |
| 100–500 M tok | API cloud ou 4× L4 | API cloud | API cloud | API cloud |
| 500 M – 1 B | 4 à 8× L4 sur site | 4× 5090 ou Cloud | Nuage (Bedrock/Ensemble) | API cloud |
| 1–5 B tok | 8× L4 sur site | 4 × 5090 | 4× 5090 ou 4× Pro 6000 SE | Hybride cloud + sur site |
| 5–50 B tok | 8× L4 cluster | 4× Pro 6000 BW SE | 4–8× Pro 6000 BW SE | Frontier cloud + repos sur site |
| > 50 milliards de tok | L4 multi-nœuds | 8× Pro 6000 BW SE | 8× Pro 6000 SE × N | Tarifs entreprise + hybride |
Un acheteur prudent (conformément à la réglementation) place la colonne « sur site » une ligne plus haut ; un acheteur expérimental, une ligne plus bas. La colonne « Frontière » est particulière : aucune installation sur site ne remplace Claude Opus 4.7 ou GPT-5. Ce sont des références de qualité que vous utilisez à la demande, et non des charges de travail hébergées.
Le point de vue honnête
La plupart des prospects qui arrivent en pensant avoir besoin d'un serveur n'en ont pas réellement besoin. Avec des volumes typiques (5 à 50 millions de jetons par mois pour un produit en phase de lancement, 50 à 500 millions pour un produit en phase de développement intermédiaire), les API cloud restent la solution optimale pendant encore douze à vingt-quatre mois. La bonne solution est d'utiliser Together ou Bedrock, de surveiller vos dépenses mensuelles et de nous contacter lorsqu'elles dépassent 1 500 € par mois de manière soutenue.
Les acheteurs pour qui une infrastructure sur site est pertinente en 2026 se répartissent en trois catégories : les clients soumis à une réglementation stricte (les données ne peuvent pas quitter le bâtiment), ceux nécessitant un volume important de transactions (plus d’un milliard de jetons par mois sur un modèle de classe 70 milliards où la rentabilité est de 2 à 3 fois supérieure), et ceux qui privilégient la robotique ou la faible latence (la complexité du WAN rend l’application inopérante). Environ 30 à 40 % de nos prospects correspondent à l’une de ces catégories. Pour les 60 à 70 % restants, les API cloud constituent un produit remarquable en 2026 et ils devraient continuer à les utiliser jusqu’à ce que la situation évolue.
L'entraînement est un tout autre sujet. Presque toutes les charges de travail à l'échelle de Kentino AI (LoRA, QLoRA, optimisation de 7 à 32 milliards de données) sont moins coûteuses sur site que la location d'un GPU dans le cloud : le serveur fonctionne à 100 % pendant l'exécution. L'exception concerne l'entraînement à très grande échelle (pré-entraînement complet de plus de 70 milliards de données, RLHF à grande échelle) qui nécessite 8 H100 avec NVLink, que nous ne vendons pas ( la page 07 explique pourquoi). Louez-le, exécutez-le, et récupérez les poids.
Que faire ensuite
Exécutez cette séquence avant de contacter un fournisseur :
- Mesurer le volume mensuel actuel des jetons, ventilé par niveau de modèle. Si vous ne pouvez pas, instrumentez-le pendant deux semaines. Sans ce nombre, chaque étape suivante est une conjecture.
- Projet à six mois, de manière prudente — multiplier par 1.5 à 2. Les factures LLM augmentent plus vite que le produit car les contextes s'élargissent et les agents ajoutent des étapes.
- Identifiez honnêtement les niveaux. Fraction nécessitant une qualité supérieure ? Fraction correcte sur Sonnet 4.6 / GPT-5 mini ? Fraction correcte sur Llama 3.3 70B ? Répartition typique : 5 % / 25 % / 70 %.
- Facture de calcul du cloud au volume prévu par niveau selon le tableau ci-dessus. Il s'agit de votre concurrent.
- Calcul sur site pour un boîtier 4× 5090 ou 4× Pro 6000 SE au volume projeté en utilisant T01.
- Si les performances du cloud dépassent celles de l'infrastructure sur site de moins de 1.5 fois, restez sur le cloud. Les opérations, les temps d'arrêt et les risques liés aux investissements en capital absorbent les petits gains.
- Si le cloud dépasse l'infrastructure sur site d'au moins deux fois, alors le cas de l'infrastructure sur site est bien réel. La souveraineté, la latence et la personnalisation deviennent des critères de départage — ils renforcent presque toujours la solution sur site à cette échelle.
- Si le système est réglementé ou soumis à des contraintes de latence, inutile de faire des calculs. Vous achetez sur place de toute façon. Taille avec T01 et W07.
Le document T03, qui fait suite à ce précédent, traite de la gestion de la charge continue par rapport à la charge par pics de consommation : quand une solution hybride est pertinente, comment dimensionner une infrastructure sur site avec un débordement cloud. Références croisées : T01 (coût total de possession par GPU et tok/s), W07 (sélection du GPU), I04 (calculs de consommation électrique côté réseau justifiant l’hypothèse du coût en €/kWh).
Un seul mot à retenir : le coût par million de jetons n’a pas de réponse unique ; il dépend de votre charge de travail, de votre volume, de votre modèle et du prix de l’électricité dans votre pays. Faites vos calculs avant de signer quoi que ce soit.
Cet article fait partie du Kentino Wiki, une série de référence sur l'intelligence artificielle, la robotique et les systèmes qui les connectent. Commentaires et corrections bienvenus à info@kentino.com.