Coût par million de jetons : sur site vs cloud

Il existe trois manières légitimes d'acquérir des capacités d'inférence LLM en 2026 : utiliser un point d'accès hébergé par un tiers et payer au jeton (API LLM cloud), louer un GPU à l'heure et exécuter son propre modèle (location de GPU cloud), ou acheter un serveur et l'exécuter sur son propre réseau (sur site). Le prix d'un million de jetons varie considérablement selon ces trois options, et pas dans l'ordre que la plupart des acheteurs imaginent.

Cet article présente les calculs en euros hors TVA. Public cible : toute personne devant choisir entre continuer à payer l’abonnement mensuel à OpenAI, passer à un fournisseur de modèles ouverts hébergé, louer un H100 ou acheter un serveur équipé de 4 ou 8 GPU. Nous indiquons les prix de mai 2026 et proposons un processus de décision en cinq minutes. Références croisées : T01 TCO par GPU, W07 sélection de cartes, I04 Numéros muraux.

Les trois plateformes

API Cloud LLM. OpenAI, Anthropic, Google, Together, Fireworks. Paiement au jeton entrant et sortant. Aucun coût d'inactivité, aucun investissement initial, aucune opération. Choix de modèle limité à leur catalogue, pas de LoRa, pas de contrôle quantitatif.

Location de GPU dans le cloud. AWS p5/p5e/p6, Azure ND H200/B200, GCP A3 Ultra, ainsi que des clouds spécialisés (Lambda, CoreWeave, Nebius, RunPod). Louez une instance GPU à l'heure et exécutez tout ce que vous souhaitez. Vous fournissez le modèle, la pile de service et les opérations. Vous payez le même prix, que vous serviez un seul jeton ou un milliard dans l'heure.

Sur site. Achetez un boîtier 4 ou 8 GPU. Installez-le dans votre bâtiment ou dans un centre de données. Vous gérez l'alimentation, le refroidissement, le réseau et l'exploitation. L'amortissement se fait sur trois ans. Le coût marginal est l'électricité. Les coûts fixes correspondent à tout ce que vous avez déjà payé.

Trois profils de coûts différents — purement variables, purement fixes avec seuil, capex plus coûts marginaux — qui s'équilibrent à différents points de l'axe de débit.

Tarification de l'API Cloud LLM

USD par million de jetons, pages de tarification publiques, mai 2026. EUR à EUR/USD ≈ 1.08.

Provider Modèle Saisie $/Mtok Production $/Mtok Entrée €/Mtok Production €/Mtok
OpenAI GPT-5 1.25 10.00 1.16 9.26
OpenAI GPT-5 mini 0.25 2.00 0.23 1.85
OpenAI GPT-5 nano 0.05 0.40 0.05 0.37
OpenAI GPT-4.1 / o3 2.00 8.00 1.85 7.41
Anthropique Claude Opus 4.7 15.00 75.00 13.89 69.44
Anthropique Claude Sonnet 4.6 3.00 15.00 2.78 13.89
Anthropique Claude Haïku 4.5 1.00 5.00 0.93 4.63
Google Gémeaux 2.5 Pro 1.25 10.00 1.16 9.26
Google Gémeaux 2.5 Flash 0.30 2.50 0.28 2.31
Google Gemini 2.5 Flash Lite 0.10 0.40 0.09 0.37
ensemble Lama 3.3 70B 0.88 0.88 0.81 0.81
ensemble Qwen2.5 72B 1.20 1.20 1.11 1.11
ensemble DeepSeek-V3 1.25 1.25 1.16 1.16
ensemble Lama 3.1 405B 3.50 3.50 3.24 3.24
Socle AWS Lama 3.3 70B 0.72 0.72 0.67 0.67
Azure Lama 3.3 70B 0.59 0.79 0.55 0.73

Deux analyses pertinentes. Les modèles fermés de Frontier (Claude Opus 4.7, GPT-5, Gemini 2.5 Pro) sont nettement plus chers que les API de modèles ouverts hébergées, comme Llama 70B ou DeepSeek-V3 : c’est le prix de la « solution la plus performante à court terme » par rapport aux « meilleures pondérations disponibles sur le marché ». Pour la plupart des charges de travail en production (RAG, étapes d’agent, code, classification), Sonnet 4.6 ou GPT-5 mini constituent le point d’exploitation courant, et non la solution phare. Le coût des jetons de sortie est trois à sept fois supérieur à celui des jetons d’entrée chez les fournisseurs de modèles fermés, et à peu près équivalent chez les hébergeurs de modèles ouverts. Les offres de modèles ouverts des hyperscalers (Bedrock, Azure) facturent une prime de 30 à 80 % par rapport à Together ou Fireworks pour un même modèle : vous payez pour l’intégration IAM et une facture unique, et non pour des jetons moins chers.

Coût sur site par Mtok

Le coût par Mtok correspond au coût total sur trois ans divisé par le nombre de jetons distribués sur cette période. Le dénominateur dépend du taux d'utilisation ; le numérateur est approximativement fixe.

On-prem €/Mtok =
    (capex + 3y electricity + 3y maintenance + 3y ops) /
    (sustained tok/s × utilization × 3 × 8,760 × 3,600 / 1e6)

En intégrant le TCO par GPU à partir de T01 à 60 % d'utilisation, 0.20 €/kWh, PUE 1.4 :

Se construisent 3 ans TCO € tok/s soutenus Jetons/3 ans (Mtok) € / Mtok
4× RTX 5090 (Llama 70B INT4 TP=4) 27,000 1,800 102,000 0.26
4 × Pro 6000 BW SE (Lama 70B FP8 DP) 58,000 1,920 109,000 0.53
4 × Pro 6000 BW SE (Qwen 32B INT4) 58,000 2,400 136,000 0.43
8 × Pro 6000 BW SE (Lama 70B FP8 DP) 115,000 3,800 215,000 0.53
8× L4 (Lama 8B FP8) 36,000 5,200 295,000 0.12

Réduisez le taux d'utilisation à 30 % et tous les chiffres doublent. Portez-le à 80 % et le service L4 pour 8 milliards de dollars revient à 0.09 €/Mtok, moins cher que toutes les API cloud de cette catégorie. Le calcul devient absurde en dessous de 25 % d'utilisation, car le coût total de possession (TCO) est alors principalement déterminé par les dépenses d'investissement (capex) engagées, que l'utilisation soit effective ou non.

Le seuil de rentabilité

Superposez la ligne de nuages. Llama 70B à 100 millions de jetons par moisAvec un équilibre 50/50, sur Together : 100 × 0.81 € = 81 €/mois → 2 916 € sur trois ans. Face à une offre sur site de 4 × 5 090 à 27 000 €, Together l'emporte de 24 000 €. À 100 millions de jetons/mois, l'offre sur site est totalement désavantageuse.

Pousser pour 1 milliard de jetons par mois1 000 × 0.81 € = 810 €/mois → 29 160 € sur trois ans. Avec 4 × 5 090, le coût total reste inférieur à 2 000 €. À 1.5 milliard par mois, la consommation sur place est nettement plus avantageuse.

Seuil de rentabilité pour Inférence de classe 70B contre l'API hébergée à modèle ouvert la moins chère terres autour 1.0 à 1.5 milliard de jetons par mois maintenu sur un 4× 5090. Pour les API à frontière fermée (Claude Sonnet 4.6 à 8.34 €/Mtok mélangé, GPT-5 à 5.21 €/Mtok mélangé), le seuil de rentabilité se déplace vers 80 à 150 millions de jetons par mois — la pente de la ligne nuageuse est dix fois plus abrupte.

C'est le chiffre le plus important de cet article : Le seuil de rentabilité ne se résume pas à « 100 millions de jetons par mois pour tout ». Il est spécifique à la charge de travail et dépend entièrement de la gamme de services cloud avec laquelle vous êtes en concurrence. Les acheteurs qui disent « nous atteignons 50 millions, nous devrions passer à une solution sur site » comparent généralement avec Claude Opus, où ils ont raison — ignorant qu'un transfert de charge de travail d'Opus vers Sonnet 4.6 leur permet d'économiser cinq fois plus qu'un passage de Sonnet vers une solution sur site à ce volume.

Location de GPU dans le cloud — l'option intermédiaire

Tarifs horaires par GPU, mai 2026 à la demande :

Provider Instance GPU $/h instance $/GPU-h
AWS p5.48xlarge 8× H100 SXM 55.18 6.90
AWS p5e.48xlarge 8× H200 SXM 30.00 3.75
AWS p6-b200 8× B200 74.88 9.36
Azure ND H200 v5 8× H200 31.00 3.88
GCP a3-ultragpu-8g 8× H200 28.00 3.50
Lambda 8× H100 8× H100 16.00 2.00
CoreWeave 8× H100 8× H100 19.20 2.40

Les engagements réservés sur un an bénéficient d'une réduction de 25 à 35 %. AWS p5 à la demande coûte environ trois fois plus cher que Lambda pour la même infrastructure H100. En termes de coût par jeton : huit instances H100 sur Lambda exécutant Llama 3.3 (70 milliards de FP8) à environ 3 1 tok/s en continu → 16 $/h × 8 3,500 × 3 = 8,760 389,000 € sur 3 ans → 1.96 €/Mtok à 60 % d'utilisation. Configuration sur site 4× et 8× Pro 6000 SE (0.53 €/Mtok) et 2.5× juste en appelant ensemble (0.81 €/Mtok).

Louer un H100 pour l'inférence de modèles ouverts est la pire des solutions : le coût de location du matériel et les frais d'exploitation. Ce n'est rentable que si vous avez besoin d'un modèle spécifique non hébergé et que vous n'avez pas le volume nécessaire pour une infrastructure sur site. La location de GPU dans le cloud a toutefois un cas d'utilisation légitime : entraînement par intervallesUn réglage fin de LoRa sur 8 serveurs H100 pendant 8 heures coûte environ 130 $ chez Lambda. Aucun autre service sur site n'offre un coût total de possession (TCO) aussi avantageux pour une opération ponctuelle. Cette logique ne s'applique pas à l'inférence, qui est continue et s'exécute 24 h/24 et 7 j/7. Attention aux solutions « spot » : les niveaux « spot », « préemptible » et « communauté » offrent des réductions de 50 à 80 %, mais sont interruptibles. Cela convient aux répliques d'inférence sans état. Pour une tâche d'entraînement de 18 heures avec un point de contrôle à chaque étape, deux interruptions doublent le coût par étape terminée et le service n'est plus plus économique qu'une solution à la demande.

Des coûts cachés que personne ne mentionne

cloud: Le coût de sortie, de 0.05 à 0.09 $/Go, s'applique lors de l'envoi d'images, de fichiers audio ou vidéo. L'enregistrement des journaux ajoute 5 à 10 % à grande échelle. Contexte de refacturation C'est le pire : chaque API facture le montant total à chaque appel, donc un contexte d'agent de 50 000 jetons coûte 50 000 jetons d'entrée. par étape d'une boucle de 20 étapes. La mise en cache des requêtes (prise en charge par Anthropic, OpenAI et Google) réduit ce temps de 50 à 90 % sur les préfixes mis en cache, à condition d'avoir conçu l'architecture en conséquence. Les limites de débit en production commencent à 30 000 à 500 000 TPM et nécessitent un historique d'utilisation ; les nouveaux clients ne peuvent pas exploiter cette capacité dès le premier jour. Les références pour la région UE sont 10 à 20 % plus chères que celles de la région Est des États-Unis, avec une disponibilité moindre.

Sur site : Le temps d'exploitation, calculé à raison de 0.1 à 0.3 ETP par serveur, s'élève à 8 000 € à 24 000 € par an, hors calcul par Mtok. En cas d'indisponibilité, il est nécessaire de prévoir un système redondant ou une solution de repli cloud fiable. L'électricité ne coûte pas 0.20 €/kWh partout. — Le coût de l'électricité dans le secteur industriel de l'UE en 2026 se situe entre 0.09 €/kWh (Suède, Norvège, hydroélectricité) et 0.35 €/kWh (Italie, Irlande). En Allemagne, il se situe entre 0.18 € et 0.22 €/kWh pour le secteur industriel subventionné, et en République tchèque, entre 0.18 € et 0.25 €/kWh pour le marché commercial ouvert. Pour l'Italie et l'Irlande, chaque tranche d'électricité… T01 Le prix augmente de 50 %. Un rack de colocation coûte entre 100 et 300 € par mois pour 4U, soit entre 3 600 et 10 800 € sur trois ans, en plus du matériel.

Le prix affiché pour le cloud est environ 1.2 à 1.5 fois supérieur à la facture réelle ; le coût total de possession (TCO) publié pour une solution sur site est environ 1.2 à 1.5 fois supérieur au prix catalogue. Les coefficients multiplicateurs s’annulent pour faciliter la comparaison.

Facteurs non liés aux coûts

Pour les vrais acheteurs, trois éléments priment sur le coût par Mtok.

Souveraineté des données. La principale raison pour laquelle les acheteurs européens privilégieront les solutions sur site en 2026 est le RGPD, associé aux réglementations sectorielles (DORA, NIS2, AI Act, MDR). L'envoi de requêtes de production contenant des données personnelles, des dossiers médicaux ou des secrets industriels vers un terminal hébergé aux États-Unis pose un problème contractuel, quel qu'en soit le prix. Les références produits pour l'UE ne signifient pas nécessairement un contrôle européen. Pour un acheteur soumis à la réglementation, le surcoût lié aux solutions sur site n'est pas une dépense, mais le prix à payer pour être légalement autorisé à les déployer.

Plancher de latence. La connexion WAN au point de terminaison hébergé le plus proche ajoute 15 à 40 ms de RTT au sein de l'UE et 80 à 120 ms transatlantiques. Sur site, sur un réseau local 10 GbE, le temps de réponse est inférieur à la milliseconde. Pour une conversation interactive, l'impact du WAN est négligeable par rapport à un TTFT de 800 ms. Pour une boucle de contrôle robotique (I01) ou un agent vocal inférieur à 300 ms, le WAN est fatal.

Personnalisation. Les API cloud fournissent le modèle et la quantification choisis par le fournisseur. Sur site, vous choisissez le modèle, la quantification, la pile de déploiement (vLLM, SGLang, llama.cpp), les adaptateurs LoRa et le décodeur spéculatif. Pour les laboratoires de recherche ou les produits spécialisés, c'est ce que vous achetez ; le coût par Mtok est secondaire.

Si aucune de ces conditions ne s'applique, l'acheteur se situe en dessous du seuil de rentabilité. L'achat d'un serveur n'est pas forcément judicieux pour tous les prospects.

Décision prise : charge de travail de classe 70B sur deux volumes

Profil client : SaaS effectuant la classification et la synthèse de documents, entrée/sortie 70/30, modèle de classe à pondération ouverte 70B.

Option À 100 M tok/mois (3 ans) À 2 B tok/mois (3 ans)
Ensemble (Llama 3.3 70B) €2,916 €58,320
AWS Bedrock (Llama 3.3 70B) €2,412 €48,240
Claude Sonnet 4.6 (référence à la frontière) €21,996 €439,920
Sur site 4× 5090 (amorti) €27,000 €27,000
Lambda 8× H100 auto-hébergé €389,000 €389,000

Avec 100 millions de jetons par mois, Bedrock surpasse largement l'infrastructure sur site ; le client n'a pas encore justifié son investissement. À 2 milliards de jetons par mois, l'infrastructure sur site l'emporte nettement, avec un gain de 1.8 à 2.2 fois, même par rapport à l'alternative hébergée la moins chère. Le seuil de rentabilité pour cette charge de travail se situe entre 800 millions et 1.2 milliard de jetons par mois. En dessous, il est préférable de louer. Au-dessus, il est conseillé d'investir.

Matrice de décision

Volume / mois Modèle 8B–13B modèle 32B modèle 70B Frontière (Claude / GPT-5)
< 100 M tok API cloud API cloud API cloud API cloud
100–500 M tok API cloud ou 4× L4 API cloud API cloud API cloud
500 M – 1 B 4 à 8× L4 sur site 4× 5090 ou Cloud Nuage (Bedrock/Ensemble) API cloud
1–5 B tok 8× L4 sur site 4 × 5090 4× 5090 ou 4× Pro 6000 SE Hybride cloud + sur site
5–50 B tok 8× L4 cluster 4× Pro 6000 BW SE 4–8× Pro 6000 BW SE Frontier cloud + repos sur site
> 50 milliards de tok L4 multi-nœuds 8× Pro 6000 BW SE 8× Pro 6000 SE × N Tarifs entreprise + hybride

Un acheteur prudent (conformément à la réglementation) place la colonne « sur site » une ligne plus haut ; un acheteur expérimental, une ligne plus bas. La colonne « Frontière » est particulière : aucune installation sur site ne remplace Claude Opus 4.7 ou GPT-5. Ce sont des références de qualité que vous utilisez à la demande, et non des charges de travail hébergées.

Le point de vue honnête

La plupart des prospects qui arrivent en pensant avoir besoin d'un serveur n'en ont pas réellement besoin. Avec des volumes typiques (5 à 50 millions de jetons par mois pour un produit en phase de lancement, 50 à 500 millions pour un produit en phase de développement intermédiaire), les API cloud restent la solution optimale pendant encore douze à vingt-quatre mois. La bonne solution est d'utiliser Together ou Bedrock, de surveiller vos dépenses mensuelles et de nous contacter lorsqu'elles dépassent 1 500 € par mois de manière soutenue.

Les acheteurs pour qui le service sur site est pertinent en 2026 se répartissent en trois catégories. RéglementéLes données ne peuvent pas quitter le bâtiment. Soutenu à grande échelle: 1 milliard de jetons/mois sur un modèle de classe 70B où les mathématiques l'emportent de 2 à 3 fois. Robotique ou faible latenceL'infrastructure WAN est un frein pour l'application. Environ 30 à 40 % de nos prospects y sont concernés. Pour les 60 à 70 % restants, les API cloud seront un produit remarquable en 2026 et ils devraient continuer à les utiliser jusqu'à ce que la situation évolue.

L'entraînement est un autre sujet. Presque toutes les charges de travail à l'échelle K-AI (LoRA, QLoRA, ajustement fin de 7 à 32 milliards de données) sont moins coûteuses sur site que la location de GPU dans le cloud : le serveur fonctionne à 100 % pendant l'exécution. L'exception est l'entraînement à très grande échelle (pré-entraînement complet de plus de 70 milliards de données, RLHF à grande échelle) qui nécessite 8 H100 avec NVLink, que nous ne vendons pas.W07 (Cela explique pourquoi). Louez-le, utilisez-le, et ramenez les poids à la maison.

Que faire ensuite

Exécutez cette séquence avant de contacter un fournisseur :

  1. Mesurer le volume mensuel actuel des jetons, ventilé par niveau de modèle. Si vous ne pouvez pas, instrumentez-le pendant deux semaines. Sans ce nombre, chaque étape suivante est une conjecture.
  2. Projet à six mois, de manière prudente — multiplier par 1.5 à 2. Les factures LLM augmentent plus vite que le produit car les contextes s'élargissent et les agents ajoutent des étapes.
  3. Identifiez honnêtement les niveaux. Fraction nécessitant une qualité supérieure ? Fraction correcte sur Sonnet 4.6 / GPT-5 mini ? Fraction correcte sur Llama 3.3 70B ? Répartition typique : 5 % / 25 % / 70 %.
  4. Facture de calcul du cloud au volume prévu par niveau selon le tableau ci-dessus. Il s'agit de votre concurrent.
  5. Calcul sur site pour un boîtier 4× 5090 ou 4× Pro 6000 SE au volume projeté en utilisant T01.
  6. Si les performances du cloud dépassent celles de l'infrastructure sur site de moins de 1.5 fois, restez sur le cloud. Les opérations, les temps d'arrêt et les risques liés aux investissements en capital absorbent les petits gains.
  7. Si le cloud dépasse l'infrastructure sur site d'au moins deux fois, alors le cas de l'infrastructure sur site est bien réel. La souveraineté, la latence et la personnalisation deviennent des critères de départage — ils renforcent presque toujours la solution sur site à cette échelle.
  8. Si le système est réglementé ou soumis à des contraintes de latence, inutile de faire des calculs. Vous achetez sur place de toute façon. Taille avec T01 et W07.

La suite T03 Fonctionnement continu vs pics de charge — quand une solution hybride est pertinente, comment dimensionner une infrastructure sur site de base avec un débordement cloud. Références croisées : T01 (coût total de possession par GPU et tok/s), W07 (sélection du GPU), I04 (les calculs électriques côté mur qui sous-tendent l'hypothèse €/kWh).

Une seule phrase à retenir : La question du coût par million de jetons n'a pas de réponse générale ; elle a une réponse spécifique en fonction de votre charge de travail, de votre volume, de votre niveau de modèle et du prix de l'électricité dans votre pays. Faites vos calculs avant de signer quoi que ce soit.