Jetons par seconde et par euro : rentabilité des GPU pour l’inférence
La plupart des acheteurs se posent la mauvaise question. Ils veulent savoir quel GPU est le plus rapide. Or, pour une charge de travail d'inférence en production, la question pertinente est : « Quel GPU génère le plus de jetons par euro dépensé au cours des trois prochaines années pour le modèle que j'utilise ? » Ces deux questions ont des réponses différentes, et l'écart est tel que privilégier la vitesse brute coûte régulièrement aux clients de Kentino entre 30 et 60 % de leur budget.
Cet article détaille les calculs. Il s'adresse à des personnes qui dimensionnent une architecture d'inférence et qui ont déjà lu cet article. W01 et N03, et doit maintenant choisir entre une RTX 5090, une RTX Pro 6000 Blackwell, une L40 ou une L4 — et combien en acheter.
L'indicateur : pourquoi tok/s par euro, et non tok/s
Deux régimes de performance sont importants, et les confondre est l'erreur de dimensionnement la plus courante.
tok/s à flux unique Il s'agit de ce qu'un utilisateur voit en attendant une réponse. La génération de jetons est limitée par la bande passante et dépend presque entièrement de la bande passante de la VRAM divisée par l'empreinte du modèle (voir W01). Débit soutenu tok/s Il s'agit du volume de données qu'un serveur traite simultanément pour de nombreux utilisateurs, avec le traitement par lots continu activé. Sur du matériel de type Blackwell, cette capacité atteint ses limites de calcul dès que le nombre de lots dépasse 16. C'est ce qui importe en production.
Les performances des deux cartes diffèrent d'un facteur 10 à 25. Un flux unique Llama 70B INT4 sur une RTX Pro 6000 Blackwell atteint environ 32 tok/s. La même carte, avec un traitement par lots de 32 bits et le traitement par lots continu vLLM, dépasse les 600 tok/s agrégés. Privilégier un flux unique sous-dimensionne les déploiements axés sur le débit d'un ordre de grandeur ; privilégier le débit surdimensionne les déploiements sensibles à la latence. Le calcul du coût total de possession (TCO) se base ici sur le débit soutenu, car c'est lui qui représente la part prépondérante du coût.
Prix de détail actuels dans l'UE (mai 2026)
Les prix ci-dessous sont les prix de détail européens, hors TVA, sur le marché libre — et non les contrats de volume OEM ni la location cloud. Données issues des comparateurs de prix et des listes de distributeurs européens (mai 2026). À considérer comme des fourchettes ; des fluctuations trimestrielles de 10 à 20 % sont normales.
| GPU | VRAM | TDP | Prix public conseillé en UE hors TVA |
|---|---|---|---|
| RTX 5090 | 32 GB GDDR7 | 575 W | 2,500 € - 3,000 € |
| Station de travail Blackwell RTX Pro 6000 | 96 Go ECC | 600 W | 8,000 € - 9,500 € |
| RTX Pro 6000 Blackwell Server Edition | 96 Go ECC | 600 W | 8,500 € - 10,000 € |
| L40 | 48 Go ECC | 300 W | 7,500 € - 9,500 € |
| L4 | 24 GB | 72 W | 2,500 € - 3,500 € |
| H100 SXM (référence, non vendu par Kentino) | 80 GB HBM3 | 700 W | 27,000 € - 35,000 € |
Deux observations se dégagent de ce tableau. La Pro 6000 Server Edition coûte environ trois fois plus cher qu'une 5090 pour trois fois plus de VRAM et une bande passante équivalente ; le prix est donc basé sur la capacité mémoire, et non sur la vitesse brute. La L4 est la seule carte de ce tableau à consommer moins de 100 W. Ce seul fait modifie considérablement le coût total de possession (TCO) dès lors que la consommation électrique est prise en compte.
Résultats des benchmarks mono-GPU
Les chiffres ci-dessous proviennent de benchmarks publics (vLLM, llama.cpp, SGLang) collectés auprès de Spheron, CloudRift, RunPod et des propres exécutions publiées par le projet vLLM, de mai 2025 à mai 2026. Il ne s'agit pas du benchmark de Kentino — nous avons effectué une vérification croisée avec nos boîtiers internes 4×5090 et 4×Pro 6000 pour les cellules que nous servons régulièrement ; les chiffres publics suivent à ±15 %.
Llama 3.3 70B FP8 — décodage à flux unique
| GPU | tok/s | Remarques |
|---|---|---|
| RTX 5090 | n/a | Les poids FP8 de 75 Go ne tiennent pas sur une carte de 32 Go. |
| Station de travail RTX Pro 6000 BW | 28-34 | Tient sur une carte avec marge KV |
| RTX Pro 6000 BW Server Ed. | 28-34 | Même silicium, températures du serveur |
| L40 | n/a | 48 Go, trop peu pour FP8 70B ; uniquement INT4. |
| L4 | n/a | Hors classe |
| H100 SXM (référence) | 55-65 | avance en bande passante HBM3 |
Llama 3.3 70B INT4 (AWQ) — décodage à flux unique
| GPU | tok/s | Remarques |
|---|---|---|
| RTX 5090 | n/a seul | 40 Go INT4 déborde sur 32 Go ; nécessite 2× |
| 2× RTX 5090 (TP=2) | 24-30 | Taxe PCIe TP visible |
| RTX Pro 6000 BW | 30-36 | Confortable à porter, plus de 50 Go gratuits pour KV |
| L40 | 14-18 | GDDR6 ECC, bande passante réduite |
| L4 | 4-6 | 24 Go suffisent à peine pour les poids, lent |
Qwen 2.5 32B INT4 (AWQ) — flux unique
| GPU | tok/s | Remarques |
|---|---|---|
| RTX 5090 | 55-65 | Poids de 18 à 20 Go, KV dans les 12 Go restants |
| RTX Pro 6000 BW | 55-65 | Bande passante équivalente à celle du 5090 ; marge de manœuvre au niveau des poids. |
| L40 | 28-34 | Bande passante limitée |
| L4 | 9-12 | Mémoire limitée, débit limité |
Llama 3 8B FP16 — flux unique et agrégé
| GPU | Tok unique/s | Agrégat au lot 32 |
|---|---|---|
| RTX 5090 | 90-110 | 3,200-3,800 |
| RTX Pro 6000 BW | 90-110 | 3,400-4,000 |
| L40 | 45-55 | 1,400-1,800 |
| L4 | 20-28 | 380-550 |
Quelques lectures honnêtes tirées de ces tableaux. Les Blackwell 5090 et Pro 6000 possèdent une bande passante identique (1.79 To/s) et des taux de décodage identiques par jeton. Les différences résident dans la capacité de la VRAM et la correction d'erreurs (ECC), et non dans la vitesse. La L40 affiche une vitesse d'inférence environ deux fois inférieure à celle des cartes Blackwell, car la mémoire GDDR6 ECC atteint 860 Go/s contre 1 790 Go/s. La L4, quant à elle, offre une bande passante quatre fois moindre ; elle compense ce défaut par sa densité et son prix.
Pour les calculs mono-flux de classe 70 octets, la Pro 6000 Blackwell est la seule carte capable d'exécuter le modèle en FP8 sur un seul emplacement. La 5090 impose l'utilisation d'INT4 et du parallélisme tensoriel bidirectionnel ; or, avec TP=2 sur PCIe, les performances sont réduites de 30 à 35 % (voir [référence manquante]). N03).
Mise à l'échelle multi-GPU : le coût du PCIe
Le traitement parallèle des tenseurs PCIe uniquement n'évolue pas linéairement. Nous avons abordé ce mécanisme dans N03; voici les multiplicateurs empiriques que vous devriez intégrer dans un modèle de coût total de possession (TCO).
| GPU | Configuration | Évolution réaliste du débit par rapport à 1× |
|---|---|---|
| 1 × | de base | 1.00 |
| 2 × | TP=2 PCIe Gen5 | 1.50-1.70 |
| 4 × | TP=4 PCIe Gen5 | 2.5-3.0 |
| 8 × | TP=4 × PP=2 (préférable) | 5.0-6.0 |
| 8 × | TP=8 PCIe (à éviter) | 4.0-4.8 |
Les chemins parallèles pipeline et données-parallèles évoluent de manière quasi linéaire ; le traitement parallèle tensoriel engendre un surcoût qui augmente avec le nombre de GPU. Pour un modèle de classe 70B, la configuration optimale sur 8 × 5090 est de deux répliques indépendantes (DP = 2 × TP = 4) ou TP = 4 × PP = 2 — et non TP = 8. Voir K03 pour les règles de configuration.
Cela a une incidence sur les coûts, car doubler le nombre de GPU ne double jamais le débit. Une estimation budgétaire simpliste du type « deux fois plus de GPU, deux fois plus de tok/s » est 30 à 50 % trop optimiste.
Le modèle de coût total de possession (TCO) sur 3 ans
Le prix catalogue d'un GPU représente environ la moitié de son coût réel d'utilisation sur trois ans. L'autre moitié correspond à la consommation électrique, à l'espace occupé dans le châssis et au sol. Le modèle ci-dessous est celui que nous utilisons en interne pour le dimensionnement de K-AI.
Per-GPU 3-year TCO =
GPU cost
+ Chassis share (chassis + CPU + RAM + PSU + NIC) / GPU count
+ Electricity: TDP × utilization × 8,760 h × 3 × €0.20/kWh
+ Colo/rack space share
+ Maintenance & spares (~5% of GPU cost / year)
Hypothèses utilisées ci-dessous :
- Electricité: 0.20 €/kWh (prix moyen pour les coentreprises industrielles ou les centres de données détenus en Europe). En République tchèque, le prix de détail se situe généralement entre 0.18 € et 0.22 € ; il est plus élevé en Allemagne.
- Utilisation: 60 % maintenus (une charge de production réaliste – pas le chiffre de référence de 100 %, pas le chiffre de laboratoire de 5 %).
- PUE : 1.4. Frais généraux du centre de données (refroidissement, pertes de distribution). Cela porte le coût effectif de l'électricité à 0.28 €/kWh de consommation GPU.
- Partage du châssis : 4 000 € amortis sur 4 GPU (1 000 €/GPU) pour une configuration Kentino 4-GPU 5090 ; 8 000 € sur 8 (1 000 €/GPU) pour le châssis Pro 6000 à 8 GPU.
- Entretien: 5 %/an du coût du GPU (fonds de réserve pour les cartes de rechange + temps consacré aux pilotes/opérations).
Tableau des coûts totaux par GPU
| GPU | Carte € | Châssis € | Électricité € (3 ans) | Maintenance € (3 ans) | TCO 3 ans € |
|---|---|---|---|---|---|
| RTX 5090 | 2,800 | 1,000 | 2,540 | 420 | 6,760 |
| RTX Pro 6000 BW WS | 8,800 | 1,000 | 2,650 | 1,320 | 13,770 |
| RTX Pro 6000 BW SE | 9,400 | 1,000 | 2,650 | 1,410 | 14,460 |
| L40 | 8,500 | 1,000 | 1,325 | 1,275 | 12,100 |
| L4 | 3,000 | 800 | 318 | 450 | 4,568 |
| H100 SXM (réf.) | 30,000 | 3,500 | 3,090 | 4,500 | 41,090 |
Calcul de la consommation électrique : PTE × 0.60 × 8 760 × 3 × 0.20 × 1.4 (PUE) / 1 000. La ligne L4 est particulièrement frappante : sa facture d’électricité sur 3 ans s’élève à 318 €. Celle de la ligne 5090 est de 2 540 €. Une consommation huit fois supérieure engendre une facture huit fois plus élevée.
Coût par million de jetons
Combinez maintenant le coût total de possession (TCO) avec le débit soutenu mesuré sur une charge de travail représentative : Llama 3.3 70B INT4 au lot 32, ou Qwen 32B au lot 32, ou Llama 8B au lot 64. Prenez le débit soutenu de jetons par seconde (tok/s) d'une carte, multipliez-le par 0.60 (taux d'utilisation) × 3 × 8 760 × 3 600 pour obtenir le nombre total de jetons distribués, puis divisez le TCO par ce résultat. Les chiffres ci-dessous sont donnés à titre indicatif ; adaptez-les à votre modèle et à votre lot réels.
| GPU | Charge de travail | tok/s soutenus | Jetons/3 ans (B) | € / Mtok |
|---|---|---|---|---|
| RTX 5090 | Lama 8B FP16 lot 64 | 3,500 | 199 | 0.034 |
| RTX 5090 | Qwen 32B INT4 lot 32 | 600 | 34 | 0.20 |
| Pro 6000 BW | Lama 70B FP8 lot 32 | 480 | 27 | 0.51 |
| Pro 6000 BW | Qwen 32B INT4 lot 32 | 650 | 37 | 0.37 |
| L40 | Lama 8B FP16 lot 64 | 1,600 | 91 | 0.13 |
| L40 | Qwen 32B INT4 lot 32 | 320 | 18 | 0.67 |
| L4 | Lama 8B FP16 lot 64 | 450 | 26 | 0.18 |
| L4 | Lama 8B FP8 lot 128 | 650 | 37 | 0.12 |
La troisième colonne indique le coût par million de jetons distribués, soit le coût total de possession (TCO) en pleine charge. Les API OpenRouter et cloud pour les mêmes modèles facturent entre 0.10 € et 2.00 € par million de jetons selon le niveau de service ; ainsi, les solutions sur site se situent dans la même gamme de prix, voire sont moins chères en cas de charge soutenue. Le calcul devient non rentable en dessous de 30 % d’utilisation : le TCO est alors principalement déterminé par les dépenses d’investissement engagées, que le service soit utilisé ou non.
L'affaire de 5090
Sur le papier, la 5090 offre le meilleur rapport débit brut (tok/s/s)/euro de toute la gamme Kentino pour l'inférence inférieure à 72 octets. 2 800 € pour 1.79 To/s de bande passante et 32 Go de GDDR7, c'est une carte performante. Pour un serveur mono-utilisateur avec un modèle de classe 32 octets, aucune autre carte n'offre un rapport aussi avantageux.
Le 5090 présente deux faiblesses :
- Modèles qui ne rentrent pas dans une capacité de 32 Go à la quantité souhaitée. Un FP8 de 70 octets (~75 Go) nécessite 3 à 4 cartes ; un INT4 de 70 octets (~40 Go) en nécessite 2. Une fois que vous utilisez le parallélisme tensoriel sur PCIe, vous payez la taxe de réduction totale de 30 à 50 % et votre tok/s par carte s'effondre.
- Mise à l'échelle multi-GPU au-delà du parallélisme de pipeline. Le 8× 5090 est un produit réel (nous le fabriquons), mais le débit par carte sur un processeur 70B parallèle Tensor est environ 0.55 fois supérieur à celui d'une seule carte. Vous avez acheté huit cartes et obtenu un débit 4.4 fois supérieur, et non 8 fois supérieur.
Le point fort du 5090 réside dans sa capacité à héberger plusieurs répliques de modèles plus petits. Quatre 5090 exécutant quatre répliques indépendantes de Qwen 32B derrière un équilibreur de charge surpassent quatre 5090 parallélisant un seul Llama 70B en termes de débit et de latence, et évitent totalement la pénalité PCIe.
Étui Blackwell Pro 6000
96 Go de mémoire GDDR7 ECC à 1.79 To/s : c'est la solution idéale lorsque 70 octets de FP8 doivent tenir sur une seule carte et que vous souhaitez éviter les problèmes liés au PCIe. Les versions Station de travail et Serveur partagent le même processeur, la même mémoire et la même bande passante ; la différence réside dans le format (refroidissement actif contre passif), le BIOS haute consommation et la validation pour les châssis de serveurs OEM. La version Serveur coûte entre 700 et 1 500 € de plus et est le choix idéal pour toute configuration rackable fonctionnant 24 h/24 et 7 j/7.
Points forts du Pro 6000 en termes de tok/s par euro :
- Hébergement d'une carte FP8 70B. Pas de parallélisation tensorielle, pas de surcharge PCIe. Flux unique à plus de 30 tok/s, agrégation par lots à plus de 480 tok/s.
- Extension horizontale via des répliques. 4× Pro 6000 = quatre répliques indépendantes de 70 octets derrière un routeur. Évolutivité linéaire du débit, isolation des pannes en douceur.
- ECC pour la formation. Si la charge de travail inclut le réglage fin ou le réentraînement complet de LoRA/QLoRA, ECC justifie son coût (voir W01).
Dans quels cas la Pro 6000 est surdimensionnée : pour toute configuration ne nécessitant pas plus de 32 Go par carte. Si tous vos modèles tiennent sur une 5090, vous payez trois fois le prix pour de la VRAM inutilisée. C’est un problème récurrent : un client choisit la Pro 6000 car c’est la carte « professionnelle », puis utilise un modèle 13B avec cette dernière.
Le boîtier L40
Le L40 se trouve dans une situation délicate. Avec 48 Go de mémoire ECC, de la GDDR6 (et non de la GDDR7) et une bande passante de 860 Go/s, il offre environ la moitié des performances d'inférence d'un Blackwell Pro 6000, pour un prix 75 à 90 % inférieur. En termes de débit binaire par euro (tok/s) par unité de mesure (en inférence), le Pro 6000 l'emporte.
Le boîtier du L40 repose sur trois autres axes :
- TDP. 300 W contre 600 W. Soit la moitié de la consommation électrique sur trois ans (1 325 € contre 2 650 € dans notre modèle). Dans les baies à contraintes thermiques ou sur les circuits monophasés, cela correspond à la différence entre quatre cartes et deux.
- Validation du centre de données. Le L40 est livré avec un refroidissement passif, une validation OEM pour Supermicro, Dell et HPE, et une garantie standard de 5 ans pour les centres de données. La station de travail Pro 6000 n'est pas validée pour un fonctionnement continu 24 h/24 et 7 j/7 ; la version serveur l'est, mais elle est plus récente sur le marché.
- Plafond de fiabilité. Le L40 est conçu spécifiquement pour supporter une charge serveur soutenue. Le temps moyen entre les pannes sur une charge de travail d'inférence 24h/24 et 7j/7 est sensiblement meilleur que celui du 5090 destiné au grand public.
En toute franchise : si votre client privilégie la disponibilité au débit brut de tok/s (secteurs réglementés, contrats SLA d'astreinte, ou toute situation où une panne de carte en pleine nuit engendre des pertes financières), le L40 justifie son surcoût en tok/s par euro. En revanche, pour un rapport qualité-prix optimal, ce n'est pas le cas.
Le boîtier L4
La L4 est celle dont personne ne parle et que la plupart des clients devraient acheter. 24 Go, 72 W, simple emplacement, sans connecteur d'alimentation, refroidissement passif. Huit modules tiennent dans un serveur 1U. Seize tiennent dans un serveur 2U.
Les points forts du L4 :
- Modèle de classe 8B en service à grande échelle. La Llama 3 8B FP8 (lot 64) atteint environ 650 tok/s par carte. Huit processeurs L4 dans un même châssis permettent d'atteindre un débit cumulé de 5 000 tok/s pour un terminal Llama 8B. Ce même châssis consomme 600 W de puissance GPU.
- Densité multi-répliques. Chaque couche L4 héberge un modèle 8B indépendant. Huit répliques sont placées derrière un équilibreur de charge, sans aucune communication inter-GPU. La défaillance d'une carte entraîne une perte de capacité d'un huitième, et non l'arrêt complet du service.
- Sites à consommation d'énergie limitée. Un circuit de 16 A peut alimenter douze processeurs L4 plus la surcharge du système hôte. Le même circuit peine à alimenter trois processeurs 5090.
- Coût par million de jetons. À 0.12 €/Mtok pour 8 milliards de FP8, le L4 est moins cher que toutes les API cloud pour la même classe de modèles.
Points faibles de la carte L4 : tout ce qui dépasse 13 milliards de bits, tout ce qui nécessite une bande passante importante, et tout type d’entraînement. La carte L4 est une carte d’inférence à fonction fixe, conçue pour les modèles de petite et moyenne taille. Si votre charge de travail ne correspond pas à ces spécifications, passez votre chemin.
Comparaison honnête vs cloud
Comparaison des coûts cloud pour une configuration identique. AWS p5.48xlarge (8 × H100 SXM) est proposé à 98.32 $/h à la demande, soit environ 12.29 $ par heure GPU. Les clouds spécialisés en IA (Lambda, RunPod, CoreWeave) coûtent entre 2.00 $ et 4.00 $ par heure H100 à la demande, et moins cher avec un engagement d'un an.
Coût du cloud à la demande sur trois ans pour un emplacement d'inférence équivalent à un H100 :
- AWS à la demande : 12.29 $ × 8 760 × 3 = $323,000
- Cloud IA spot/à prix réduit : 2.50 $ × 8 760 × 3 = $65,700
- 1 an de réservation pour le cloud IA : ~1.80 $ × 8 760 × 3 = $47,300
Serveur Kentino Pro 6000 8× sur site : coût total de possession (TCO) d'environ 115 000 € sur trois ans pour huit cartes. 14 400 € par carte. Cela représente environ… un quart du cloud H100 le moins cher réservé pour un débit comparable en termes d'inférence (la bande passante du Pro 6000 atteint environ 60 à 70 % de celle du H100 SXM sur les charges de travail d'inférence non dépendantes de NVLink).
Seuil de rentabilité par rapport à la réservation H100 pour le cloud IA : Le boîtier 8× Pro 6000 sur site est rentabilisé à environ 50 % d'utilisation soutenue sur trois ans. En dessous de ce seuil, la location. Au-dessus, l'achat. C'est le même calcul auquel arrive tout acheteur sérieux d'infrastructure sur site, et la raison pour laquelle l'option sur site n'est pas obsolète en 2026 malgré la baisse des coûts du cloud.
matrice de recommandation de charge de travail pour GPU
| Charge de travail | GPU de premier choix | Pourquoi |
|---|---|---|
| Lama 8B / Qwen 7B / Mistral 7B à l'échelle | L4 (multiple) | Meilleur tok/s/€ sur les petits modèles, puissance minimale |
| Utilisateur unique, classe 32B, sensible à la latence | RTX 5090 | Meilleur rapport bande passante/€, compatible avec INT4 |
| Classe 32B multi-utilisateurs, sensible au débit | 2 cartes RTX 5090 ou 1 cartes Pro 6000 | Réplique à l'échelle ou carte unique si le budget le permet. |
| Inférence 70B, utilisateur unique, qualité FP8 | RTX Pro 6000 Blackwell | Seule carte compatible avec 70 FP8 sur un seul emplacement |
| Inférence 70B, multi-utilisateurs, débit | 4× Pro 6000 BW (répliques DP) | Mise à l'échelle linéaire sans taxe PCIe TP |
| Réglage fin 70B (LoRA / QLoRA) | RTX Pro 6000 Blackwell SE | ECC, validation 24h/24 et 7j/7, compatible avec les fichiers KV d'entraînement de 96 Go |
| Formation 70B à partir de zéro | Pas la formation de Kentino | Louez un NVLink H100/B200, puis apportez les poids sur place. |
| Inférence mixte + entraînement léger, site réglementé | L40 | ECC, fiabilité soutenue, centre de données validé |
| Budget énergétique limité pour les racks, densité 1U | L4 (8× par 1U) | 72 W à un seul emplacement, ECC non nécessaire pour l'inférence |
| 405B inférence dense | 3× Pro 6000 BW (PP) | Seul chemin possible sur le matériel Kentino ; voir K03 |
Le point de vue honnête
La plupart des clients de Kentino demandent quelle carte graphique est la plus rapide. Pour leurs besoins réels (un modèle de conversation de 7 ou 8 bits, un modèle de raisonnement de 32 bits, ou encore un modèle de vision de 7 à 13 bits), la solution la plus adaptée est une L4 ou une 5090, et non le modèle haut de gamme. Le surcoût de la Blackwell Pro 6000, à notre tarif, est de 5 000 à 7 000 € par carte. Avec quatre cartes par configuration, cela représente 20 000 à 28 000 € de VRAM payée sans être utilisée.
Il s'agit de déterminer les modèles, le niveau de concurrence et la fenêtre de contexte appropriés, puis d'adapter la taille en conséquence. Un contrat plus modeste garantit le retour du client lors de la montée en charge.
Que faire ensuite
Si vous dimensionnez une configuration, suivez ces étapes dans l'ordre :
- Énumérez tous les modèles que vous devez prendre en charge, avec quantification et contexte. Notez-les. Llama 3.3 70B INT4 @ 8K. Qwen 32B INT4 @ 32K. Llama 8B FP8 @ 16K. Sans cette liste, chaque étape suivante sera une supposition.
- Calculer l'empreinte VRAM la plus importante d'une instance unique (Poids + KV à la concurrence cible). Cela représente votre minimum de VRAM par carte.
- Calculer la cible de tok/s soutenue. Nombre d'utilisateurs simultanés × jetons par seconde et par utilisateur × cycle de service. Cela détermine le nombre de cartes nécessaires.
- Associer au GPU. Si la capacité de stockage est inférieure à 32 Go : 5090 ou L4. Si elle est inférieure à 48 Go : L40 ou carte multi-cartes 5090. Si elle est comprise entre 48 et 96 Go : Blackwell Pro 6000. Si elle est supérieure à 96 Go : carte multi-cartes PP (et non TP).
- Calculez le coût total de possession (TCO) sur 3 ans en fonction de votre utilisation réelle. Si votre cycle d'utilisation est inférieur à 30 %, envisagez plutôt le cloud. S'il est supérieur à 50 %, l'infrastructure sur site est clairement la meilleure option.
- Ajoutez une marge de 30 % Quel que soit le nombre de GPU calculé, les charges de travail réelles augmentent, la taille des modèles aussi, et la sous-estimation du cache KV est systématique.
Les articles suivants de cette série reprennent les mêmes chiffres sous différents angles : coût par million de jetons avec une ventilation sur site par rapport au cloud (T02) et l'économie de l'inférence soutenue par rapport à l'inférence par rafales (T03). Les fondements de la sélection du GPU résident dans W07et les choix de parallélisme qui déterminent le coût total de possession (TCO) multi-GPU sont dans K03.
La seule phrase à retenir : La plupart des clients demandent lequel est le plus rapide alors qu'ils devraient demander lequel est le moins cher compte tenu de ma charge de travail. La solution la plus rapide est rarement la moins chère.
Ceci fait partie du Kentino Wiki, une série de référence sur l'intelligence artificielle, la robotique et les systèmes qui les connectent. Commentaires et corrections bienvenus. info@kentino.com.