Dimensionnement des systèmes d'alimentation sans coupure (UPS) pour le calcul IA : topologie, chimie des batteries, autonomie et piège du kVA

L'installation d'un onduleur en amont d'un serveur d'IA est un poste de dépense où la différence entre un choix judicieux et un choix économique réside davantage dans la connaissance du produit acheté que dans le prix lui-même. Un modèle de 6 kVA étiqueté « 6 000 W » ne correspond souvent pas à une puissance réelle de 6 kW. Un onduleur interactif, trois fois moins cher qu'un modèle à double conversion, convient pour un poste de travail, mais peut parfois provoquer une panne sur un nœud équipé de 4 GPU.

Il s'agit de la protection UPS pour le matériel Kentino : serveurs d'IA Kentino à 4 et 8 GPU sur cartes graphiques grand public (RTX 5090, 4090) et station de travail (RTX Pro 6000 Blackwell). Références croisées : W04, P01 , P03 , I04, P06 , L05.

Pourquoi un serveur d'IA a-t-il besoin d'un onduleur ?

Non destiné à assurer la continuité d'exécution. Les tâches d'entraînement sont sauvegardées ; l'inférence est interrompue et redémarrée. En cas de coupure de courant de 90 minutes, la tâche est perdue depuis la dernière sauvegarde ; le modèle, les données et le matériel sont conservés. Ce que l'onduleur permet d'acheter :

  1. Arrêt en douceur. Un redémarrage brutal en pleine charge est problématique : les systèmes de fichiers en cours d’écriture peuvent devenir incohérents (le journal gère certaines opérations, mais pas les points de contrôle interrompus ni les écritures de base de données en cours). Avec un onduleur, le serveur vide les files d’attente, synchronise les systèmes de fichiers, envoie les signaux SIGTERM vLLM ou SGLang, puis s’éteint via le système d’exploitation — cela prend entre trois et cinq minutes sur un nœud optimisé.
  2. Passage passager. La tension du réseau chute pendant des dizaines, voire des centaines de millisecondes. Généralement, l'alimentation compense ; parfois, le serveur redémarre silencieusement. Pire encore : le GPU subit une sous-tension de 12 V pendant quelques millisecondes, réduit sa fréquence boost, génère des erreurs ECC et les résultats d'inférence sont légèrement erronés pendant plusieurs minutes, jusqu'à la réinitialisation du pilote. Le problème a été diagnostiqué des semaines plus tard, suite à l'augmentation de la perplexité.
  3. Conditionnement électrique. La double conversion régénère le courant sinusoïdal de sortie à partir du bus CC. L'alimentation reçoit une tension propre de 230 V, quelle que soit la qualité du réseau électrique.

Un onduleur n'est pas conçu pour : assurer l'alimentation pendant une panne prolongée. Dimensionné pour 5 kW pendant dix minutes, il équivaut déjà à plusieurs kVA de batterie ; dimensionné pour une heure, il représente une pièce entière. Pour une véritable autonomie, un groupe électrogène ( P06 ) est nécessaire.

Le piège du kVA par rapport au kW

La puissance apparente (kVA) est égale à la valeur efficace de la tension (V) multipliée par la valeur efficace du courant (I). La puissance active (kW) correspond à la puissance qui fournit réellement un travail. Le facteur de puissance (PF) est égal à kW divisé par kVA.

Pour les charges non linéaires (PF < 1.0), l'onduleur fournit toujours la pleine puissance apparente (kVA). Les anciens modèles indiquaient une puissance apparente (VA) pour un PF de 0.6 à 0.8. Un onduleur « 6 kVA » de 2010 pouvait avoir une puissance réelle de 4 kW, ce qui explique la plupart des surprises liées à une puissance annoncée de 6 000 VA mais une puissance de coupure de 4 500 W.

Les alimentations modernes à intelligence artificielle (IA) changent la donne. La correction active du facteur de puissance (PFC) depuis environ 2010 abaisse le facteur de puissance à environ 0.95–0.99. Les alimentations IA Kentino (Corsair AX, Seasonic PRIME, Super Flower Leadex, Supermicro CRPS) fonctionnent avec un facteur de puissance supérieur ou égal à 0.97. Les alimentations modernes pour serveurs atteignent un facteur de puissance d'environ 0.99, ce qui assure une meilleure cohérence entre la puissance apparente (kVA) et la puissance apparente (kW) des onduleurs.

Unité kVA kW PF
Onduleur APC Smart-UPS SRT 6000 / 8000 6/8 6/8 1.0
Générateur au lithium Eaton 9PX 6 kVA 6 5.4 0.9
Eaton 9PX 11 kVA 11 10 0.91
Riello Sentinel Double SDU 10000 10 10 1.0
Vertiv Liebert EXM (modulaire) 30-250 allumettes 1.0
Schneider Galaxy VS allumettes 20-150 1.0

Les onduleurs interactifs (Vertiv Liebert PSI5, APC Smart-UPS SMT) conservent un facteur de puissance d'environ 0.9. Pour les onduleurs à double conversion de 6 kVA et plus, considérez que kVA ≈ kW à 10 % près et consultez la fiche technique. Dimensionnez en fonction de la puissance en kW, puis vérifiez que la puissance apparente (kVA) est suffisante.

Double conversion en ligne vs interactive en ligne

Trois classes UPS ; une seule convient à l'IA.

Veille (hors ligne). Transfert de 8 à 25 ms, souvent sinusoïdal par paliers. 100 € par unité de bureau. Ignorer.

Interactif au réseau. Autotransformateur pour la correction des baisses de tension et des surtensions sans recours à la batterie. Transfert de 2 à 10 ms. Compatible avec Vertiv Liebert PSI5, APC Smart-UPS SMT et Eaton 5PX. Convient aux applications bureautiques. Non adapté au calcul haute performance pour l'intelligence artificielle.

Double conversion en ligne. La charge est alimentée en permanence par l'onduleur, via un bus CC provenant d'un redresseur et d'une batterie en parallèle. En cas de coupure d'entrée, la batterie prend le relais sur le bus CC ; l'onduleur n'est jamais averti. Temps de transfert nul , sortie entièrement régénérée. APC Smart-UPS SRT, Eaton 9PX, Vertiv Liebert GXT5/EXM, Riello Sentinel Dual SDU/SDH, Schneider Galaxy VS.

Pourquoi la double conversion ? Un transfert de 4 à 10 ms sature une alimentation proche de sa capacité nominale (un nœud d'IA Kentino de 5 kW à 70 % de charge subit une interruption d'environ 12 ms ; un transfert de 6 ms consomme la moitié de l'énergie sans marge pour les pics transitoires). Une chute de tension momentanée de 12 V se propage à l'entrée VRM du GPU, entraînant des baisses de fréquence, des erreurs ECC, voire la déconnexion de la carte. Les alimentations ATX et CRPS modernes sont sensibles à la tension sinusoïdale modifiée. La double conversion élimine ces trois problèmes.

Coût : Les systèmes à double conversion de 6 kVA coûtent entre 1 500 et 2 500 € ; les systèmes interactifs entre 700 et 1 200 €. Pour une configuration serveur de plus de 30 000 €, plus plus de 5 000 € de frais d’électricité et de refroidissement, cette différence de 1 000 € représente l’assurance la plus économique.

Calcul du dimensionnement : puissance réelle + marge de sécurité

P_ups_kW   =  (P_server + P_network + P_workstation_critical) × 1.25
P_ups_kVA  =  P_ups_kW / PF_load   (PF ≈ 0.97 for AI PSUs)

La version 1.25 couvre les pics transitoires du GPU (une 5090 atteignant 600 W pendant 5 ms) et une croissance de 10 %.

Se construisent kW soutenu × 1.25 UPS kVA min
Kentino IA à 4 GPU 2.4 3.0 3 kVA
4 GPU + serveur de rebond + commutateur 2.7 3.4 4 à 5 kVA
Kentino IA à 8 GPU 5.0 6.25 6 à 8 kVA
8 GPU + réseau + stockage 5.5 6.9 8 kVA
Rack 2×8 GPU 10 12.5 15 à 20 kVA
Rack 4×8 GPU 20 25 30 kVA modulaire

Les postes de travail n'ont généralement pas besoin d'onduleur : les opérateurs rétablissent la connexion SSH après une coupure d'une minute. En revanche, le matériel réseau en a besoin : un serveur qui survit mais ne peut pas accéder au réseau de l'opérateur pendant l'arrêt est considéré comme totalement hors service. Il faut donc inclure le commutateur ToR et le point d'accès de gestion.

Installation raisonnable : chargez l’onduleur à 70–80 % de sa puissance nominale (kW). En dessous de 50 %, l’investissement est inutilement gaspillé pour un fonctionnement moins efficace ; au-dessus de 85 %, la marge de manœuvre est insuffisante et l’onduleur se met en sécurité dès le premier pic de consommation du GPU.

dimensionnement de l'exécution

Doubler l'autonomie revient à plus que doubler le coût de la batterie, car des batteries plus grandes nécessitent également un onduleur plus puissant.

Cas d'utilisation Objectif Remarques
Arrêt en douceur uniquement 5 min Vidange, synchronisation, mise hors tension
Traversez les brefs événements de la grille 10 min Couvre environ 95 % des pannes
Transfert du pont au générateur 2 min ATS + groupe électrogène = 10–30 s typique
Poursuivre l'inférence malgré la panne 30 minutes et plus Mauvaise réponse — procurez-vous un générateur

Pour Kentino AI, visez 10 à 15 minutes à charge soutenue . Cinq minutes suffisent techniquement pour un arrêt propre, mais ne laissent aucune marge en cas de fluctuations du réseau (coupure, rétablissement pendant 30 secondes, nouvelle coupure). Quinze minutes permettent à l'opérateur de se connecter et de décider de maintenir le système en fonctionnement ou de l'arrêter.

Un onduleur de 6 kVA avec batteries internes offre généralement une autonomie de 4 à 6 minutes. Dix personnes nécessitent un coffret de batteries externe, quinze en nécessitent deux. Chaque coffret représente environ 30 à 40 % du prix de l'onduleur. L'autonomie est le principal facteur de coût.

Montée en puissance du coût d'exploitation — Groupe électrogène à double conversion de 8 kVA en service à pleine charge
Runtime Configuration UE hors TVA
4 – 5 min Onduleur uniquement, batteries internes 3 000 € – 4 500 €
8 – 10 min Onduleur + 1 armoire externe (VRLA) 4 500 € – 6 500 €
15 min Onduleur + 2 armoires externes 6 500 € – 9 000 €
30 min Onduleur + 4 armoires externes 11 000 € – 15 000 €
60 min Onduleur + 8 armoires, ou générateur à la place 18 000 € et plus — générateur

Le seuil de rentabilité du générateur se situe autour de 20 à 30 minutes à 5 kW. Ci-dessous : batteries. Ci-dessus : générateur + pont UPS plus petit ( P06 ).

Lithium contre VRLA : le tableau de 2026

Les batteries lithium-ion (LFP — lithium fer phosphate, stationnaire à chimie sûre) ont franchi le seuil de rentabilité au cours des trois dernières années, et tous les principaux fournisseurs livrent désormais des variantes lithium de leurs lignes de double conversion de milieu de gamme.

Propriétés VRLA Lithium (LFP)
Investissements par kWh intégrés 100–200 €/kWh 300–500 €/kWh
Multiplicateur des dépenses d'investissement 1 × 2 à 3×
Durée de vie du service 3 à 5 ans 8 à 10 ans
Cycles de charge jusqu'à 80 % 200-400 1500-3000
Recharge 0 → 90 % 8 – 12 h 2 – 4 h
Empreinte au sol par kWh 1 × 0.5 à 0.7×
Température tolérée meurt rapidement à >25 °C −10 à 40 °C
Télémétrie BMS aucun/basique riche, par cellule
TCO sur 10 ans 1× ligne de base 0.5 à 0.65×

Le coût total de possession (TCO) dépend du vieillissement des batteries VRLA dans la pièce. Un onduleur installé dans un local à 30 °C consomme des batteries VRLA tous les 18 à 24 mois ; le lithium est amorti en deux à trois ans. Dans un laboratoire à 22 °C, les batteries VRLA peuvent durer cinq ans, le lithium étant alors amorti sur une période plus longue. Le TCO du lithium est inférieur d'environ 35 % sur 10 ans ; certains fournisseurs annoncent une réduction de 50 %.

Le lithium est la technologie par défaut pour les nouvelles installations de plus de 3 kVA. Le système de gestion de batterie (BMS) permet également à l'onduleur de détecter la fin de la charge de sa batterie. Les batteries VRLA restent pertinentes pour la protection des très petites puissances (1 à 3 kVA) et comme batteries de remplacement dans les unités non lithium.

Choix concrets par niveau Kentino AI

Les familles de fournisseurs, et non les références (SKU) — les familles sont stables, les numéros de modèle fluctuent.

Onduleur Kentino AI 4 GPU (2.4 kW en continu, 3.0 kW en transitoire) : 3 kVA / 2.7 kW double conversion, lithium. Comparable aux modèles APC Smart-UPS SRT 3000, Eaton 9PX 3000, Vertiv Liebert GXT5 3000 et Riello Sentinel Dual SDU 3000. Durée d'arrêt interne : environ 5 minutes, suffisante pour un arrêt en douceur. Prix : 1 500 € à 2 500 € (lithium), 1 000 € à 1 600 € (VRLA). Format convertible 2U à 3U.

Groupe électrogène Kentino AI 8 GPU (5 kW en continu, 6 kW en transitoire) : 6 kVA / 5.4–6 kW double conversion, lithium. Compatible avec les systèmes APC Smart-UPS SRT 6000, Eaton 9PX 6000, Vertiv Liebert GXT5 6000 et Riello Sentinel Dual SDH 6000. Autonomie : 4 à 6 min en interne ; 10 à 12 min en externe (une armoire). Coût : 3 000 à 5 000 € (lithium), 2 000 à 3 500 € (VRLA), plus 1 000 à 2 000 € par armoire. Format : 4U à 6U.

Baie de 4 serveurs de 8 GPU (20 kW en continu) : 20 à 30 kVA centralisés, ou 6 kVA par serveur. Centralisée : APC Smart-UPS SRT 20000, Eaton 9PX 22 kVA, Vertiv Liebert APM, Schneider Galaxy VS 20 kW – 12 000 à 20 000 € (batterie lithium pour 10 minutes d’autonomie). Par serveur : 4 serveurs de 6 kVA, 16 000 à 22 000 € au total.

Une solution centralisée est plus efficace (un onduleur à 96-97 % contre quatre à 92-94 %), occupe moins d'espace dans les racks et est moins chère au kW au-delà de 15 kW environ. Chaque serveur est plus résilient : une panne d'onduleur met hors service un serveur. Un seul rack, un seul opérateur : optez pour la centralisation. Pour les services gérés, privilégiez la distribution.

Surveillance : SNMP, NUT, chaîne d’arrêt

Un onduleur non surveillé est un onduleur qui échoue discrètement à son test de capacité et vous mentira le jour où vous en aurez besoin. Trois niveaux de protection, dès le premier jour.

UPS
SNMP RFC 1628 / MIB PowerNet
Carte de gestion de réseau
SNMP
Prométhée
exportateur SNMP
Sondage par minute
Charge, SoC, durée d'exécution, température
NUT — Nœud d'IA Kentino
  • Montres pour LB (batterie faible)
  • Vidange les files d'attente vLLM / SGLang
  • Synchronisation des systèmes de fichiers
  • systemctl poweroff

Test de capacité annuel. Décharge manuelle une fois par an. Une capacité inférieure à 80 % de la capacité nominale indique la fin de vie de l'appareil. La panne la plus fréquente d'un onduleur est l'affichage du message « batterie OK » alors que l'autonomie n'est que de 30 secondes au lieu de 10 minutes ; cette estimation du micrologiciel est basée sur la tension de charge et non sur la capacité réelle. Le système de gestion de batterie (BMS) pour batteries lithium remplace ce test ; il est obligatoire pour les batteries VRLA. Voir la référence L05.

Le piège du « branché et oublié »

Défaillance silencieuse de la batterie. Onduleur inutilisé pendant trois ans. L'autotest de 30 secondes est réussi car la batterie a encore 30 secondes d'autonomie. Voyant vert sur le tableau de bord. Coupure de cinq minutes, l'onduleur s'arrête au bout de 45 secondes, le serveur redémarre de force. Batterie hors service depuis 18 mois.

Surchauffe excessive. Onduleur installé dans un placard avec un serveur à 4 GPU consommant 2.4 kW, sans refroidissement, température ambiante de 32 à 35 °C tout l'été. Les batteries VRLA vieillissent environ deux fois plus par tranche de 10 °C au-dessus de 25 °C ; les batteries données pour cinq ans durent 18 mois à 35 °C. Les batteries au lithium sont plus tolérantes, mais restent optimales en dessous de 30 °C.

Solution : planifier le test, surveiller la température ambiante et apposer une étiquette indiquant la date du prochain remplacement sur l’appareil.

Aperçu de l'intégration du générateur

Au-delà de 20 à 30 minutes d'autonomie, les batteries ne conviennent pas. Un groupe électrogène extérieur de 10 ou 20 kW est alimenté par un inverseur de source automatique (ATS). En cas de coupure de courant, l'ATS se met en marche, attend une tension de sortie stable (10 à 30 secondes), puis transfère la charge. L'onduleur prend le relais : la batterie fournit la pleine charge pendant environ 60 secondes, avec une marge. Une autonomie de 5 minutes pour l'onduleur est largement suffisante. Une autonomie prolongée est assurée par le réservoir de carburant. Le document P06 traite du groupe électrogène, de l'ATS et des dispositifs de sécurité.

Que faire ensuite

Séquence de sélection UPS :

  1. Charge de puissance réelle totale. Consommation électrique du serveur (kW) : W04 + réseau + critique lors de l’arrêt. Ignorer les postes de travail sauf nécessité absolue. Multiplier par 1.25.
  2. Topologie : double conversion en ligne, point final.
  3. Chimie : lithium pour les nouvelles installations ≥ 3 kVA, VRLA uniquement pour les très petits groupes électrogènes ou les groupes de remplacement. Rentable en termes de coût total de possession (TCO) en 2 à 4 ans.
  4. Durée d'exécution selon les besoins. Cinq minutes pour un arrêt en douceur, 10 à 15 minutes pour des événements de réseau réalistes, au-delà de 20 minutes, ajoutez un générateur.
  5. Famille de fournisseurs d'après la fiche technique. Onduleurs APC Smart-UPS SRT, Eaton 9PX, Vertiv Liebert GXT5/EXM, Riello Sentinel Dual et Schneider Galaxy VS (pour les puissances supérieures). Vérifiez la compatibilité kVA/kW, sortie sinusoïdale pure, carte SNMP incluse.
  6. Surveillance dès le premier jour. SNMP vers Prometheus, NUT lié au script d'arrêt, seuils d'alerte, test de capacité annuel programmé. Un onduleur sans surveillance est inutile avec des batteries.
  7. Centralisé vs par serveur au-delà de deux nœuds. Un seul rack, un seul opérateur : centralisation. SLA pour les services gérés : distribution.
  8. Site thermique. ≤ 25 °C idéal, ≤ 30 °C tolérable. Ne pas installer dans un local non climatisé contenant un serveur.
  9. Document. Date d'installation de la batterie, autonomie nominale, date du test, date de remplacement. Étiquette apposée sur l'appareil, dans le système de surveillance, dans le carnet d'exploitation.

Soyons francs : la plupart des labos amateurs à un seul serveur n’ont pas besoin d’onduleur ; une machine de développement à 4 GPU peut gérer une coupure de courant grâce à un redémarrage à partir d’un point de contrôle. En revanche, les labos à deux serveurs devraient en être équipés : la probabilité d’une coupure de courant chaque semaine est suffisamment élevée pour que la perte de productivité dépasse le coût de l’onduleur en six mois. Quiconque exécute des tâches d’entraînement de plus d’une heure a absolument besoin d’un onduleur : le coût d’une interruption de plusieurs heures due à une baisse de tension est plusieurs fois supérieur au prix de l’onduleur, et ce type d’incident est suffisamment fréquent pour que le calcul soit évident.

Le document P06 traite de la sélection des générateurs et des systèmes de transfert automatique (ATS) pour les sites où la durée d'exécution justifie l'étape suivante. Références croisées : W04, P01 , P03 , I04, L05.


Cet article fait partie du Kentino Wiki, une série de référence sur l'intelligence artificielle, la robotique et les systèmes qui les connectent. Commentaires et corrections bienvenus à info@kentino.com.