Construire Wiki

Construire Wiki

Une série de référence sur la construction, la mise en réseau, l'alimentation et l'exploitation des systèmes de calcul d'IA — pour les acheteurs et les intégrateurs qui dimensionnent leur prochain boîtier à 4 GPU, leur serveur à 8 GPU ou leur laboratoire de robotique.

Chaque article est basé sur de véritables montages Kentino. Pas de superflu. Des opinions tranchées lorsque les contraintes techniques l'exigent. Une honnêteté sans faille quant aux limites.

49articles en direct 9pistes thématiques 2Nouveautés par semaine · Mar + Jeu

Serveur d'IA fondamental Série W

Si vous configurez un PC multi-GPU, lisez d'abord ce qui suit : mémoire, PCIe, alimentation, refroidissement, stockage et sélection des GPU.

W01RAM et VRAM : leur relation dans un serveur d’IAUn PC à 4 GPU avec 192 Go de VRAM et 32 ​​Go de RAM est inutilisable. Le ratio optimal dépend des applications que vous utilisez.
W02Lignes PCIe et topologie dans un serveur d'IA multi-GPUL'affirmation selon laquelle la différence entre PCIe x8 et x16 n'a pas d'importance pour l'inférence est globalement correcte, et ceux qui la répètent ignorent généralement pourquoi.
W03Rehausseurs pour GPU : quand en avez-vous besoin et quelles sont les pannes ?Là où l'intégrité du signal disparaît discrètement, les liaisons se réentraînent silencieusement vers la Gen3 et les tests réussis commencent à perdre un GPU par jour.
W04Dimensionnement des alimentations et configurations à double alimentationLes calculs, la réalité du format et le cadre honnête de l'alimentation électrique des systèmes à 4 et 8 GPU.
W05Gestion thermique et flux d'air dans les configurations de serveurs d'IA multi-GPUQuatre GPU de 450 W chacun génèrent 1.8 kW de chaleur dans un boîtier. Le flux d'air avant-arrière, la pression statique et le simple fait d'avoir des ventilateurs ne constituent pas une solution de refroidissement efficace.
W06Niveaux de stockage dans un serveur d'IAModèle, jeu de données, espace de travail temporaire, point de contrôle : quatre charges de travail avec quatre modes d’accès. Une seule couche NVMe ne convient à aucune d’entre elles.
W07Sélection de GPU : 5090, 4090, RTX Pro 6000, L40, L4Une comparaison honnête et directe avec des chiffres de performance réels, les compromis à faire et un processus de décision que nous utilisons réellement lors des appels clients.

Économie de jeton Série T

Le calcul financier : nombre de jetons par euro, coût sur site vs coût cloud par million de jetons, et conditions de rentabilité de chaque modèle.

T01Jetons par seconde par euroLa seule métrique de valeur GPU pertinente pour l'inférence. Jetons réels par seconde et par euro pour les modèles 5090, 4090, RTX Pro 6000, L40 et L4.
T02Coût par million de jetons : sur site vs cloudInfrastructure sur site vs cloud : analyse en euros. Où se situe le point de convergence et pourquoi la facture du cloud l’emporte jusqu’à un certain point.
T03Économie de l'inférence soutenue vs. inférence par rafalesL'inférence continue 24h/24 et 7j/7 et les traitements par lots ponctuels ont des avantages économiques opposés. Quand l'infrastructure sur site l'emporte, et quand le cloud vous sauve la mise.

Linux / Système d'exploitation / Logiciel Série L

La pile logicielle sous-jacente aux GPU : configuration des pilotes, configuration CUDA, optimisation du noyau, systèmes de fichiers et surveillance.

L01Gestion des épingles Ubuntu et des pilotes NVIDIAÉpinglez le noyau, épinglez le pilote, ou attendez-vous à ce qu'une mise à jour apt mette vos GPU hors service. Gestion des pilotes qui persiste après redémarrage.
L02CUDA, cuDNN et le kit d'outils de conteneurisation NVIDIALa voie logique pour une configuration optimale. Gestion des versions CUDA, pilotes et kits d'outils, et l'utilisation de conteneurs pour éviter les problèmes de dépendances.
L03Optimisation du noyau Linux pour les serveurs d'IAQu'est-ce qui fait réellement la différence pour les charges de travail d'IA (les pages énormes, NUMA, l'affinité IRQ) et qu'est-ce qui relève du culte du cargo ?
L04Choix du système de fichiers pour les serveurs d'IAXFS, ZFS, ext4 — et pourquoi Btrfs n'est pas recommandé pour les serveurs d'IA. Adaptez le système de fichiers au modèle d'accès.
L05Suite logicielle de supervision : Prometheus, Grafana, DCGM, LokiSurveillez les températures du GPU, la VRAM, les erreurs ECC et les échecs de tâches avant qu'ils ne vous fassent perdre un cycle d'entraînement.

Networking série N

La réalité de NVLink, les topologies de cluster (feuille-épine, arbre gras, libellule, sans commutateur), l'analyse de la latence, le routage et la configuration RDMA en pratique.

N03NVLink et NVSwitch : quand cela compteLe service marketing de DGX vante une bande passante NVLink de plusieurs téraoctets par seconde. Pour la plupart des charges de travail Kentino, vous n'en avez pas besoin.
N04Topologies commutées : arbre gras, feuille-épine, libellule, tesseractChaque schéma de cluster commence de la même manière. Le véritable choix porte sur la topologie, le niveau de sursouscription et la vitesse par port.
N05Topologies sans commutateur : Mesh, Ring, Direct ConnectUn commutateur 400 GbE à 32 ports coûtera entre 40 000 € et 80 000 € mi-2026. Pour 2 à 4 nœuds, vous n'en avez pas besoin.
N06Analyse de la latence : où va chaque microsecondeOn dimensionne les réseaux à l'aide de graphiques de bande passante. Or, leur outil de test allreduce affiche un résultat bien loin du débit de ligne.
N07Routage : ECMP, routage adaptatif, DCQCNQue se passe-t-il au-dessus des câbles, des cartes réseau et des commutateurs : comment les paquets trouvent leur chemin et qu’est-ce qui empêche le réseau de s’effondrer sous la réduction globale ?
N08Mise en œuvre pratique du RDMA + Conception de liaison montante en clusterPratique : installer les pilotes, vérifier le chemin d’accès, activer GPUDirect, valider NCCL, puis passer à l’étape suivante et concevoir la liaison montante de l’ensemble du cluster.

regroupement Série K

Quand un seul nœud ne suffit pas. Choix entre un nœud unique et plusieurs nœuds, entraînement distribué, clusters d'inférence, stockage partagé, planification et gestion des pannes.

K01Architecture mono-nœud multi-GPU vs architecture multi-nœuds : quand faut-il passer à l’échelle ?L'erreur la plus coûteuse consiste à répartir un budget GPU entre deux nœuds alors qu'un seul nœud plus puissant aurait suffi.
K02Formation distribuée en 2026 : DDP, FSDP2, DeepSpeed, MegatronQuatre piles logicielles open source, cinq axes de parallélisme, et laquelle choisir pour quelle tâche.
K03Clusters d'inférence : vLLM Tensor Parallel, Pipeline ParallelUn modèle de 70 octets ne tient pas sur un seul GPU avec une capacité de cache KV utile. Un modèle de 405 octets ne tient pas sur un seul nœud. Le coût du modèle dépend de la façon dont il est découpé.
K04Stockage en cluster : NFS, BeeGFS, Lustre, stockage d’objetsLe stockage partagé est la partie d'un cluster distribué à laquelle personne ne pense jusqu'à ce que les GPU atteignent 40 % d'utilisation.
K05Planification des tâches : SLURM, Kubernetes, RaySLURM, Kubernetes, Ray — et savoir quand s'en passer. Adaptez le planificateur à la taille de votre équipe.
K06Gestion des pannes dans les clusters d'IAQu’est-ce qui dysfonctionne réellement dans un cluster GPU et comment y remédier ? – création de points de contrôle, vérifications de l’état de santé et vidage des nœuds défectueux.

Intégration : je série

En résumé : configuration du serveur d’inférence, réseau du laboratoire et budgets énergétiques, configuration de référence et déploiement de la flotte.

I01Architecture d'IA en périphérie : Robot ↔ Serveur d'inférence sur siteL'article de référence. Un humanoïde que vous avez acheté ne représente que la moitié du système ; voici l'autre moitié et comment les deux moitiés s'assemblent.
I02Configuration d'un serveur d'inférence : vLLM, llama.cpp, SGLangInstallation, déploiement et évaluation des performances. Quel moteur pour quel modèle et quelle cible de latence ?
I03Topologie de réseau pour un laboratoire de calcul en robotique et IACâblage d'un laboratoire de robotique et d'IA : liaisons entre les robots, liaisons montantes vers le serveur d'inférence et sources de latence.
I04Budget énergétique et de refroidissement pour un laboratoire de robotique et d'IADimensionner la puissance et le refroidissement d'un laboratoire mixte de robotique et d'IA avant de signer le bail.
I05Configuration de référence : Un laboratoire de robotique et d’IA dans un seul rackUn laboratoire complet de robotique et d'IA dans un seul rack — la nomenclature, l'agencement et les compromis que nous expédierions réellement.
I06Déploiement de flottes : plusieurs robots, calcul partagéPlusieurs robots, puissance de calcul partagée. Comment dimensionner et planifier l'inférence pour une flotte, et non pour une démonstration.

Livraison de puissance P série

Alimentation électrique propre du rack : phases, PDU, équilibrage, disjoncteurs, UPS et générateurs pour le calcul IA.

P01Alimentation monophasée ou triphaséeQuand un boîtier à 4 GPU dépasse les capacités d'un seul circuit de 16 A, et que vous apporte réellement le triphasé dans un rack d'IA.
P02Types d'unités de distribution d'énergie (PDU) : de base, mesurées, commutées, ATSLe rôle de chaque élément et celui dont vous avez réellement besoin pour un rack GPU.
P03Équilibrage de phase sur les racks d'IARépartir la charge sur les trois phases de manière uniforme, sous peine de déclencher un disjoncteur au pire moment. Fonctionnement de l'équilibrage sur les racks d'IA.
P04Dimensionnement du disjoncteur et courant d'appelCharge continue, courant d'appel et règle des 80 %. Disjoncteurs dimensionnés pour serveurs GPU qui ne se déclenchent pas intempestivement.
P05Dimensionnement des onduleurs pour le calcul IATopologie, chimie des batteries, autonomie et le piège kVA/kW qui sous-dimensionne la moitié des achats d'onduleurs pour les laboratoires d'IA.
P06Générateur et commutateur de transfertLorsque l'autonomie de la batterie est insuffisante. Dimensionnement des générateurs et principes de base des commutateurs de transfert pour les laboratoires d'IA.

Robotique Série R · blog

Un humanoïde moderne est le fruit de six ou sept disciplines d'ingénierie assemblées avec soin : l'anatomie, les capteurs, le placement des ressources de calcul, les kits de développement logiciel (SDK), la mise en réseau, l'approvisionnement et la pile technologique de pointe VLM (Vehicle Modeling Language).

R01Anatomie d'un humanoïde moderneSix ou sept disciplines d'ingénierie assemblées. Que contient réellement un humanoïde moderne ?
R02Anatomie d'un robot quadrupèdeLes quadrupèdes privilégient la stabilité et l'autonomie au détriment de la portée. Anatomie mécanique et informatique du gabarit du cheval de trait.
R03La pile de capteurs du robotCaméras, profondeur, LiDAR, IMU, force-couple — ce que chaque capteur apporte et ce qu'il coûte en calcul.
R04Calcul embarqué vs calcul hors appareil pour les robotsQu'est-ce qui s'exécute sur le robot et qu'est-ce qui s'exécute sur le serveur ? Le compromis entre latence et capacité auquel chaque déploiement doit faire face.
R05Kits de développement logiciel pour robots, ROS 2 et simulationROS 2, les kits de développement logiciel (SDK) des fournisseurs et les environnements de simulation — les logiciels sur lesquels vous développez avant l'arrivée du matériel.
R06Réseaux de robots : Wi-Fi, câbles d’alimentation, 5GWi-Fi, partage de connexion, 5G — et pourquoi c'est la latence, et non la bande passante, qui détermine ce que vous pouvez décharger hors du robot.
R07Achat d'un robot : délais de livraison, douanes, assistanceL'achat de matériel robotique dans l'UE est bien différent de l'achat d'un poste de travail. Voici à quoi ressemblent concrètement les délais de livraison, les formalités douanières et le service après-vente.
R08Pourquoi les robots ont besoin de ressources de calcul dédiées en périphérieL'argument de la latence. Pourquoi le fait de placer votre modèle derrière une API cloud compromet le cas d'utilisation que le client souhaite réellement.
R09Étiquetage automatique avec des modèles du monde pilotés par VLMLa pile de perception de pointe — Qwen2.5-VL, Grounded-SAM 2, Florence-2, NVIDIA Cosmos — appliquée à la vérité terrain en robotique.

Études de cas Série C · blog

Des montages Kentino authentiques, avec des données chiffrées. Photos, nomenclatures, benchmarks et analyses post-mortem transparentes.

C01Étude de cas : Station de travail IA 4× RTX 4090EPYC 7542, 512 Go de mémoire DDR4 ECC, 4 cartes graphiques RTX 4090. Puissance de calcul mesurée : 651.6 TFLOPS. Débit continu de 179.3 tok/s sur vLLM. Température maximale : 73 °C. Données réelles d'une configuration commercialisée.

Nouveaux articles tous les mardis et jeudis

Ce wiki est une bibliothèque en constante expansion : de nouveaux articles sur la construction, la mise en réseau, le clustering, l’alimentation et la robotique sont publiés jusqu’en 2026, chacun étant basé sur une véritable configuration Kentino. Si vous souhaitez qu’un sujet spécifique soit traité en priorité, écrivez à : info@kentino.com.