Ethernet pour l'IA : Principes fondamentaux du 25/100/400 GbE

Ethernet est l'infrastructure par défaut pour tout cluster d'IA construit en dehors d'un hyperscaler. Ce n'est pas toujours l'option la plus rapide sur le papier. N02 Nous défendrons InfiniBand là où il est réellement avantageux — mais c'est l'option qui existe partout, qui prend en charge tous les outils connexes, qui coûte le moins cher par gigabit et qui ne vous lie à rien.

Pour les clusters de niveau Kentino (serveurs d'inférence mono-nœud, plateformes d'entraînement de 2 à 8 nœuds, petits laboratoires de recherche), l'Ethernet est quasiment toujours la solution idéale. Les questions essentielles sont : quel niveau de débit choisir ? Quelle carte réseau ? Cuivre ou fibre ? Et quel est le coût réel de chaque option supérieure ? Cet article y répond en toute transparence, avec des tarifs basés sur les prix de mi-2026.

Si vous déployez un seul serveur à 4 ou 8 GPU dédié à l'inférence, vous pouvez vous contenter de consulter le tableau des coûts en bas de page. La suite de cet article concerne les planificateurs multi-nœuds.

Pourquoi Ethernet l'emporte par défaut

Trois raisons, classées par ordre de fréquence à laquelle elles influencent réellement la décision :

  1. Écosystème. Chaque serveur, commutateur, boîtier de stockage et orchestrateur utilise Ethernet. Les pilotes sont intégrés au noyau. Les outils de surveillance le supposent. Le premier jour d'un nouvel employé n'est pas consacré à lui expliquer InfiniBand.
  2. Coût par gigabit. Un port de commutateur 100 GbE coûte environ quatre fois moins cher qu'un port InfiniBand HDR équivalent. Les convertisseurs numérique-analogique (DAC) et les émetteurs-récepteurs sont des produits courants. L'offre de cartes réseau est assurée par plusieurs fournisseurs (NVIDIA, Broadcom, Intel), ce qui contribue à maintenir des prix compétitifs. InfiniBand, quant à lui, est fourni par un seul fabricant.
  3. Aucun verrouillage du tissu. Ethernet est un protocole de transport. Les commutateurs modernes gèrent le trafic TCP, RoCE, NVMe-oF et du plan de gestion sur le même câble avec une QoS optimale. InfiniBand s'inscrit pleinement dans la feuille de route de NVIDIA.

En contrepartie, l'Ethernet pour l'IA nécessite un réglage plus précis pour atteindre les mêmes performances qu'InfiniBand, qui offre un débit filaire dès sa mise en service. RoCEv2, PFC, ECN, DCQCN : toutes ces fonctionnalités sont configurables sur Ethernet, mais préconfigurées sur InfiniBand. N02 et N08 Couvrir ce combat.

Niveaux de vitesse et quand chacun est pertinent

L'erreur la plus fréquente concernant les devis de niveau Kentino est de surdimensionner la liaison. Un commutateur 400 GbE pour un serveur d'inférence à 8 GPU représente un gaspillage d'argent. Une liaison 10 GbE entre deux nœuds d'entraînement gaspille du temps GPU. C'est le schéma ci-dessous qui est pertinent.

Niveau Endroit idéal Coût par port (mi-2026) Remarques
1/10 GbE Gestion, IPMI/BMC, amorçage, SSH 50 € - 200 € Toujours séparé du plan de données
25 GbE Liaison montante d'administration, stockage léger, ingestion de jeux de données inférieure à ~3 Go/s 300 € - 600 € Niveau « réel » le moins cher ; standard 2× SFP28 sur la plupart des serveurs
100 GbE Ligne de base intra-cluster pour l'entraînement de 2 à 8 nœuds et le stockage RoCE 1200 € - 2000 € L'outil indispensable — ce dont 80 % des spécifications multi-nœuds Kentino ont besoin
200 GbE Formation Frontier, classe 70B+, réduction dense 2500 € - 4000 € Couche intermédiaire sous-utilisée ; compatible QSFP56 / QSFP-DD
400 GbE Entraînement multi-rack, à proximité des hyperscalers, chemin d'accès privilégié aux ensembles de données 5500 € - 9000 € Le coût réel n'est possible que si l'on peut prouver que le GPU peut l'absorber.
800 GbE À la pointe de la technologie, les racks B200/MI355 sont aujourd'hui principalement utilisés par les hyperscalers. 11000€+ Territoire ConnectX-8 / Thor Ultra ; rare en dehors du haut de gamme

Trois choses à intérioriser :

  • Le 25 GbE n'est pas adapté à l'infrastructure d'IA. Il sert à tout ce qui l'entoure : administration, télémétrie, liaison avec le serveur de stockage lorsque celui-ci ne se trouve pas sur la même infrastructure RDMA. Qualifier le 25 GbE de « couche IA » est révélateur du fait que le fournisseur ne comprend pas la charge de travail.
  • 100 GbE est la norme de base raisonnable pour les architectures multi-nœuds. En dessous de ce seuil, la synchronisation des gradients se bloque à chaque itération. Au-dessus, la question est de savoir si vos GPU peuvent générer des données suffisamment rapidement pour saturer la bande passante. Pour les systèmes mono-nœud Blackwell 5090 / RTX Pro 6000 effectuant des tâches de réglage fin, 100 GbE suffisent généralement.
  • Le 400 GbE n'est rentable que pour les formations réelles multi-racks. Deux nœuds à 8 GPU effectuant un travail de réglage fin de 70 milliards de données n'en ont pas besoin. Seize nœuds effectuant un pré-entraînement sur du texte tokenisé, si.

L'interface 800 GbE existe, les puces sont disponibles (ConnectX-8, Thor Ultra), mais son déploiement reste pour l'instant réservé aux hyperscalers et aux serveurs de classe B200. À noter : il est peu probable qu'elle soit intégrée à une infrastructure Kentino en 2026.

familles NIC qui expédient réellement

En 2026, le marché des cartes réseau est dominé par la gamme ConnectX de NVIDIA, Broadcom et Intel se partageant le reste. Marvell, AMD/Pensando et quelques cartes Broadcom rebadgées existent, mais apparaissent rarement dans les nomenclatures Kentino.

NIC Vitesse Max PCIe Notes / rôle typique
Intel E810-CQDA2 2×100GbE Génération 4 x16 100 GbE fiable et au meilleur prix ; solide ice pilote ; prise en charge de RoCE v2
Mellanox ConnectX-6 Dx 2×100GbE Génération 4 x16 Solution de base pour le 100 GbE sur les hôtes de 4e génération ; RoCE mature
Mellanox ConnectX-7 1 à 2 × 200/400 GbE ou NDR IB Génération 5 x16 Interface IB/Ethernet bimode ; spécifications haut de gamme actuelles de Kentino pour les réseaux multi-nœuds exigeants.
Broadcom Thor 2 2 × 200/400 GbE Génération 5 x16 RoCE v2 de classe entreprise, utilisé dans les références OEM rebrandées
Carte réseau NVIDIA BlueField-3 SuperNIC 1–2 × 400 GbE Génération 5 x32 Processeur graphique Arm à 16 cœurs ; RoCE, NVMe-oF, déchargement du chiffrement ; coûteux
NVIDIA ConnectX-8 1 × 800 / 2 × 400 GbE Génération 6 x16 Dernière version ; compatible avec le Spectrum-X 800 ; nécessite une carte PCIe Gen 6 pour son alimentation.
Broadcom Thor Ultra 1×800GbE Génération 6 x16 Conforme à la norme UEC-1.0 ; carte réseau IA entièrement nouvelle ; cible d'extension horizontale de plus de 100 000 XPU

Les choix les plus judicieux pour un travail du niveau de Kentino :

  • Intel E810-CQDA2 Pour un client souhaitant une connexion 100 GbE à un prix abordable et acceptant que l'optimisation RoCE soit plus complexe qu'avec Mellanox. Prix public conseillé : environ 700 à 900 €.
  • ConnectX-6 Dx Pour toute liaison 100 GbE nécessitant une exécution fiable de RoCE. Supplément de 1 100 € à 1 500 €. Solution à 90 %.
  • ConnectX-7 Lorsque la plateforme est PCIe Gen 5 et que le 200 ou le 400 GbE est justifié par une véritable infrastructure multi-nœuds, la carte OSFP NDR400 à port unique est disponible aux alentours de 1 650 € et permet de basculer entre IB et Ethernet via le firmware — une fonctionnalité utile en cas de migration ultérieure de l'infrastructure.
  • BlueField-3 et ConnectX-8 existent ; si vous êtes en train de les spécifier, vous ne lisez pas cet article.

PCIe représente le plafond silencieux. Une carte réseau 100 GbE dans un emplacement Gen 3 x8 fonctionne à la vitesse de liaison et à la moitié de sa vitesse réelle. La règle est la suivante :

vitesse de la carte réseau PCIe minimum Emplacement confortable
25 GbE Génération 3 x4 Gen 4 x4 ou Gen 3 x8
100 GbE Gen 4 x8 ou Gen 3 x16 Génération 4 x16
2×100 GbE Génération 4 x16 Gen 5 x8 ou Gen 4 x16
200 GbE Gen 5 x8 ou Gen 4 x16 Génération 5 x16
400 GbE Génération 5 x16 Gen 5 x16 uniquement
800 GbE Gen 6 x16 ou 2× Gen 5 x16 Gen 6 x16 uniquement

Sur les plateformes EPYC 8 GPU de Kentino, les GPU occupent la majeure partie des ports x16 Gen 4/5 ; la carte réseau se retrouve dans un port x8 Gen 4 dans certaines configurations. Cela convient pour un port 100 GbE, mais est limite pour deux. Veuillez vérifier avant de faire un devis. W02 (Voies PCIe et topologie) est la version détaillée de cette histoire.

Les options métalliques et optiques — DAC, AOC, optique

Il existe trois façons de réaliser une liaison physique, avec un écart de coût considérable. Les acheteurs gaspillent de l'argent en optique alors qu'un convertisseur numérique-analogique aurait suffi.

Option Portée (100 GbE) Portée (400 GbE) Coût par liaison (100 GbE) Coût par liaison (400 GbE) Puissance / latence
DAC (cuivre passif) 1 à 3 m, ≤ 5 m avec des variants actifs ≤2 m pratique, ≤3 m passif 50 € - 150 € 200 € - 400 € ~0 W, sub-ns/m
AOC (optique active) 3 à 30 m en général, jusqu'à 100 m 3–30 m, 100 m max 200 € - 500 € 600 € - 1200 € 2 à 4 W par extrémité, ~5 ns/m
Optique SR + MMF 70 m sur OM3 / 100 m sur OM4 / 150 m sur OM5 30–100 m typique (SR4 / SR8) 400 €–800 € la paire + fibre 1500 €–2500 € la paire + fibre 3 à 4.5 W par extrémité
Optique LR + SMF jusqu'à km 10 jusqu'à km 10 800 €–1500 € la paire + fibre 2500 €–4000 €+ paire + fibre 3.5 à 5 W par extrémité

Règles applicables à tous les fournisseurs :

  • Convertisseur numérique-analogique (DAC) intégré dans un seul rack. Le cuivre passif à 100GBASE-CR4 est fiable jusqu'à 3 m, et jusqu'à 5 m pour les variantes actives. À 400 Gbit/s (100 Gbit/s PAM4 par voie), la limite pratique est de : 2 m passif — Il existe des DAC de 3 m, mais l'intégrité du signal devient fragile avec les coudes du câble.
  • AOC pour les courses de 5 à 30 m, notamment entre baies adjacentes. L'émetteur-récepteur est collé à la fibre, donc une extrémité défectueuse implique la mise au rebut de tout le câble.
  • Optique SR + MMF Pour les câblages intérieurs de plus de 30 m ou en présence d'un câblage structuré existant, la fibre OM5 offre une portée environ 50 % supérieure à celle de l'OM4 à 100 GbE SR et est le choix recommandé pour les nouvelles installations.
  • Optique LR + SMF Pour traverser des bâtiments ou des pièces. Surdimensionné pour un seul cluster de 4 racks.

Calcul de la longueur des câbles pour un cluster de 4 racks. Une rangée de quatre baies 42U, d'environ 600 mm de large chacune, avec un espacement inter-baies d'environ 100 mm. Un commutateur en haut de la baie 1 est relié à une carte réseau en bas de la baie 4 : la longueur totale est d'environ 4 m, avec une marge de sécurité, soit environ 2.1 m à l'horizontale et 2 m à la verticale. À 100 GbE, vous atteignez la limite de la capacité de transmission ; à 400 GbE, vous la dépassez. Pour tout cluster de plus de deux baies à 400 GbE, prévoyez une passerelle optique ou un système de filtrage. Il s'agit de l'erreur de spécification la plus fréquente dans les devis multi-baies : supposer que la capacité de transmission sera suffisante car « les baies sont très proches les unes des autres ».

Liaison 100 GbE de bout en bout, distance inter-rack de 2 m, mi-2026 : Paire ConnectX-6 Dx ~2400 € + deux ports de commutation amortis ~1500 € + 2 m QSFP28 DAC ~90 € = Environ 4 000 € par lienLa même liaison à 400 GbE (paire ConnectX-7, ports de commutateur 400 GbE, DAC QSFP-DD de 2 m) coûte environ 14 4 € — soit quatre fois plus de bande passante pour environ 3.5 fois plus cher. Le rapport qualité-prix est bon ; la question est de savoir si la charge de travail le justifie.

Changer de paysage

Le marché des commutateurs Ethernet IA en 2026 se divise en trois catégories évidentes.

Classe Exemples Latence par port Remarques
IA en haut de rack (coupe directe, tampon profond) NVIDIA Spectrum-X SN5600 (64×800 GbE / 51.2 Tb/s), Arista 7060X4 (32×400 GbE, ~700 ns), Cisco Nexus série 9300 400 à 700 ns Modèles RoCE sans perte, PFC/ECN prêts à l'emploi, test de l'infrastructure IA
Colonne vertébrale modulaire Arista 7800R3 (jusqu'à 36×400 GbE par carte de ligne), Cisco Nexus 9500 1 à 3 µs selon la carte de ligne Pour les clusters de plus de 16 nœuds ; réseau dorsal Clos routé
Générique / boîte blanche Carte Tomahawk avec SONiC, Dell PowerSwitch et Mikrotik pour l'entrée de gamme variable, 600 ns – 3 µs Moins cher, plus de configuration, le réglage du RoCE est à votre charge.

Deux appels tranchés :

  • Pour les clusters d'entraînement de 4 à 8 nœuds à 100 ou 400 GbE, un seul Spectrum-X SN5600 ou Arista 7060X4 est la bonne réponse. Un seul commutateur, un seul domaine de panne, pas de Clos, modèles RoCE fournis par le fabricant. Le SN5600 offre 64 ports 800 GbE dans un format 2U avec une capacité agrégée de 51.2 Tb/s et des tampons profonds optimisés par IA ; le 7060X4 propose 32 ports 400 GbE dans un format 1U avec une latence de coupure d'environ 700 ns pour un coût nettement inférieur lorsque vous n'avez pas besoin de 800 GbE.
  • Pour 16 nœuds et plus, planifiez le routage L3 Clos avec deux épines, BGP non numéroté entre les feuilles et les épines, ECMP à travers les épines. N08 couvre les mécanismes de liaison montante ; N04 couvre le choix de la topologie.

MTU et châssis jumbo

La MTU Ethernet par défaut est de 1 500 octets. À 100 GbE, cela représente environ 8.3 millions de paquets par seconde et par flux, chacun engendrant un coût de traitement par le noyau. Une MTU de 9 000 octets réduit le débit de paquets d'un facteur 6, diminue d'autant la charge du processeur et est quasiment indispensable pour toute infrastructure d'IA.

Pour RoCEv2 en particulier, la MTU de type IB est choisie parmi les plus grandes valeurs compatibles avec la MTU Ethernet. Une MTU Ethernet de 9 000 octets confère à RoCE une MTU de 4 096 octets, valeur attendue par toutes les piles NCCL et RDMA. En conservant une MTU de 1 500 octets, on obtient une MTU RoCE de 2 048 octets et une perte de performances notable pour toutes les opérations collectives.

Trois choses à savoir :

  • Doit correspondre de bout en bout. Un seul périphérique avec une MTU de 1500 sur le chemin provoque une fragmentation silencieuse et une forte baisse du débit. Configurez-le sur chaque carte réseau, chaque port de commutateur et chaque routeur du VLAN d'IA.
  • Confinez les gros appareils au VLAN IA. Votre réseau d'entreprise ne fonctionnera pas correctement avec une MTU de 9 000. Le plan de gestion restera à 1 500.
  • Vérifier avec ip link et tracepathCe n'est pas en se fiant à la configuration que l'on risque de se tromper. Le nombre de clusters où quelqu'un a configuré la limite à 9000 sur les cartes réseau et a oublié de configurer les ports du commutateur est consternant.

Ethernet avec perte vs Ethernet sans perte : un aperçu

TCP/IP simple sur Ethernet est lossyLorsque les files d'attente sont pleines, les commutateurs abandonnent des paquets, TCP retransmet et le débit diminue. Cela convient au trafic web en continu, mais est fatal pour RDMA : une seule perte de paquet dans une requête RoCE allreduce interrompt le transfert et provoque l'expiration du délai NCCL.

La solution est Ethernet sans perte, obtenu grâce à deux mécanismes fonctionnant de concert :

  • PFC (Priority Flow Control, 802.1Qbb) — Pause par priorité. Lorsque la mémoire tampon du commutateur pour la priorité 3 (priorité RDMA par convention) est pleine, il envoie une trame de pause au port en amont. Freinage d'urgence temporaire.
  • ECN (Notification explicite de congestion) — Les commutateurs marquent les paquets dans les files d'attente qui se remplissent, le récepteur renvoie un CNP, l'émetteur ralentit. Contrôle de congestion à long terme.

Ensemble, ils forment DCQCN (Data Center Quantized Congestion Notification), la boucle de contrôle standard RoCEv2 des infrastructures Ethernet IA modernes. ECN assure la majeure partie du travail ; PFC n'intervient que lorsque ECN ne peut réagir assez rapidement.

En résumé : si vous utilisez RoCE, votre commutateur doit prendre en charge PFC et ECN sur la priorité RDMA, et votre carte réseau doit être configurée pour les signaler et les respecter. L’achat d’un commutateur auprès d’un fournisseur proposant des modèles RoCE documentés (NVIDIA Spectrum, Arista, Cisco Nexus 9000) vous fera gagner une semaine de configuration. N02 couvre la comparaison avec InfiniBand ; N07 Il s'étend en profondeur sur le contrôle de la congestion.

Profondeur de la zone tampon — faible vs profonde

L'autre axe des commutateurs d'IA est la profondeur du tampon. AllReduce est de type plusieurs-à-un à chaque itération : chaque nœud de l'anneau ou de l'arbre converge vers un seul nœud au même instant. incastet cela écrase les commutateurs à mémoire tampon superficielle.

  • Interrupteurs à mémoire tampon superficielle (Anciens modèles Tomahawk, configuration standard pour entreprises) : mémoire tampon totale de 4 à 32 Mo. Économiques, faible latence, idéales pour le trafic est-ouest sur un réseau d'entreprise. Les paquets sont supprimés lors de la première tentative d'envoi.
  • Commutateurs d'IA à mémoire tampon profonde (Jericho3-AI, Spectrum-X, certaines cartes de ligne 7800R3) disposent de centaines de mégaoctets à plusieurs gigaoctets de mémoire tampon. Elles absorbent le pic de trafic entrant et retiennent les paquets pendant que DCQCN réduit le nombre d'émetteurs.

Pour un cluster à deux nœuds, la profondeur du tampon est négligeable. En revanche, pour huit nœuds ou plus effectuant une exécution dense d'AllReduce, des tampons profonds font toute la différence entre un réseau performant et un réseau sujet aux interruptions et aux blocages dus à la correction du facteur de puissance (PFC). C'est une raison valable d'opter pour des commutateurs de classe IA plutôt que pour des commutateurs génériques.

Avis sincère : cela s’applique-t-il à votre configuration ?

Un serveur Kentino K-AI à nœud unique effectuant une inférence ou un réglage fin à nœud unique n'a besoin de rien de tout celaLes GPU communiquent via PCIe et NVLink ; la liaison Ethernet sert à la réception des requêtes, à l’envoi des jetons et à la lecture des données. Deux ports SFP28 25 GbE sur la carte réseau intégrée de l’hôte suffisent.

Vous lisez ceci car vous prévoyez de mettre en place au moins deux nœuds. La matrice :

  • 1 nœud : 10 ou 25 GbE intégré. Aucune mise à niveau possible.
  • 2 à 4 nœuds, réglage fin : 100 GbE via ConnectX-6 Dx, un commutateur, configuration RoCE. ~4 000 € par liaison.
  • 4 à 8 nœuds, plus de 70 milliards de données d'entraînement : 100 ou 200 GbE avec ConnectX-7 si PCIe Gen 5 est disponible. Commutateur unique Spectrum-X SN5600 ou Arista 7060X4.
  • 8 à 16 nœuds, apprentissage dense : 200 ou 400 GbE, routage L3 Clos avec deux spines, commutateurs à mémoire tampon profonde.
  • 16+ nœuds : Au-delà de la gamme habituelle de Kentino, utilisez l'architecture de référence NVIDIA (Spectrum-X, BlueField-3 ou ConnectX-8) et un consultant.

Que faire ensuite

Avant de signer la partie réseau d'un devis, répondez par écrit :

  1. Combien de nœuds fonctionneront réellement ensemble ? Ni « plus tard », ni « peut-être ». Cela définit le niveau.
  2. Quelle sera la charge de travail de formation la plus importante que vous exécuterez de bout en bout ? Le pré-entraînement LLM par texte à jetons est peu gourmand en bande passante ; la diffusion d'images/vidéos est gourmande en bande passante.
  3. Le RoCE est-il une option envisagée ? Si oui, choisissez des cartes réseau Mellanox et un fournisseur proposant des modèles RoCE. Sinon, l'Intel E810 convient parfaitement et coûte 500 € de moins par hôte.
  4. Quelle est la longueur exacte du câble reliant le serveur au commutateur ? Mesurez avec un mètre ruban, ne faites pas d'estimation. Les limites du CNA à 100G/400G sont faibles.
  5. Avez-vous séparé la gestion du plan de données ? Toujours deux réseaux : le réseau 1/10 GbE bon marché pour SSH/IPMI/Prometheus et le réseau RDMA coûteux réservé à NCCL. N08 a la disposition.
  6. L'hôte dispose-t-il des lignes PCIe ? Une carte réseau 400 GbE dans un emplacement Gen 4 x16 offre en pratique un débit d'environ 200 GbE. Veuillez vérifier avant d'établir un devis.

Références croisées dans la piste N pour le niveau de détail suivant : N02 (InfiniBand vs RoCE vs Ethernet classique — quand l'alternative à Ethernet l'emporte réellement) N04 et N05 (topologies commutées et sans commutateur pour le cas multi-nœuds), N06 (analyse de la latence — où vont réellement les microsecondes), et N08 (Configuration RDMA en pratique et comment le cluster se connecte au reste du monde).

L'Ethernet pour l'IA est un problème résolu. Les erreurs les plus préjudiciables ne concernent presque jamais le câblage lui-même ; elles consistent plutôt à choisir un niveau de connectivité inadapté à la charge de travail, à installer la carte réseau dans le mauvais emplacement PCIe, ou à considérer le commutateur comme un simple produit alors que la charge de travail exige en réalité des tampons importants et une correction du facteur de puissance (PFC). Une fois ces trois points correctement gérés, le réseau deviendra la partie la plus simple du développement, ce qui est précisément l'objectif recherché.


Ceci fait partie du Kentino Wiki, une série de référence sur l'intelligence artificielle, la robotique et les systèmes qui les connectent. Commentaires et corrections bienvenus. info@kentino.com.