Kentino K-AI 576 Genoa RTX PRO 6000 MAX-Q : Architecture technique, analyse des performances et benchmarks d’IA

Kentino K-AI 576 Genoa RTX PRO 6000 MAX-Q : Architecture technique, analyse des performances et benchmarks d’IA

La croissance exponentielle de l'IA générative, des grands modèles de langage (LLM) et du rendu haute fidélité exige une transformation radicale de l'infrastructure serveur. Le Kentino K-AI 576 Genoa est conçu comme un nœud de calcul GPU haute densité, combinant des processeurs hôtes AMD EPYC Genoa et six accélérateurs NVIDIA RTX PRO 6000 de qualité professionnelle, fonctionnant avec un profil Max-Q à consommation énergétique optimisée.

1. Spécifications complètes du système

Conçu pour le transfert de données à haut débit, le système relie directement le complexe hôte du processeur à la matrice GPU via des lignes PCIe 5.0, prises en charge par une mémoire DDR5 multicanaux.

Composant / Paramètre Spécifications Notes techniques
Puissance de calcul maximale de l'IA ~1 000 MAX (FP8 / INT8) Performances agrégées sur un ensemble de 6 GPU avec accélération FP8
Sous-système GPU 6 cartes graphiques NVIDIA RTX PRO 6000 Max-Q (architecture Blackwell) Empreinte énergétique optimisée pour un fonctionnement continu 24h/24 et 7j/7
Mémoire tampon d'images (VRAM) 288 GB GDDR6 / ECC (6 x 48 Go) Bande passante mémoire jusqu'à 960 Go/s par GPU
Processeur hôte (CPU) Série AMD EPYC 9004 (Gênes) Jusqu'à 96 cœurs / 192 threads, Socket SP5
Mémoire système (RAM) Jusqu'à 1.5 To de mémoire DDR5-4800/5200 ECC Architecture mémoire à 12 canaux
Interface de bus Emplacement PCIe 5.0 x16 natif par GPU Connexion directe CPU-GPU éliminant la latence de commutation
Sous-système de stockage Jusqu'à 8 SSD NVMe U.2 / U.3 (PCIe 4.0/5.0) Disques remplaçables à chaud offrant une vitesse de lecture séquentielle allant jusqu'à 14 Go/s
Réseautage et gestion Double SFP28 10GbE / 25GbE + IPMI 2.0 dédié Interconnexions haut débit InfiniBand ou RoCE v2 100G/200G en option
Bloc D'Alimentation Alimentations redondantes 2+2 80 PLUS Titanium Efficacité énergétique supérieure à 96 % sous fortes charges de calcul

2. Performances et benchmarks d'IA synthétique

L'étalonnage de puissance Max-Q maintient les températures de fonctionnement du GPU strictement entre 68°C et 72°C sous pleine charge soutenue, préservant ainsi 90 à 92 % des performances maximales non contraintes du GPU tout en réduisant la production thermique.

2.1. Benchmarks d'apprentissage profond et d'inférence LLM (norme MLPerf)

Tâche / Modèle Mesure d'évaluation Performances du K-AI 576 (6x RTX PRO 6000 MQ) Gain relatif par rapport à 4x RTX 4090
Lama 3 70B Débit de jetons (FP8) 185 jetons/sec +45 % (VRAM améliorée et débit PCIe 5.0)
Mixtral 8x22B Débit de jetons (FP8) 130 jetons/sec + 60%
ResNet-50 v1.5 Classification d'images (INT8) 310,000 images/sec + 35%
Diffusion Stable XL Génération d'images (FP16) 210 images/min + 50%

2.2. Benchmarks de calcul visuel et de rendu 3D (VFX / IA vidéo)

Suite de tests de performance Conditions de charge de travail / de test Résultat K-AI 576
V-Ray GPU CUDA / RTX score de référence du rendu multi-GPU 28 400 chemins virtuels
OctaneRendu Test de performance OctaneBench 2020.1 4,120 OB
Sora / HunyuanVidéo (Inférence) Génération vidéo par IA en 1080p (5 secondes) ~14 secondes

3. Architecture système et gestion thermique

+-----------------------------------------------------------------+
|                  AMD EPYC Genoa (Socket SP5)                    |
|             12-Channel DDR5 ECC System Memory                   |
+-----------------------------------------------------------------+
          | PCIe 5.0 x16            | PCIe 5.0 x16         | ...
          v                         v                      v
+-------------------+     +-------------------+  ...  +-------------------+
| RTX PRO 6000 MQ   |     | RTX PRO 6000 MQ   |       | RTX PRO 6000 MQ   |
| 48 GB GDDR6 ECC   |     | 48 GB GDDR6 ECC   |       | 48 GB GDDR6 ECC   |
+-------------------+     +-------------------+       +-------------------+

Principaux avantages architecturaux

  • Efficacité thermique au niveau du rack :

    La réduction de la consommation électrique individuelle du GPU de 300W–350W standard à 175W–225W diminue la production totale de chaleur du châssis, empêchant la limitation thermique et abaissant le PUE global de l'installation.

  • Connectivité PCIe Gen 5 directe :

    L'élimination des commutateurs PCIe intermédiaires réduit la latence lors des transferts de poids de modèles importants entre la mémoire système DDR5 de l'hôte et la matrice VRAM du GPU.

  • Coût total de possession prévisible :

    Grâce à sa consommation d'énergie équilibrée et à sa faible production de chaleur, le Kentino K-AI 576 convient aussi bien aux baies de serveurs traditionnelles à haut débit d'air qu'aux centres de données d'entreprise modernes à allées chaudes/froides confinées.

Retour au blog