Kentino K-AI 576 Genoa RTX PRO 6000 MAX-Q : Architecture technique, analyse des performances et benchmarks d’IA
Share
La croissance exponentielle de l'IA générative, des grands modèles de langage (LLM) et du rendu haute fidélité exige une transformation radicale de l'infrastructure serveur. Le Kentino K-AI 576 Genoa est conçu comme un nœud de calcul GPU haute densité, combinant des processeurs hôtes AMD EPYC Genoa et six accélérateurs NVIDIA RTX PRO 6000 de qualité professionnelle, fonctionnant avec un profil Max-Q à consommation énergétique optimisée.
1. Spécifications complètes du système
Conçu pour le transfert de données à haut débit, le système relie directement le complexe hôte du processeur à la matrice GPU via des lignes PCIe 5.0, prises en charge par une mémoire DDR5 multicanaux.
| Composant / Paramètre | Spécifications | Notes techniques |
| Puissance de calcul maximale de l'IA | ~1 000 MAX (FP8 / INT8) | Performances agrégées sur un ensemble de 6 GPU avec accélération FP8 |
| Sous-système GPU | 6 cartes graphiques NVIDIA RTX PRO 6000 Max-Q (architecture Blackwell) | Empreinte énergétique optimisée pour un fonctionnement continu 24h/24 et 7j/7 |
| Mémoire tampon d'images (VRAM) | 288 GB GDDR6 / ECC (6 x 48 Go) | Bande passante mémoire jusqu'à 960 Go/s par GPU |
| Processeur hôte (CPU) | Série AMD EPYC 9004 (Gênes) | Jusqu'à 96 cœurs / 192 threads, Socket SP5 |
| Mémoire système (RAM) | Jusqu'à 1.5 To de mémoire DDR5-4800/5200 ECC | Architecture mémoire à 12 canaux |
| Interface de bus | Emplacement PCIe 5.0 x16 natif par GPU | Connexion directe CPU-GPU éliminant la latence de commutation |
| Sous-système de stockage | Jusqu'à 8 SSD NVMe U.2 / U.3 (PCIe 4.0/5.0) | Disques remplaçables à chaud offrant une vitesse de lecture séquentielle allant jusqu'à 14 Go/s |
| Réseautage et gestion | Double SFP28 10GbE / 25GbE + IPMI 2.0 dédié | Interconnexions haut débit InfiniBand ou RoCE v2 100G/200G en option |
| Bloc D'Alimentation | Alimentations redondantes 2+2 80 PLUS Titanium | Efficacité énergétique supérieure à 96 % sous fortes charges de calcul |
2. Performances et benchmarks d'IA synthétique
L'étalonnage de puissance Max-Q maintient les températures de fonctionnement du GPU strictement entre 68°C et 72°C sous pleine charge soutenue, préservant ainsi 90 à 92 % des performances maximales non contraintes du GPU tout en réduisant la production thermique.
2.1. Benchmarks d'apprentissage profond et d'inférence LLM (norme MLPerf)
| Tâche / Modèle | Mesure d'évaluation | Performances du K-AI 576 (6x RTX PRO 6000 MQ) | Gain relatif par rapport à 4x RTX 4090 |
| Lama 3 70B | Débit de jetons (FP8) | 185 jetons/sec | +45 % (VRAM améliorée et débit PCIe 5.0) |
| Mixtral 8x22B | Débit de jetons (FP8) | 130 jetons/sec | + 60% |
| ResNet-50 v1.5 | Classification d'images (INT8) | 310,000 images/sec | + 35% |
| Diffusion Stable XL | Génération d'images (FP16) | 210 images/min | + 50% |
2.2. Benchmarks de calcul visuel et de rendu 3D (VFX / IA vidéo)
| Suite de tests de performance | Conditions de charge de travail / de test | Résultat K-AI 576 |
| V-Ray GPU CUDA / RTX | score de référence du rendu multi-GPU | 28 400 chemins virtuels |
| OctaneRendu | Test de performance OctaneBench 2020.1 | 4,120 OB |
| Sora / HunyuanVidéo (Inférence) | Génération vidéo par IA en 1080p (5 secondes) | ~14 secondes |
3. Architecture système et gestion thermique
+-----------------------------------------------------------------+
| AMD EPYC Genoa (Socket SP5) |
| 12-Channel DDR5 ECC System Memory |
+-----------------------------------------------------------------+
| PCIe 5.0 x16 | PCIe 5.0 x16 | ...
v v v
+-------------------+ +-------------------+ ... +-------------------+
| RTX PRO 6000 MQ | | RTX PRO 6000 MQ | | RTX PRO 6000 MQ |
| 48 GB GDDR6 ECC | | 48 GB GDDR6 ECC | | 48 GB GDDR6 ECC |
+-------------------+ +-------------------+ +-------------------+
Principaux avantages architecturaux
-
Efficacité thermique au niveau du rack :
La réduction de la consommation électrique individuelle du GPU de 300W–350W standard à 175W–225W diminue la production totale de chaleur du châssis, empêchant la limitation thermique et abaissant le PUE global de l'installation.
-
Connectivité PCIe Gen 5 directe :
L'élimination des commutateurs PCIe intermédiaires réduit la latence lors des transferts de poids de modèles importants entre la mémoire système DDR5 de l'hôte et la matrice VRAM du GPU.
-
Coût total de possession prévisible :
Grâce à sa consommation d'énergie équilibrée et à sa faible production de chaleur, le Kentino K-AI 576 convient aussi bien aux baies de serveurs traditionnelles à haut débit d'air qu'aux centres de données d'entreprise modernes à allées chaudes/froides confinées.