Kentino · Serveur d'IA personnalisé

NVIDIA RTX PRO 6000 Blackwell Max-Q 96 Go GDDR7 ECC

Plateforme de niveau entreprise, assemblée et testée dans l'UE.

€13.565,40Hors TVA · Frais de port calculés lors du paiement
En stock — expédié depuis un entrepôt de l'UE
ISO 9001 · matériel vérifiéEntrepôt et garantie en UEPlus de 7 ans d'expérience en IA d'entrepriseTest de rodage effectué avant expédition
Marché
Livraison et garantie
Blackwell · 96 Go ECC · 300 W

NVIDIA RTX PRO 6000 Blackwell Max-Q — 96 Go pour l'IA sur site

Le GPU Blackwell complet de 96 Go dans un format compact de 300 W. Même pool de VRAM ECC unifié et même puce de calcul que la carte de 600 W, consommant deux fois moins d'énergie : la carte à privilégier lorsque la température, le bruit ou un châssis de station de travail partagé constituent les contraintes.

96 GB
VRAM GDDR7 ECC
24,064
Cœurs CUDA
~ 1.8 Toxicité/s
Bande passante mémoire
300 W
Puissance du conseil
Marché

96 Go de VRAM unifiée à 300 W

La version Max-Q embarque la même puce Blackwell et les mêmes 96 Go de GDDR7 ECC que la RTX PRO 6000 pleine puissance, mais sa consommation est limitée à 300 W. Ce point est plus important qu'il n'y paraît : une seule carte intègre un modèle de classe 70B en 4 bits dans un pool de mémoire unifié. Il n'y a donc ni partitionnement des tenseurs, ni transfert PCIe entre GPU, ni travail de partitionnement. Comparée à l'assemblage de plusieurs cartes grand public pour atteindre la même capacité de VRAM, elle offre la mémoire ECC, une consommation d'énergie considérablement réduite et un seul emplacement mémoire au lieu de plusieurs.

Spécifications techniques

Données techniques

GPU NVIDIA GB202 — Blackwell
Numéro de fabricant 900-5G153
Mémoire 96 Go GDDR7 ECC, 512 bits
Bande passante mémoire ~1.8 To/s
Cœurs CUDA 24,064
Noyaux tenseurs 752 (5e génération) · ~2,000 TOPS INT8
noyaux RT 188 (4e génération)
Interface PCIe 5.0 × 16
Puissance du conseil 300 W (16 broches 12 V - 2×6)
Refroidissement Ventilateur actif, double fente
Affichage des sorties 4 ports DisplayPort 2.1b
Garantie 36 mois
Meilleur pour

Où ça s'intègre

  • Inférence 70B sur une seule carte — 96 Go contiennent un modèle 70B à 4 bits dans un pool unifié, sans division du modèle.
  • Postes de travail et bureaux silencieux où une carte de 600 W génère trop de chaleur et de bruit.
  • Les systèmes multi-GPU fonctionnent avec un budget énergétique limité : quatre cartes Max-Q consomment à peu près autant que deux cartes à pleine puissance.
  • Optimisation des modèles de taille moyenne où la mémoire ECC et la stabilité à long terme sont importantes.
  • Génération d'images et de vidéos à partir de modèles volumineux stockés en mémoire VRAM.
Débit indicatif en flux unique : environ 25 à 35 tok/s sur un modèle 70 octets à 4 bits, et bien plus de 100 tok/s sur un modèle 8 octets. Ces chiffres sont des estimations indicatives issues de références externes publiées et n’ont pas été mesurés sur du matériel Kentino. Veuillez nous indiquer votre modèle et la longueur du contexte afin que nous puissions dimensionner le système correctement.
Questions que

QFP

En quoi la technologie Max-Q diffère-t-elle de la carte 600 W ?

Même GPU, mêmes 96 Go de GDDR7 ECC, même bande passante mémoire. La Max-Q est limitée à 300 W au lieu de 600 W, ce qui réduit le débit soutenu pour les tâches gourmandes en calcul. Cependant, tout modèle compatible avec 96 Go de mémoire vive (VRAM) l'est toujours, et c'est généralement la capacité de la VRAM qui détermine si un modèle peut s'exécuter.

Une seule carte graphique peut-elle vraiment faire tourner un modèle 70B ?

Oui. Un modèle 70 octets en 4 bits nécessite environ 40 Go de mémoire ; il tient donc dans 96 Go, laissant une marge confortable pour le cache KV et le contexte long. C’est la principale raison de choisir cette carte plutôt que plusieurs modèles plus petits.

Ai-je besoin de mémoire ECC ?

Pour les tâches interactives, non. Pour les formations automatisées, les traitements par lots de longue durée ou toute opération où une inversion de bits silencieuse pourrait corrompre un résultat, la correction d'erreurs (ECC) fait la différence entre une machine fiable et une panne inexpliquée.

Est-ce que ça conviendra à mon châssis ?

Il s'agit d'une carte double emplacement à refroidissement actif, compatible avec les configurations tour et 4U standard. Assurez-vous de disposer d'un emplacement PCIe 5.0 x16 libre et d'un connecteur d'alimentation 12 V-2 x6 à 16 broches.

Quel est le délai de livraison?

Ces pièces sont fabriquées sur commande – comptez généralement 10 à 21 jours. Leur disponibilité évolue rapidement, veuillez donc nous contacter pour confirmation avant de fixer une date.

Vous souhaitez intégrer cette carte dans une machine complète ? Kentino assemble, teste et met en service des serveurs et des stations de travail RTX PRO 6000 AI complets — demandez-nous une configuration personnalisée.

Expédié depuis notre entrepôt européen. Les articles lourds peuvent nécessiter un transport ; veuillez nous contacter pour obtenir un devis et un délai de livraison. Garantie limitée de 2 ans avec assistance RMA avancée ; extension de garantie disponible.

Ce n'est pas exactement ce dont vous avez besoin ?

Indiquez-nous votre charge de travail et nous adapterons cette plateforme en conséquence : GPU, mémoire, stockage et refroidissement adaptés à votre utilisation réelle.