Serveur d'IA domestique — Punkstation Pro - 88 Go de VRAM - EPYC
Serveur d'IA domestique — Punkstation Pro - 88 Go de VRAM - EPYC
Serveur d'IA domestique — Punkstation Pro - 88 Go de VRAM - EPYC
Serveur d'IA domestique — Punkstation Pro - 88 Go de VRAM - EPYC
Serveur d'IA domestique — Punkstation Pro - 88 Go de VRAM - EPYC
Kentino · Serveur d'IA personnalisé

Serveur d'IA domestique — Punkstation Pro - 88 Go de VRAM - EPYC

Plateforme de niveau entreprise, assemblée et testée dans l'UE.

€4.599,00 Hors TVA · Frais de port calculés lors du paiement
En stock — expédié depuis un entrepôt de l'UE
Facteur de forme
ISO 9001 · matériel vérifiéEntrepôt et garantie en UEPlus de 7 ans d'expérience en IA d'entrepriseTest de rodage effectué avant expédition
Marché
QFP
Livraison et garantie

La Punkstation sur une plateforme serveur : une RTX 4090 grand public associée à un GPU NVIDIA CMP 170HX (64 Go HBM2e) débloqué ( 88 Go de VRAM agrégée ) sur une carte mère AMD EPYC mono-processeur avec mémoire ECC, gestion à distance IPMI et quatre emplacements PCIe 4.0 x16 pour l’extension. Ce n’est pas un PC de bureau d’entrée de gamme : une machine robuste et évolutive, conçue et configurée pour des performances maximales . Disponible en format tour silencieux ou en format rack.

88 GBVRAM agrégée (24 + 64)
EPYCPlateforme serveur · ECC · IPMI
2 → 4Emplacements pour carte graphique (possibilité d'extension)

À quoi ça sert

Les mêmes performances en VRAM agrégée que la Punkstation, sur un matériel durable et évolutif. La VRAM est agrégée et non mutualisée : les deux cartes disposent de mémoires indépendantes. Le système excelle donc dans la génération vidéo et d'images, les modèles complexes à forte complexité tenant sur une seule carte, et les pipelines multi-agents/multi-modèles. La RTX 4090 gère le bureau et la génération d'images rapides ; les 64 Go de la 170HX prennent en charge le modèle complexe. La plateforme EPYC ajoute de la mémoire ECC, la gestion IPMI hors bande, davantage de lignes PCIe et NVMe , et offre une voie de mise à niveau claire vers une configuration à 4 × 170HX.

Génération d'images, génération vidéo, raisonnement MoE , mélange d'agents

  • Validé : Qwen3 35B-A3B (mixture-of-experts, W8A8, compilé) s'exécute entièrement sur les 64 Go du 170HX sans déchargement. ~140 jetons/s en flux unique (et ~3 270 tok/s sur un lot de 48 requêtes) — plus rapide qu'un modèle dense de 7 milliards tout en raisonnant de manière cohérente.
  • Vidéo / image : Les modèles de génération ne peuvent pas être répartis entre les cartes : chaque carte est dédiée à un seul GPU. Les 64 Go de la 170HX permettent de gérer des modèles de diffusion et vidéo volumineux en haute résolution et par lots ; la 4090 assure une génération d'images rapide de type SDXL/Flux. Il est possible d'exécuter les deux en parallèle pour des tâches simultanées.

Spécifications

Composant Détails
Accélérateur 1 NVIDIA GeForce RTX 4090 · 24 Go GDDR6X · Performances d'affichage et performances élevées sur une seule carte
Accélérateur 2 NVIDIA CMP 170HX · 64 Go HBM2e (modifiée, pilote déverrouillé, dédiée au calcul uniquement)
VRAM totale 88 Go agrégés (24 + 64), les deux entièrement accessibles
Processeur AMD EPYC (Rome / Milan, SP3) — modèle configuré sur commande
Carte mère Carte mère serveur EPYC mono-processeur · Mémoire DDR4 ECC 8 canaux · 4 ports PCIe 4.0 x16 · Carte graphique intégrée + gestion à distance IPMI/BMC
Mémoire DDR4 ECC, octa-channel — configurable (128 Go typiques)
Stockage M.2 NVMe (jusqu'à 3× PCIe 4.0 ×4)
Networking Double port 2.5 GbE + port de gestion à distance IPMI dédié
Tuning Moteur Alimentation améliorée dimensionnée pour la configuration
Châssis Tour de bureau silencieuse — ou serveur rackable (choisissez ci-dessus)
Système exploitation Ubuntu, pilotes NVIDIA + CUDA préconfigurés, environnement d'exécution compilé/cudagraph optimisé
Montage Construit, rodé et validé à performances maximales avant expédition

Veuillez lire avant de commander

⚠ Carte déverrouillée par le conducteur. La CMP 170HX est une carte de calcul débloquée à pleine vitesse. en dehors des spécifications de NVIDIALa configuration est fonctionnelle et validée pour les livraisons, mais le 170HX présente un problème. aucune garantie du fabricant — Kentino prend en charge la construction et les composants standard ; le 170HX est pris en charge au mieux de nos capacités.
  • Le 170HX est calcul uniquement (pas d'affichage) — la RTX 4090 (ou la carte graphique BMC intégrée) pilote la console.
  • Les liens 170HX à PCIe 2.0 (×4 standard, ×16 mod disponible) — limite le transfert hôte↔périphérique, pas l'inférence du modèle résident.

Passation de commande

Prix ​​en cours d'élaboration — demandez un devis. Choisissez entre tour et serveur (rack) ci-dessus. Délai de livraison : 10 à 28 jours . Prix en euros HT . Configuration CPU/mémoire/stockage sur mesure.

Les questions que les acheteurs nous posent le plus souvent avant de commander un serveur.

Combien de temps faudra-t-il compter ?

Les ordinateurs assemblés avec des composants en stock sont expédiés rapidement ; pour tout appareil nécessitant une génération spécifique de GPU, la disponibilité dépend des stocks. Nous vous communiquons une date avant le paiement et, en cas de changement, nous vous en informons.

La configuration peut-elle être modifiée avant la compilation ?

Presque toujours. Les cartes graphiques, la mémoire, le stockage et le système de refroidissement sont choisis à la commande, et la configuration indiquée est un point de départ et non une configuration fixe. Si vous avez besoin de plus de VRAM, d'un stockage plus rapide ou d'un système de refroidissement différent, veuillez le préciser avant de commander et nous vous ferons parvenir un devis.

Puis-je récupérer le serveur en personne ?

Oui, c'est possible. Notre entrepôt se trouve à Prague et nous vous invitons à venir retirer votre commande sur place. La plupart de nos clients profitent de cette visite pour découvrir la machine avec notre technicien et poser les questions qu'ils n'osent pas poser par e-mail. Pour les commandes en République tchèque, nous essayons également d'assurer la livraison en personne et de vous accompagner lors de l'installation.

Puis-je parler à quelqu'un qui comprend réellement la charge de travail ?

Oui. Nous avons un ingénieur spécialisé en systèmes d'IA, et non un commercial généraliste. Si votre question concerne la taille des lots, la quantification, l'interconnexion ou l'identification de votre goulot d'étranglement, n'hésitez pas à la poser ; cette discussion permet généralement d'améliorer la configuration.

Quel modèle puis-je exécuter sur cette configuration ?

Oui. Chaque machine est assemblée, testée en conditions réelles et évaluée sur des charges de travail d'IA réelles avant son expédition. Nous vous livrons ainsi un LLM déjà installé et opérationnel. Il vous suffit de le brancher, de le connecter à votre réseau et de commencer à travailler : vous n'avez plus qu'à choisir le projet à exécuter en premier.

Comment teste-t-on un serveur avant son expédition ?

Nous effectuons les tests sur des charges de travail d'IA réelles, et non sur des scores synthétiques : débit d'inférence, comportement en charge soutenue et températures en fonctionnement continu. Vous obtenez les résultats du test avec la machine ; les performances promises sont donc celles que vous pouvez vérifier dès le premier jour.

Le serveur est-il prêt à fonctionner dès son arrivée ?

Oui. Chaque machine est assemblée, testée en conditions réelles et évaluée sur des charges de travail d'IA réelles avant son expédition. Nous vous livrons ainsi un LLM déjà installé et opérationnel. Il vous suffit de le brancher, de le connecter à votre réseau et de commencer à travailler : vous n'avez plus qu'à choisir le projet à exécuter en premier.

Expédié depuis notre entrepôt européen. Les articles lourds peuvent nécessiter un transport ; veuillez nous contacter pour obtenir un devis et un délai de livraison. Garantie limitée de 2 ans avec assistance RMA avancée ; extension de garantie disponible.

Ce n'est pas exactement ce dont vous avez besoin ?

Indiquez-nous votre charge de travail et nous adapterons cette plateforme en conséquence : GPU, mémoire, stockage et refroidissement adaptés à votre utilisation réelle.