Kentino · Serveur d'IA personnalisé

NVIDIA L4 24 Go GDDR6 — Passive à profil bas

Plateforme de niveau entreprise, assemblée et testée dans l'UE.

€2.657,42 Hors TVA · Frais de port calculés lors du paiement
En stock — expédié depuis un entrepôt de l'UE
ISO 9001 · matériel vérifiéEntrepôt et garantie en UEPlus de 7 ans d'expérience en IA d'entrepriseTest de rodage effectué avant expédition
Marché
QFP
Livraison et garantie
Ada Lovelace · 24 Go · 72 W · Profil bas

NVIDIA L4 24 Go — carte d'inférence de 72 W

GPU pour datacenter à simple emplacement, profil bas et refroidissement passif, consommant seulement 72 W directement depuis l'emplacement PCIe — sans câble d'alimentation ni conception de ventilation supplémentaire. La solution la plus compacte pour ajouter 24 Go de capacité d'inférence à un serveur.

24 GB
VRAM GDDR6 ECC
7,680
Cœurs CUDA
72 W
alimenté par machine à sous
1 fente
Discret, passif
Marché

Densité et efficacité, et non débit de pointe

La carte L4 est conçue selon une priorité différente de celle des grandes cartes d'accélération : les performances par watt et par emplacement. Avec une consommation de 72 W, elle ne nécessite aucun connecteur d'alimentation supplémentaire et, grâce à son format compact et discret, elle s'intègre dans des châssis qui ne peuvent pas accueillir une carte pleine hauteur. Cette combinaison en fait le choix idéal pour regrouper de nombreuses charges de travail d'inférence indépendantes sur un seul serveur, ou pour ajouter une accélération IA performante aux systèmes compacts et périphériques où la consommation et l'espace sont des contraintes essentielles. C'est également une carte vidéo puissante (encodage et décodage matériels, y compris AV1), ce qui en fait un choix courant pour le transcodage en parallèle de l'inférence.

Spécifications techniques

Données techniques

GPU NVIDIA AD104 — Ada Lovelace
Numéro de fabricant TCSL4PCIE-PB
Mémoire GDDR24 6 Go avec ECC
Bande passante mémoire ~ 300 Go/s
Cœurs CUDA 7,680
Noyaux tenseurs 240 (4e génération) · ~242 TOPS INT8
noyaux RT 60 (3e génération)
Interface PCIe 4.0 × 16
Puissance du conseil 72 W — consommés par la fente, sans connecteur d'alimentation
Facteur de forme Fente unique, profil bas, pleine longueur
Refroidissement Passif — nécessite un flux d'air dans le châssis
Affichage des sorties Aucun — calcul uniquement
Moteurs vidéo Encodage/décodage matériel incluant AV1
Garantie 36 mois
Meilleur pour

Où ça s'intègre

  • Compatible avec les modèles de petite et moyenne taille — 24 Go peuvent facilement contenir un modèle quantifié 7B–13B.
  • Serveurs d'inférence multi-GPU : avec 72 W par carte, vous pouvez en installer plusieurs sans repenser l'alimentation ou le refroidissement.
  • Châssis compact et discret ne pouvant accueillir une carte double emplacement pleine hauteur.
  • Pipelines de transcodage vidéo, y compris AV1, ainsi que l'inférence sur la même carte.
  • Déploiements en périphérie et sur site où la consommation électrique totale est plafonnée.
La L4 privilégie la capacité et l'efficacité, mais pas le débit. Pour des réglages poussés, le traitement de modèles complexes ou un nombre maximal de jetons par seconde, une RTX PRO 6000 ou une configuration multi-GPU est un meilleur investissement ; décrivez-nous votre charge de travail et nous vous conseillerons.
Questions que

QFP

A-t-il besoin d'un câble d'alimentation ?

Non. La carte entière fonctionne dans la limite de 75 W du port PCIe ; il n’y a donc pas de connecteur 8 ou 12 broches à gérer. C’est un atout majeur pour les configurations compactes : le câblage de l’alimentation n’est plus une contrainte.

Va-t-il se refroidir tout seul ?

Non. Comme les autres cartes pour centres de données, elle est passive et dépend de la circulation d'air du châssis. Dans un serveur doté d'une ventilation optimale, son fonctionnement est idéal ; dans un boîtier de bureau silencieux, elle risque de surchauffer. N'hésitez pas à nous contacter en cas de doute concernant votre châssis.

Quelles tailles de modèles sont compatibles avec une mémoire interne de 24 Go ?

Un modèle quantifié de 7 à 13 octets est compatible avec le contexte. Un modèle de 70 octets ne l'est pas : il nécessite environ 40 Go en 4 bits ; il est donc préférable d'opter pour une carte de 96 Go ou une configuration multi-GPU.

Comment se compare-t-il au L40 ?

La L40 offre 48 Go de RAM et une puissance de calcul nettement supérieure, pour une consommation d'environ 300 W et un format double emplacement pleine hauteur. La L4, quant à elle, privilégie la puissance à 72 W, occupe un seul emplacement et présente un profil bas. Optez pour la L4 si la consommation et la densité sont vos priorités, et pour la L40 si vous privilégiez les performances.

Puis-je en installer plusieurs sur un seul serveur ?

Oui, et c'est là que le cache L4 excelle : plusieurs cartes de 72 W chacune restent dans des budgets qui seraient impossibles à atteindre avec des GPU haute puissance. Kentino propose des serveurs d'inférence multi-L4 si vous préférez acheter la machine complète.

Quel est le délai de livraison?

Fabriqué sur commande, généralement sous 10 à 21 jours. Veuillez nous contacter pour confirmer la disponibilité avant de planifier une date.

Vous souhaitez une machine déjà configurée ? Kentino conçoit, teste et met en service des serveurs d’inférence multi-couches 4 — demandez-nous une configuration personnalisée.

Les questions que les acheteurs nous posent le plus souvent avant de commander un serveur.

Combien de temps faudra-t-il compter ?

Les ordinateurs assemblés avec des composants en stock sont expédiés rapidement ; pour tout appareil nécessitant une génération spécifique de GPU, la disponibilité dépend des stocks. Nous vous communiquons une date avant le paiement et, en cas de changement, nous vous en informons.

La configuration peut-elle être modifiée avant la compilation ?

Presque toujours. Les cartes graphiques, la mémoire, le stockage et le système de refroidissement sont choisis à la commande, et la configuration indiquée est un point de départ et non une configuration fixe. Si vous avez besoin de plus de VRAM, d'un stockage plus rapide ou d'un système de refroidissement différent, veuillez le préciser avant de commander et nous vous ferons parvenir un devis.

Puis-je récupérer le serveur en personne ?

Oui, c'est possible. Notre entrepôt se trouve à Prague et nous vous invitons à venir retirer votre commande sur place. La plupart de nos clients profitent de cette visite pour découvrir la machine avec notre technicien et poser les questions qu'ils n'osent pas poser par e-mail. Pour les commandes en République tchèque, nous essayons également d'assurer la livraison en personne et de vous accompagner lors de l'installation.

Puis-je parler à quelqu'un qui comprend réellement la charge de travail ?

Oui. Nous avons un ingénieur spécialisé en systèmes d'IA, et non un commercial généraliste. Si votre question concerne la taille des lots, la quantification, l'interconnexion ou l'identification de votre goulot d'étranglement, n'hésitez pas à la poser ; cette discussion permet généralement d'améliorer la configuration.

Quel modèle puis-je exécuter sur cette configuration ?

Oui. Chaque machine est assemblée, testée en conditions réelles et évaluée sur des charges de travail d'IA réelles avant son expédition. Nous vous livrons ainsi un LLM déjà installé et opérationnel. Il vous suffit de le brancher, de le connecter à votre réseau et de commencer à travailler : vous n'avez plus qu'à choisir le projet à exécuter en premier.

Comment teste-t-on un serveur avant son expédition ?

Nous effectuons les tests sur des charges de travail d'IA réelles, et non sur des scores synthétiques : débit d'inférence, comportement en charge soutenue et températures en fonctionnement continu. Vous obtenez les résultats du test avec la machine ; les performances promises sont donc celles que vous pouvez vérifier dès le premier jour.

Le serveur est-il prêt à fonctionner dès son arrivée ?

Oui. Chaque machine est assemblée, testée en conditions réelles et évaluée sur des charges de travail d'IA réelles avant son expédition. Nous vous livrons ainsi un LLM déjà installé et opérationnel. Il vous suffit de le brancher, de le connecter à votre réseau et de commencer à travailler : vous n'avez plus qu'à choisir le projet à exécuter en premier.

Expédié depuis notre entrepôt européen. Les articles lourds peuvent nécessiter un transport ; veuillez nous contacter pour obtenir un devis et un délai de livraison. Garantie limitée de 2 ans avec assistance RMA avancée ; extension de garantie disponible.

Ce n'est pas exactement ce dont vous avez besoin ?

Indiquez-nous votre charge de travail et nous adapterons cette plateforme en conséquence : GPU, mémoire, stockage et refroidissement adaptés à votre utilisation réelle.