Kentino · Serveur d'IA personnalisé

NVIDIA L4 24 Go GDDR6 — Passive à profil bas

Plateforme de niveau entreprise, assemblée et testée dans l'UE.

€2.657,42Hors TVA · Frais de port calculés lors du paiement
En stock — expédié depuis un entrepôt de l'UE
ISO 9001 · matériel vérifiéEntrepôt et garantie en UEPlus de 7 ans d'expérience en IA d'entrepriseTest de rodage effectué avant expédition
Marché
Livraison et garantie
Ada Lovelace · 24 Go · 72 W · Profil bas

NVIDIA L4 24 Go — carte d'inférence de 72 W

GPU pour datacenter à simple emplacement, profil bas et refroidissement passif, consommant seulement 72 W directement depuis l'emplacement PCIe — sans câble d'alimentation ni conception de ventilation supplémentaire. La solution la plus compacte pour ajouter 24 Go de capacité d'inférence à un serveur.

24 GB
VRAM GDDR6 ECC
7,680
Cœurs CUDA
72 W
alimenté par machine à sous
1 fente
Discret, passif
Marché

Densité et efficacité, et non débit de pointe

La carte L4 est conçue selon une priorité différente de celle des grandes cartes d'accélération : les performances par watt et par emplacement. Avec une consommation de 72 W, elle ne nécessite aucun connecteur d'alimentation supplémentaire et, grâce à son format compact et discret, elle s'intègre dans des châssis qui ne peuvent pas accueillir une carte pleine hauteur. Cette combinaison en fait le choix idéal pour regrouper de nombreuses charges de travail d'inférence indépendantes sur un seul serveur, ou pour ajouter une accélération IA performante aux systèmes compacts et périphériques où la consommation et l'espace sont des contraintes essentielles. C'est également une carte vidéo puissante (encodage et décodage matériels, y compris AV1), ce qui en fait un choix courant pour le transcodage en parallèle de l'inférence.

Spécifications techniques

Données techniques

GPU NVIDIA AD104 — Ada Lovelace
Numéro de fabricant TCSL4PCIE-PB
Mémoire GDDR24 6 Go avec ECC
Bande passante mémoire ~ 300 Go/s
Cœurs CUDA 7,680
Noyaux tenseurs 240 (4e génération) · ~242 TOPS INT8
noyaux RT 60 (3e génération)
Interface PCIe 4.0 × 16
Puissance du conseil 72 W — consommés par la fente, sans connecteur d'alimentation
Facteur de forme Fente unique, profil bas, pleine longueur
Refroidissement Passif — nécessite un flux d'air dans le châssis
Affichage des sorties Aucun — calcul uniquement
Moteurs vidéo Encodage/décodage matériel incluant AV1
Garantie 36 mois
Meilleur pour

Où ça s'intègre

  • Compatible avec les modèles de petite et moyenne taille — 24 Go peuvent facilement contenir un modèle quantifié 7B–13B.
  • Serveurs d'inférence multi-GPU : avec 72 W par carte, vous pouvez en installer plusieurs sans repenser l'alimentation ou le refroidissement.
  • Châssis compact et discret ne pouvant accueillir une carte double emplacement pleine hauteur.
  • Pipelines de transcodage vidéo, y compris AV1, ainsi que l'inférence sur la même carte.
  • Déploiements en périphérie et sur site où la consommation électrique totale est plafonnée.
La L4 privilégie la capacité et l'efficacité, mais pas le débit. Pour des réglages poussés, le traitement de modèles complexes ou un nombre maximal de jetons par seconde, une RTX PRO 6000 ou une configuration multi-GPU est un meilleur investissement ; décrivez-nous votre charge de travail et nous vous conseillerons.
Questions que

QFP

A-t-il besoin d'un câble d'alimentation ?

Non. La carte entière fonctionne dans la limite de 75 W du port PCIe ; il n’y a donc pas de connecteur 8 ou 12 broches à gérer. C’est un atout majeur pour les configurations compactes : le câblage de l’alimentation n’est plus une contrainte.

Va-t-il se refroidir tout seul ?

Non. Comme les autres cartes pour centres de données, elle est passive et dépend de la circulation d'air du châssis. Dans un serveur doté d'une ventilation optimale, son fonctionnement est idéal ; dans un boîtier de bureau silencieux, elle risque de surchauffer. N'hésitez pas à nous contacter en cas de doute concernant votre châssis.

Quelles tailles de modèles sont compatibles avec une mémoire interne de 24 Go ?

Un modèle quantifié de 7 à 13 octets est compatible avec le contexte. Un modèle de 70 octets ne l'est pas : il nécessite environ 40 Go en 4 bits ; il est donc préférable d'opter pour une carte de 96 Go ou une configuration multi-GPU.

Comment se compare-t-il au L40 ?

La L40 offre 48 Go de RAM et une puissance de calcul nettement supérieure, pour une consommation d'environ 300 W et un format double emplacement pleine hauteur. La L4, quant à elle, privilégie la puissance à 72 W, occupe un seul emplacement et présente un profil bas. Optez pour la L4 si la consommation et la densité sont vos priorités, et pour la L40 si vous privilégiez les performances.

Puis-je en installer plusieurs sur un seul serveur ?

Oui, et c'est là que le cache L4 excelle : plusieurs cartes de 72 W chacune restent dans des budgets qui seraient impossibles à atteindre avec des GPU haute puissance. Kentino propose des serveurs d'inférence multi-L4 si vous préférez acheter la machine complète.

Quel est le délai de livraison?

Fabriqué sur commande, généralement sous 10 à 21 jours. Veuillez nous contacter pour confirmer la disponibilité avant de planifier une date.

Vous souhaitez une machine déjà configurée ? Kentino conçoit, teste et met en service des serveurs d’inférence multi-couches 4 — demandez-nous une configuration personnalisée.

Expédié depuis notre entrepôt européen. Les articles lourds peuvent nécessiter un transport ; veuillez nous contacter pour obtenir un devis et un délai de livraison. Garantie limitée de 2 ans avec assistance RMA avancée ; extension de garantie disponible.

Ce n'est pas exactement ce dont vous avez besoin ?

Indiquez-nous votre charge de travail et nous adapterons cette plateforme en conséquence : GPU, mémoire, stockage et refroidissement adaptés à votre utilisation réelle.