NVIDIA L4 24 Go GDDR6 — Passive à profil bas
Plateforme de niveau entreprise, assemblée et testée dans l'UE.
NVIDIA L4 24 Go — carte d'inférence de 72 W
GPU pour datacenter à simple emplacement, profil bas et refroidissement passif, consommant seulement 72 W directement depuis l'emplacement PCIe — sans câble d'alimentation ni conception de ventilation supplémentaire. La solution la plus compacte pour ajouter 24 Go de capacité d'inférence à un serveur.
Densité et efficacité, et non débit de pointe
La carte L4 est conçue selon une priorité différente de celle des grandes cartes d'accélération : les performances par watt et par emplacement. Avec une consommation de 72 W, elle ne nécessite aucun connecteur d'alimentation supplémentaire et, grâce à son format compact et discret, elle s'intègre dans des châssis qui ne peuvent pas accueillir une carte pleine hauteur. Cette combinaison en fait le choix idéal pour regrouper de nombreuses charges de travail d'inférence indépendantes sur un seul serveur, ou pour ajouter une accélération IA performante aux systèmes compacts et périphériques où la consommation et l'espace sont des contraintes essentielles. C'est également une carte vidéo puissante (encodage et décodage matériels, y compris AV1), ce qui en fait un choix courant pour le transcodage en parallèle de l'inférence.
Données techniques
| GPU | NVIDIA AD104 — Ada Lovelace |
| Numéro de fabricant | TCSL4PCIE-PB |
| Mémoire | GDDR24 6 Go avec ECC |
| Bande passante mémoire | ~ 300 Go/s |
| Cœurs CUDA | 7,680 |
| Noyaux tenseurs | 240 (4e génération) · ~242 TOPS INT8 |
| noyaux RT | 60 (3e génération) |
| Interface | PCIe 4.0 × 16 |
| Puissance du conseil | 72 W — consommés par la fente, sans connecteur d'alimentation |
| Facteur de forme | Fente unique, profil bas, pleine longueur |
| Refroidissement | Passif — nécessite un flux d'air dans le châssis |
| Affichage des sorties | Aucun — calcul uniquement |
| Moteurs vidéo | Encodage/décodage matériel incluant AV1 |
| Garantie | 36 mois |
Où ça s'intègre
- Compatible avec les modèles de petite et moyenne taille — 24 Go peuvent facilement contenir un modèle quantifié 7B–13B.
- Serveurs d'inférence multi-GPU : avec 72 W par carte, vous pouvez en installer plusieurs sans repenser l'alimentation ou le refroidissement.
- Châssis compact et discret ne pouvant accueillir une carte double emplacement pleine hauteur.
- Pipelines de transcodage vidéo, y compris AV1, ainsi que l'inférence sur la même carte.
- Déploiements en périphérie et sur site où la consommation électrique totale est plafonnée.
QFP
A-t-il besoin d'un câble d'alimentation ?
Non. La carte entière fonctionne dans la limite de 75 W du port PCIe ; il n’y a donc pas de connecteur 8 ou 12 broches à gérer. C’est un atout majeur pour les configurations compactes : le câblage de l’alimentation n’est plus une contrainte.
Va-t-il se refroidir tout seul ?
Non. Comme les autres cartes pour centres de données, elle est passive et dépend de la circulation d'air du châssis. Dans un serveur doté d'une ventilation optimale, son fonctionnement est idéal ; dans un boîtier de bureau silencieux, elle risque de surchauffer. N'hésitez pas à nous contacter en cas de doute concernant votre châssis.
Quelles tailles de modèles sont compatibles avec une mémoire interne de 24 Go ?
Un modèle quantifié de 7 à 13 octets est compatible avec le contexte. Un modèle de 70 octets ne l'est pas : il nécessite environ 40 Go en 4 bits ; il est donc préférable d'opter pour une carte de 96 Go ou une configuration multi-GPU.
Comment se compare-t-il au L40 ?
La L40 offre 48 Go de RAM et une puissance de calcul nettement supérieure, pour une consommation d'environ 300 W et un format double emplacement pleine hauteur. La L4, quant à elle, privilégie la puissance à 72 W, occupe un seul emplacement et présente un profil bas. Optez pour la L4 si la consommation et la densité sont vos priorités, et pour la L40 si vous privilégiez les performances.
Puis-je en installer plusieurs sur un seul serveur ?
Oui, et c'est là que le cache L4 excelle : plusieurs cartes de 72 W chacune restent dans des budgets qui seraient impossibles à atteindre avec des GPU haute puissance. Kentino propose des serveurs d'inférence multi-L4 si vous préférez acheter la machine complète.
Quel est le délai de livraison?
Fabriqué sur commande, généralement sous 10 à 21 jours. Veuillez nous contacter pour confirmer la disponibilité avant de planifier une date.
Expédié depuis notre entrepôt européen. Les articles lourds peuvent nécessiter un transport ; veuillez nous contacter pour obtenir un devis et un délai de livraison. Garantie limitée de 2 ans avec assistance RMA avancée ; extension de garantie disponible.
Ce n'est pas exactement ce dont vous avez besoin ?
Indiquez-nous votre charge de travail et nous adapterons cette plateforme en conséquence : GPU, mémoire, stockage et refroidissement adaptés à votre utilisation réelle.