NVIDIA L4 24 Go GDDR6 — Passive à profil bas
Plateforme de niveau entreprise, assemblée et testée dans l'UE.
NVIDIA L4 24 Go — carte d'inférence de 72 W
GPU pour datacenter à simple emplacement, profil bas et refroidissement passif, consommant seulement 72 W directement depuis l'emplacement PCIe — sans câble d'alimentation ni conception de ventilation supplémentaire. La solution la plus compacte pour ajouter 24 Go de capacité d'inférence à un serveur.
Densité et efficacité, et non débit de pointe
La carte L4 est conçue selon une priorité différente de celle des grandes cartes d'accélération : les performances par watt et par emplacement. Avec une consommation de 72 W, elle ne nécessite aucun connecteur d'alimentation supplémentaire et, grâce à son format compact et discret, elle s'intègre dans des châssis qui ne peuvent pas accueillir une carte pleine hauteur. Cette combinaison en fait le choix idéal pour regrouper de nombreuses charges de travail d'inférence indépendantes sur un seul serveur, ou pour ajouter une accélération IA performante aux systèmes compacts et périphériques où la consommation et l'espace sont des contraintes essentielles. C'est également une carte vidéo puissante (encodage et décodage matériels, y compris AV1), ce qui en fait un choix courant pour le transcodage en parallèle de l'inférence.
Données techniques
| GPU | NVIDIA AD104 — Ada Lovelace |
| Numéro de fabricant | TCSL4PCIE-PB |
| Mémoire | GDDR24 6 Go avec ECC |
| Bande passante mémoire | ~ 300 Go/s |
| Cœurs CUDA | 7,680 |
| Noyaux tenseurs | 240 (4e génération) · ~242 TOPS INT8 |
| noyaux RT | 60 (3e génération) |
| Interface | PCIe 4.0 × 16 |
| Puissance du conseil | 72 W — consommés par la fente, sans connecteur d'alimentation |
| Facteur de forme | Fente unique, profil bas, pleine longueur |
| Refroidissement | Passif — nécessite un flux d'air dans le châssis |
| Affichage des sorties | Aucun — calcul uniquement |
| Moteurs vidéo | Encodage/décodage matériel incluant AV1 |
| Garantie | 36 mois |
Où ça s'intègre
- Compatible avec les modèles de petite et moyenne taille — 24 Go peuvent facilement contenir un modèle quantifié 7B–13B.
- Serveurs d'inférence multi-GPU : avec 72 W par carte, vous pouvez en installer plusieurs sans repenser l'alimentation ou le refroidissement.
- Châssis compact et discret ne pouvant accueillir une carte double emplacement pleine hauteur.
- Pipelines de transcodage vidéo, y compris AV1, ainsi que l'inférence sur la même carte.
- Déploiements en périphérie et sur site où la consommation électrique totale est plafonnée.
QFP
A-t-il besoin d'un câble d'alimentation ?
Non. La carte entière fonctionne dans la limite de 75 W du port PCIe ; il n’y a donc pas de connecteur 8 ou 12 broches à gérer. C’est un atout majeur pour les configurations compactes : le câblage de l’alimentation n’est plus une contrainte.
Va-t-il se refroidir tout seul ?
Non. Comme les autres cartes pour centres de données, elle est passive et dépend de la circulation d'air du châssis. Dans un serveur doté d'une ventilation optimale, son fonctionnement est idéal ; dans un boîtier de bureau silencieux, elle risque de surchauffer. N'hésitez pas à nous contacter en cas de doute concernant votre châssis.
Quelles tailles de modèles sont compatibles avec une mémoire interne de 24 Go ?
Un modèle quantifié de 7 à 13 octets est compatible avec le contexte. Un modèle de 70 octets ne l'est pas : il nécessite environ 40 Go en 4 bits ; il est donc préférable d'opter pour une carte de 96 Go ou une configuration multi-GPU.
Comment se compare-t-il au L40 ?
La L40 offre 48 Go de RAM et une puissance de calcul nettement supérieure, pour une consommation d'environ 300 W et un format double emplacement pleine hauteur. La L4, quant à elle, privilégie la puissance à 72 W, occupe un seul emplacement et présente un profil bas. Optez pour la L4 si la consommation et la densité sont vos priorités, et pour la L40 si vous privilégiez les performances.
Puis-je en installer plusieurs sur un seul serveur ?
Oui, et c'est là que le cache L4 excelle : plusieurs cartes de 72 W chacune restent dans des budgets qui seraient impossibles à atteindre avec des GPU haute puissance. Kentino propose des serveurs d'inférence multi-L4 si vous préférez acheter la machine complète.
Quel est le délai de livraison?
Fabriqué sur commande, généralement sous 10 à 21 jours. Veuillez nous contacter pour confirmer la disponibilité avant de planifier une date.
Les questions que les acheteurs nous posent le plus souvent avant de commander un serveur.
Combien de temps faudra-t-il compter ?
Les ordinateurs assemblés avec des composants en stock sont expédiés rapidement ; pour tout appareil nécessitant une génération spécifique de GPU, la disponibilité dépend des stocks. Nous vous communiquons une date avant le paiement et, en cas de changement, nous vous en informons.
La configuration peut-elle être modifiée avant la compilation ?
Presque toujours. Les cartes graphiques, la mémoire, le stockage et le système de refroidissement sont choisis à la commande, et la configuration indiquée est un point de départ et non une configuration fixe. Si vous avez besoin de plus de VRAM, d'un stockage plus rapide ou d'un système de refroidissement différent, veuillez le préciser avant de commander et nous vous ferons parvenir un devis.
Puis-je récupérer le serveur en personne ?
Oui, c'est possible. Notre entrepôt se trouve à Prague et nous vous invitons à venir retirer votre commande sur place. La plupart de nos clients profitent de cette visite pour découvrir la machine avec notre technicien et poser les questions qu'ils n'osent pas poser par e-mail. Pour les commandes en République tchèque, nous essayons également d'assurer la livraison en personne et de vous accompagner lors de l'installation.
Puis-je parler à quelqu'un qui comprend réellement la charge de travail ?
Oui. Nous avons un ingénieur spécialisé en systèmes d'IA, et non un commercial généraliste. Si votre question concerne la taille des lots, la quantification, l'interconnexion ou l'identification de votre goulot d'étranglement, n'hésitez pas à la poser ; cette discussion permet généralement d'améliorer la configuration.
Quel modèle puis-je exécuter sur cette configuration ?
Oui. Chaque machine est assemblée, testée en conditions réelles et évaluée sur des charges de travail d'IA réelles avant son expédition. Nous vous livrons ainsi un LLM déjà installé et opérationnel. Il vous suffit de le brancher, de le connecter à votre réseau et de commencer à travailler : vous n'avez plus qu'à choisir le projet à exécuter en premier.
Comment teste-t-on un serveur avant son expédition ?
Nous effectuons les tests sur des charges de travail d'IA réelles, et non sur des scores synthétiques : débit d'inférence, comportement en charge soutenue et températures en fonctionnement continu. Vous obtenez les résultats du test avec la machine ; les performances promises sont donc celles que vous pouvez vérifier dès le premier jour.
Le serveur est-il prêt à fonctionner dès son arrivée ?
Oui. Chaque machine est assemblée, testée en conditions réelles et évaluée sur des charges de travail d'IA réelles avant son expédition. Nous vous livrons ainsi un LLM déjà installé et opérationnel. Il vous suffit de le brancher, de le connecter à votre réseau et de commencer à travailler : vous n'avez plus qu'à choisir le projet à exécuter en premier.
Expédié depuis notre entrepôt européen. Les articles lourds peuvent nécessiter un transport ; veuillez nous contacter pour obtenir un devis et un délai de livraison. Garantie limitée de 2 ans avec assistance RMA avancée ; extension de garantie disponible.
Ce n'est pas exactement ce dont vous avez besoin ?
Indiquez-nous votre charge de travail et nous adapterons cette plateforme en conséquence : GPU, mémoire, stockage et refroidissement adaptés à votre utilisation réelle.