NVIDIA L4 vs A100 vs H100 en 2026 : guide d'achat des GPU d'inférence
Le débat sur les GPU a changé dans la plupart des réunions d'achat en entreprise. Il y a deux ans, la question était de savoir quel accélérateur acheter pour l'entraînement. En 2026, la question qui revient le plus souvent est de savoir quel accélérateur acheter pourl'inférence— et la réponse n'est souvent ni la carte la plus récente, ni la plus grosse.
Ce basculement a de vraies conséquences budgétaires. Une simple carte H100 80GB PCIe se négocie entre $25,000 et $32,200 dans les circuits actuels. Une L4 24GB se situe entre $2,492 et $4,040. Un ordre de grandeur les sépare, et pour une part significative des charges d'inférence en production, la carte la moins chère délivre le niveau de service dont vous avez réellement besoin.
Ce guide compare les trois accélérateurs NVIDIA les plus prescrits par les acheteurs professionnels en 2026 — L4, A100 40GB et H100 80GB — à partir des prix de canal relevés, et précise quelles charges de travail justifient chaque niveau.
Les trois niveaux et ce qui les distingue
Les trois cartes ci-dessous sont également disponibles à l'unité :NVIDIA L4 24GB,A100 40GBetH100 80GB— et les acheteurs qui arbitrent le choix du processeur pour les mêmes serveurs liront avec profit notreguide des CPU pour l'inférence IA.
NVIDIA L4 24GBest une carte PCIe de 72W conçue pour l'efficacité plutôt que pour le débit maximal. Elle s'installe dans un emplacement serveur standard sans alimentation auxiliaire, ce qui signifie qu'on peut l'ajouter à des serveurs 2U existants sans revoir l'alimentation ni le refroidissement. Pour le transcodage vidéo, les modèles de langue plus petits, la diffusion de recommandations et l'inférence en périphérie, elle domine largement ce comparatif en capacité par watt.
NVIDIA A100 40GBest la valeur sûre des centres de données de la génération précédente. Sa production s'est arrêtée en 2024 : ce qui circule aujourd'hui provient des stocks existants et de l'offre du marché secondaire. L'A100 40GB est donc une pièce arrêtée mais encore bien prise en charge, avec le comportement tarifaire d'un produit en fin de vie plutôt que d'un produit courant.
NVIDIA H100 80GBincarne le haut de gamme actuel : la plus grande réserve de mémoire, la bande passante la plus élevée et le débit le plus fort des trois. C'est aussi la seule des trois où la disponibilité, et non le prix, constitue souvent la contrainte décisive.
Ce que montrent les données de prix 2026
D'après les prix demandés relevés sur les circuits américains, européens et APAC en septembre 2026 :
| GPU | Mémoire | Prix canal (neuf) | Marché secondaire |
|---|---|---|---|
| NVIDIA L4 | 24GB | $2,492–$4,040 (médiane ≈ $2,950) | — |
| NVIDIA A100 40GB | 40GB | — | $3,150–$5,870 (fourchette relevée $5,500–$7,900) |
| NVIDIA H100 80GB PCIe | 80GB | $25,000–$32,200 | ≈ $28,000 |
Deux observations comptent pour la planification budgétaire.
La L4 et l'A100 40GB ont convergé en prix.Une L4 neuve et une A100 40GB d'occasion se situent désormais dans des fourchettes qui se recoupent. C'est inhabituel — l'architecture la plus récente bénéficie normalement d'une prime — et cela traduit le fait que l'offre d'A100 est finie et valorisée comme un stock hérité, tandis que la L4 reste en production active.
Le prix de la H100 relève d'un autre ordre de grandeur et repose sur un échantillon mince.Notre fourchette relevée pour la H100 PCIe repose sur un petit nombre d'annonces et doit être considérée comme indicative, et non comme un prix de marché établi. Les variantes SXM5 se situent encore plus haut. Les acheteurs doivent s'attendre à ce que les devis H100 évoluent avec les allocations plutôt qu'avec les tarifs catalogue.
Adapter la carte à la charge de travail
L'erreur la plus coûteuse dans l'achat de GPU d'inférence est d'acheter selon le classement des benchmarks plutôt que selon la charge de travail. Les trois cartes répondent à des usages réellement différents.
Quand la L4 est la bonne réponse
La L4 est le bon choix lorsque la charge de travail consiste ende nombreuses inférences simultanées de taille modesteplutôt qu'en quelques inférences de grande taille. Le transcodage vidéo et les pipelines analytiques, la diffusion d'embeddings et de recherche, les modèles de recommandation, les modèles de langue petits et moyens et l'inférence en périphérie ou en agence relèvent tous de ce cas. L'enveloppe de 72W est l'avantage décisif : elle permet la densité — plusieurs cartes par serveur, dans des serveurs que vous possédez déjà.
Si votre modèle tient à l'aise dans 24GB et que vous servez de nombreuses requêtes plutôt que de repousser les limites de taille des modèles, payer le prix d'une H100 revient à acheter un débit que vous ne pourrez pas exploiter.
Quand l'A100 40GB garde toute sa place
L'A100 40GB reste un achat judicieux pour les organisations qui ont besoin de plus de mémoire et de bande passante qu'une L4 n'en offre, sans pouvoir justifier les tarifs actuels d'une H100. Les modèles de langue plus volumineux, l'entraînement et le fine-tuning mêlés à l'inférence, ainsi que les charges HPC qui tirent parti du profil de bande passante de l'A100, sont concernés.
La réserve porte sur le cycle de vie. L'A100 40GB n'est plus produite ; l'horizon de support comme la valeur de revente déclinent à partir d'ici. Si vous achetez de l'A100 aujourd'hui, achetez-la pour une charge de travail que vous pourrez migrer, et vérifiez la provenance et l'état de la carte : les GPU du marché secondaire exigent autant de vérifications que les disques du marché secondaire.
Quand la H100 est incontournable
La H100 80GB s'impose lorsque la réserve de 80GB est une exigence et non une préférence : modèles volumineux qui ne tiennent pas dans 40GB, diffusion à haut débit où les cartes plus petites ne peuvent pas tenir les objectifs de latence, et tout environnement où la charge de travail doit monter en puissance sur la carte au fil de sa durée de service.
Si vous prescrivez de la H100, considérez le délai de livraison et les allocations comme le principal risque de planification. Budgetez la carte et le calendrier séparément.
La question de la plateforme serveur
Les GPU s'achètent rarement isolément, et le choix de la plateforme contraint souvent celui du GPU plus que l'inverse.
L'enveloppe de 72W de la L4 lui permet d'entrer dans un serveur 2U standard sans alimentation auxiliaire — y compris dans de nombreuses plateformes de génération actuelle et précédente déjà en service. C'est la voie la moins contraignante pour ajouter de la capacité d'inférence à un parc existant.
L'A100 comme la H100 exigent nettement plus de marge d'alimentation et de refroidissement, et généralement une plateforme conçue pour elles : topologie PCIe ou SXM adaptée, flux d'air suffisant et, pour la H100, une alimentation qui peut nécessiter un arbitrage au niveau du site plutôt qu'un simple choix de serveur. Lorsque des acheteurs nous demandent de comparer des prix de GPU, la réponse honnête consiste souvent à comparer des configurations serveur complètes.
Questions fréquentes
Une L4 suffit-elle pour l'inférence de LLM en production, ou faut-il une A100 ou une H100 ?
Pour les modèles petits et moyens qui tiennent dans 24GB et pour la diffusion à forte concurrence de requêtes modestes, une L4 suffit souvent et coûte radicalement moins cher à l'achat comme à l'exploitation. L'A100 ou la H100 devient nécessaire lorsque le modèle dépasse lui-même 24GB, lorsque vous devez faire du fine-tuning en plus de la diffusion, ou lorsque la carte plus petite ne permet pas d'atteindre les objectifs de latence à haut débit. Mesurez l'empreinte réelle de votre modèle et sa concurrence avant de choisir par défaut l'option la plus grosse.
Pourquoi une A100 40GB d'occasion se vend-elle presque au prix d'une L4 neuve ?
Parce que l'A100 40GB n'est plus produite et que son offre résiduelle est finie, tandis que la L4 reste en production active avec un flux de canal continu. Cette convergence est un artefact de l'offre et non le signe que les deux cartes sont équivalentes : elles servent des profils de charge différents, et la L4, plus récente, bénéficie d'un horizon de support plus long.
Quel GPU choisir si je veux aussi faire du fine-tuning de modèles ?
L'A100 40GB ou la H100 80GB. La L4 est orientée vers l'inférence et les charges plus légères ; le fine-tuning de modèles volumineux est précisément le cas où les bus mémoire plus larges et les réserves de mémoire supérieures de l'A100 et de la H100 font la différence. Si vous avez besoin des deux dans un même environnement, la réserve de 80GB de la H100 offre la plus grande marge, à un coût proportionné.
Faut-il acheter des GPU reconditionnés ou d'occasion ?
Cela peut avoir du sens pour des charges secondaires, à condition que la provenance et l'état soient vérifiables et que le revendeur offre une garantie. Les GPU de centre de données sont généralement plus durables que leurs équivalents grand public, mais le marché secondaire comporte des cartes au passé inconnu. Exigez les mêmes preuves que pour le stockage : l'origine de la carte, son historique d'exploitation lorsqu'il est disponible et des conditions de garantie écrites.
Pouvez-vous fournir des GPU dans le cadre d'une configuration serveur complète ?
Oui. Nous approvisionnons des NVIDIA L4, A100 40GB et H100 80GB ainsi que des plateformes serveur Dell PowerEdge, HPE ProLiant et Lenovo ThinkSystem depuis notre entrepôt de Hong Kong, ce qui permet aux acheteurs de prescrire une configuration complète et validée plutôt que de sourcer cartes et châssis séparément. Transmettez-nous votre besoin de charge de travail et nous proposerons la configuration et le tarif.
Notre verdict pour 2026
Ne choisissez pas la plus grosse carte par défaut. Pour les charges d'inférence et de vidéo à forte concurrence sur des modèles modestes, laL4est le bon achat en 2026, et son enveloppe de 72W en fait la seule des trois que vous pouvez ajouter à un serveur existant sans arbitrage de plateforme. L'A100 40GBreste pertinente pour les modèles plus volumineux et les usages mixtes entraînement-inférence, avec la réserve qu'elle est en fin de vie et doit être achetée pour une charge de travail que vous pourrez migrer. LaH100 80GBse justifie lorsque la réserve de 80GB est une exigence impérative — et dans ce cas, planifiez en fonction des allocations et des délais de livraison, non du tarif catalogue.
Parlons de votre besoin en GPU
HKCHL stocke et approvisionne des accélérateurs NVIDIA L4, A100 et H100, seuls ou intégrés à des configurations serveur complètes et validées, depuis notre entrepôt de Hong Kong, avec expédition dans le monde entier. Transmettez-nous l'empreinte de votre modèle, votre objectif de concurrence et vos contraintes de plateforme : nous reviendrons vers vous avec une configuration et un devis, généralement sous 12 heures.
Besoin de tarifs actuels pour un GPU d'inférence ou un serveur GPU complet ? Nous approvisionnons et testons intégralement serveurs d'entreprise, GPU, stockage et mémoire ECC DDR4/DDR5 depuis notre entrepôt de Hong Kong. Contactez-nous avec vos besoins : nous répondons sous 12 heures.