Investissement matériel
Coût complet du serveur bi-GPU (2x RTX 5090 - 64 Go VRAM) capable d'exécuter des modèles jusqu'à 70 milliards de paramètres.
Faire tourner un modèle de langage sur ses propres serveurs garantit la confidentialité des données. Mais à quel coût énergétique et avec quelle précision ? Pour répondre avec des faits mesurés, nous avons assemblé un serveur dédié bi-GPU et soumis 8 modèles à 750 questions métiers.
Coût complet du serveur bi-GPU (2x RTX 5090 - 64 Go VRAM) capable d'exécuter des modèles jusqu'à 70 milliards de paramètres.
Taux de succès obtenu par GPT-OSS 20b sur les tâches d'entreprise (raisonnement, documents, code, traduction).
Consommation mesurée à la prise pour GPT-OSS 20b (soit 0,10 gCO2e par réponse), 11 fois moins qu'un grand modèle cloud.
Délai du premier token pour Mistral Small 24b, stable même face à 30 requêtes simultanées.
Les organisations souhaitent intégrer l'intelligence artificielle sans envoyer leurs données stratégiques vers des prestataires tiers. Mais deux freins reviennent souvent : la crainte d'une facture d'électricité incontrôlée et le doute sur la précision des modèles de taille moyenne.
Notre démarche s'appuie sur trois exigences simples :
L'étude Boavizta (menée sur 200 serveurs pendant 6 mois) constate qu'un serveur dédié classique consomme entre 10 et 60 W au repos, et entre 80 et 200 W sous forte charge.
Notre serveur de calcul affiche 85,8 W au repos avec ses deux cartes graphiques. Lors des phases de calcul intensif, il monte entre 300 et 420 W, soit 2 fois la consommation d'un serveur d'hébergement web classique.
Côté carbone, l'ADEME chiffre la dépense moyenne d'un serveur physique à 3 215 kWh/an en cycle de vie complet (fabrication comprise). L'usage de notre machine (1 825 kWh/an pour 10h d'activité par jour) s'inscrit donc dans un ordre de grandeur mesurable et prévisible.
| Composant | Spécification | Montant HT |
|---|---|---|
| Cartes graphiques | 2x NVIDIA RTX 5090 (32 Go VRAM chacune, 64 Go au total) | 4 268 € |
| Processeur | Intel Core Ultra 9 285K (24 cœurs, jusqu'à 5,7 GHz) | 604 € |
| Carte mère | ASUS Prime B860-PLUS WiFi (bus PCIe 5.0) | 178 € |
| Mémoire vive | 64 Go DDR5 5200 MT/s Kingston FURY Beast | 150 € |
| Stockage | SSD NVMe P310 2 To (7 100 Mo/s) | 107 € |
| Alimentation | Corsair HX1500i modulaire 1500W Platinum | 231 € |
| Châssis & ventilation | Noctua NF-F12, accessoires et câblage PCIe | 193 € |
Pour éviter les estimations approximatives, nous avons branché le serveur sur une prise connectée AwoX. Un agent logiciel relève la puissance électrique toutes les 500 millisecondes et enregistre les données dans un tableau de bord Grafana.
En parallèle, nous suivons la consommation propre du processeur via Scaphandre et celle des processeurs graphiques via l'outil NVIDIA-SMI.
Chaque réponse générée a été transmise à un modèle arbitre distant pour comparaison avec le corrigé type, puis validée manuellement par un relecteur humain.
Moyenne obtenue sur 67 questions par modèle, exécutées dans des conditions logicielles et matérielles strictement identiques :
| Modèle | Taille | Précision | Vitesse | Tokens / rép. | Temps moy. | Énergie / q. | Émissions CO2e |
|---|---|---|---|---|---|---|---|
| Qwen 3 | 30b (Q4) | 81 % | 164 t/s | 3 777 t | 32 s | 0,0045 kWh | 0,25 g |
| OpenAI gpt-oss Recommandé | 20b (MXFP4) | 79 % | 208 t/s | 2 079 t | 13 s | 0,0018 kWh | 0,10 g |
| Qwen 3 | 32b (Q4) | 75 % | 59 t/s | 1 938 t | 39 s | 0,0087 kWh | 0,49 g |
| Mistral Small 3.2 | 24b (Q4) | 73 % | 80 t/s | 1 183 t | 29 s | 0,0065 kWh | 0,36 g |
| Google Gemma 3 | 27b (Q4) | 67 % | 69 t/s | 601 t | 10 s | 0,0021 kWh | 0,12 g |
| Meta Llama 3.3 | 70b (Q4) | 61 % | 34 t/s | 425 t | 12 s | 0,0028 kWh | 0,15 g |
| Meta Llama 3.1 | 8b (Q4) | 51 % | 161 t/s | 426 t | 3 s | 0,0006 kWh | 0,03 g |
| Mistral Nemo | 12b (Q4) | 45 % | 142 t/s | 903 t | 16 s | 0,0035 kWh | 0,20 g |
GPT-OSS 20b offre le meilleur équilibre : il traite une question en 13 secondes à 208 tokens/seconde, avec une facture énergétique de seulement 0,0018 kWh.
En écartant la recherche d'actualités directes où tous les modèles sans moteur web butent, sa note grimpe à 89 %.
Qwen 3 30b obtient la meilleure note brute (81 %), mais génère 3 777 tokens en moyenne par réponse.
Cette prolixité allonge le temps de réponse à 32 secondes et double la consommation d'électricité par requête (0,0045 kWh).
Llama 3.3 70b (70 milliards de paramètres) plafonne à 61 % de justesse, loin derrière des modèles récents de 20 à 24 milliards.
Inutile d'acheter des machines géantes : l'architecture récente des modèles l'emporte sur le simple volume de poids.
Temps moyen mesuré avant réception du premier octet (TTFT) selon le nombre de requêtes simultanées :
| Modèle testé | 1 utilisateur | 5 utilisateurs | 10 utilisateurs | 30 utilisateurs |
|---|---|---|---|---|
| Mistral Small 24b | 0,041 s | 0,049 s | 0,058 s | 0,059 s |
| Qwen 3 30b | 4,0 s | 20,0 s | 26,0 s | 32,0 s |
| Google Gemma 3 27b | 5,0 s | 11,0 s | 18,0 s | 32,0 s |
Tests réalisés sur 180 secondes avec la question type : « Traduis en français : UK car industry in brace position ahead of Brexit deadline ».
1. Configuration d'Ollama : Par défaut, le moteur ne traite qu'une requête à la fois. Dès que deux collaborateurs interrogent l'outil au même instant, une file d'attente se forme et déclenche rapidement des erreurs de délai dépassé (504 Timeout).
2. La stabilité de Mistral : Mistral Small 24b encaisse la charge avec une grande régularité. Même sous 30 appels simultanés, le temps de réaction reste sous 65 millisecondes.
3. Le seuil critique de la mémoire : Lorsque le modèle tient entièrement dans les 64 Go de mémoire VRAM, le processeur ne chauffe pas. Dès que la mémoire vidéo sature, les données basculent vers la mémoire centrale et la machine ralentit brutalement.
Les classements académiques (Chatbot Arena, MMLU, GSM8K) donnent une tendance, mais masquent les réalités du terrain d'entreprise :
Téléchargez le livre blanc technique de 10 pages comprenant l'ensemble des graphiques de charge, les fiches détaillées des 8 modèles et nos préconisations d'achat matériel.
Indiquez votre adresse email professionnelle pour recevoir le document et accéder au lien direct :
Notre machine de test équipée de 2 cartes NVIDIA RTX 5090 et d'un processeur Intel Core Ultra 9 consomme 85,8 W en veille (sans requête active). Cela représente une facture annuelle d'environ 151 € à l'arrêt.
En inférence continue 10 heures par jour avec le modèle GPT-OSS 20b, le serveur consomme environ 5 kWh par jour (soit 152 kWh par mois). Le coût annuel s'établit à 368 € (environ 31 € par mois), avec une empreinte de 102 kgCO2e.
La date de publication et la qualité du jeu d'entraînement comptent plus que le volume brut de paramètres. Les modèles de 2025 comme GPT-OSS 20b ou Mistral Small 24b intègrent des méthodes de raisonnement et de quantification récentes qui dépassent les anciennes générations plus volumineuses.
Si la taille du modèle excède la mémoire vidéo des cartes graphiques, le système décharge une partie du calcul sur la mémoire vive (RAM) de la carte mère. La vitesse de transfert s'effondre alors d'un facteur 5 à 10, rendant l'usage impraticable pour une équipe.