Étude technique & mesures physiques directes

Consommation et efficience d'une IA locale : Mesures réelles en entreprise

Faire tourner un modèle de langage sur ses propres serveurs garantit la confidentialité des données. Mais à quel coût énergétique et avec quelle précision ? Pour répondre avec des faits mesurés, nous avons assemblé un serveur dédié bi-GPU et soumis 8 modèles à 750 questions métiers.

5 731 € HT

Investissement matériel

Coût complet du serveur bi-GPU (2x RTX 5090 - 64 Go VRAM) capable d'exécuter des modèles jusqu'à 70 milliards de paramètres.

89 %

Précision utile

Taux de succès obtenu par GPT-OSS 20b sur les tâches d'entreprise (raisonnement, documents, code, traduction).

0,0018 kWh

Énergie par question

Consommation mesurée à la prise pour GPT-OSS 20b (soit 0,10 gCO2e par réponse), 11 fois moins qu'un grand modèle cloud.

< 60 ms

Réactivité sous charge

Délai du premier token pour Mistral Small 24b, stable même face à 30 requêtes simultanées.

Pourquoi mesurer une IA sur ses propres serveurs ?

Les organisations souhaitent intégrer l'intelligence artificielle sans envoyer leurs données stratégiques vers des prestataires tiers. Mais deux freins reviennent souvent : la crainte d'une facture d'électricité incontrôlée et le doute sur la précision des modèles de taille moyenne.

Notre démarche s'appuie sur trois exigences simples :

  • Souveraineté : Héberger l'intégralité du traitement sur notre infrastructure. Aucun octet client ne quitte le réseau interne.
  • Frugalité : Choisir le modèle le plus compact capable de résoudre la tâche demandée afin d'économiser l'électricité et le matériel.
  • Utilité : Se concentrer sur les besoins concrets du travail quotidien : synthèse documentaire, audit de code, logique métier et traduction technique.

Ce que disent les études de référence

L'étude Boavizta (menée sur 200 serveurs pendant 6 mois) constate qu'un serveur dédié classique consomme entre 10 et 60 W au repos, et entre 80 et 200 W sous forte charge.

Notre serveur de calcul affiche 85,8 W au repos avec ses deux cartes graphiques. Lors des phases de calcul intensif, il monte entre 300 et 420 W, soit 2 fois la consommation d'un serveur d'hébergement web classique.

Côté carbone, l'ADEME chiffre la dépense moyenne d'un serveur physique à 3 215 kWh/an en cycle de vie complet (fabrication comprise). L'usage de notre machine (1 825 kWh/an pour 10h d'activité par jour) s'inscrit donc dans un ordre de grandeur mesurable et prévisible.

Le banc d'essai et la méthode de mesure

La configuration matérielle (5 731 € HT)

Composant Spécification Montant HT
Cartes graphiques 2x NVIDIA RTX 5090 (32 Go VRAM chacune, 64 Go au total) 4 268 €
Processeur Intel Core Ultra 9 285K (24 cœurs, jusqu'à 5,7 GHz) 604 €
Carte mère ASUS Prime B860-PLUS WiFi (bus PCIe 5.0) 178 €
Mémoire vive 64 Go DDR5 5200 MT/s Kingston FURY Beast 150 €
Stockage SSD NVMe P310 2 To (7 100 Mo/s) 107 €
Alimentation Corsair HX1500i modulaire 1500W Platinum 231 €
Châssis & ventilation Noctua NF-F12, accessoires et câblage PCIe 193 €

Relevés physiques et contrôle impartial

Pour éviter les estimations approximatives, nous avons branché le serveur sur une prise connectée AwoX. Un agent logiciel relève la puissance électrique toutes les 500 millisecondes et enregistre les données dans un tableau de bord Grafana.

En parallèle, nous suivons la consommation propre du processeur via Scaphandre et celle des processeurs graphiques via l'outil NVIDIA-SMI.

Corpus de 750 questions réparties en 7 catégories :

  • Langage
  • Raisonnement logique
  • Traduction technique
  • Mathématiques
  • Code informatique
  • Compréhension de PDF
  • Recherche d'actualité

Chaque réponse générée a été transmise à un modèle arbitre distant pour comparaison avec le corrigé type, puis validée manuellement par un relecteur humain.

Résultats des 8 modèles testés

Moyenne obtenue sur 67 questions par modèle, exécutées dans des conditions logicielles et matérielles strictement identiques :

Modèle Taille Précision Vitesse Tokens / rép. Temps moy. Énergie / q. Émissions CO2e
Qwen 3 30b (Q4) 81 % 164 t/s 3 777 t 32 s 0,0045 kWh 0,25 g
OpenAI gpt-oss Recommandé 20b (MXFP4) 79 % 208 t/s 2 079 t 13 s 0,0018 kWh 0,10 g
Qwen 3 32b (Q4) 75 % 59 t/s 1 938 t 39 s 0,0087 kWh 0,49 g
Mistral Small 3.2 24b (Q4) 73 % 80 t/s 1 183 t 29 s 0,0065 kWh 0,36 g
Google Gemma 3 27b (Q4) 67 % 69 t/s 601 t 10 s 0,0021 kWh 0,12 g
Meta Llama 3.3 70b (Q4) 61 % 34 t/s 425 t 12 s 0,0028 kWh 0,15 g
Meta Llama 3.1 8b (Q4) 51 % 161 t/s 426 t 3 s 0,0006 kWh 0,03 g
Mistral Nemo 12b (Q4) 45 % 142 t/s 903 t 16 s 0,0035 kWh 0,20 g

Le vainqueur de l'efficience

GPT-OSS 20b offre le meilleur équilibre : il traite une question en 13 secondes à 208 tokens/seconde, avec une facture énergétique de seulement 0,0018 kWh.

En écartant la recherche d'actualités directes où tous les modèles sans moteur web butent, sa note grimpe à 89 %.

Les pièges des modèles verbeux

Qwen 3 30b obtient la meilleure note brute (81 %), mais génère 3 777 tokens en moyenne par réponse.

Cette prolixité allonge le temps de réponse à 32 secondes et double la consommation d'électricité par requête (0,0045 kWh).

L'âge compte plus que la taille

Llama 3.3 70b (70 milliards de paramètres) plafonne à 61 % de justesse, loin derrière des modèles récents de 20 à 24 milliards.

Inutile d'acheter des machines géantes : l'architecture récente des modèles l'emporte sur le simple volume de poids.

Comportement sous forte charge d'utilisateurs

Temps moyen mesuré avant réception du premier octet (TTFT) selon le nombre de requêtes simultanées :

Modèle testé 1 utilisateur 5 utilisateurs 10 utilisateurs 30 utilisateurs
Mistral Small 24b 0,041 s 0,049 s 0,058 s 0,059 s
Qwen 3 30b 4,0 s 20,0 s 26,0 s 32,0 s
Google Gemma 3 27b 5,0 s 11,0 s 18,0 s 32,0 s

Tests réalisés sur 180 secondes avec la question type : « Traduis en français : UK car industry in brace position ahead of Brexit deadline ».

Les leçons de la mise en production

1. Configuration d'Ollama : Par défaut, le moteur ne traite qu'une requête à la fois. Dès que deux collaborateurs interrogent l'outil au même instant, une file d'attente se forme et déclenche rapidement des erreurs de délai dépassé (504 Timeout).

2. La stabilité de Mistral : Mistral Small 24b encaisse la charge avec une grande régularité. Même sous 30 appels simultanés, le temps de réaction reste sous 65 millisecondes.

3. Le seuil critique de la mémoire : Lorsque le modèle tient entièrement dans les 64 Go de mémoire VRAM, le processeur ne chauffe pas. Dès que la mémoire vidéo sature, les données basculent vers la mémoire centrale et la machine ralentit brutalement.

Pourquoi les benchmarks publics ne suffisent pas

Les classements académiques (Chatbot Arena, MMLU, GSM8K) donnent une tendance, mais masquent les réalités du terrain d'entreprise :

Classements publics sur le web

  • Tests menés en pleine précision (FP16/FP32) sur des clusters industriels inaccessibles aux PME.
  • Questionnaires à choix multiples en anglais, souvent mémorisés pendant l'entraînement.
  • Aucune mesure de la dépense électrique par réponse utile.
  • Tests unitaires sans aucune mise à l'épreuve de simultanéité.

Mesures sur votre banc local

  • Modèles quantifiés (Q4, MXFP4) adaptés au budget de l'organisation.
  • Cas d'usage concrets en français : contrats, code spécifique, raisonnements internes.
  • Relevé au wattmètre du coût réel par question et des phases de repos.
  • Vérification des limites de bande passante PCIe et saturation mémoire.

Recevoir l'étude complète en PDF

Téléchargez le livre blanc technique de 10 pages comprenant l'ensemble des graphiques de charge, les fiches détaillées des 8 modèles et nos préconisations d'achat matériel.

  • 10 pages de données brutes et d'analyses opérationnelles
  • Bilan chiffré des consommations au repos et en activité
  • Tableaux détaillés des 750 questions par catégorie métier
  • Guide de dimensionnement matériel et configuration d'Ollama

Téléchargement immédiat

Indiquez votre adresse email professionnelle pour recevoir le document et accéder au lien direct :

Foire aux questions sur l'IA locale

Quelle puissance électrique consomme un serveur d'IA au repos ?

Notre machine de test équipée de 2 cartes NVIDIA RTX 5090 et d'un processeur Intel Core Ultra 9 consomme 85,8 W en veille (sans requête active). Cela représente une facture annuelle d'environ 151 € à l'arrêt.

Combien coûte l'électricité pour 10 heures d'utilisation par jour ?

En inférence continue 10 heures par jour avec le modèle GPT-OSS 20b, le serveur consomme environ 5 kWh par jour (soit 152 kWh par mois). Le coût annuel s'établit à 368 € (environ 31 € par mois), avec une empreinte de 102 kgCO2e.

Pourquoi le modèle Llama 3.3 70b obtient-il une note inférieure à un modèle 20b ?

La date de publication et la qualité du jeu d'entraînement comptent plus que le volume brut de paramètres. Les modèles de 2025 comme GPT-OSS 20b ou Mistral Small 24b intègrent des méthodes de raisonnement et de quantification récentes qui dépassent les anciennes générations plus volumineuses.

Que se passe-t-il si le modèle dépasse la capacité de la mémoire VRAM ?

Si la taille du modèle excède la mémoire vidéo des cartes graphiques, le système décharge une partie du calcul sur la mémoire vive (RAM) de la carte mère. La vitesse de transfert s'effondre alors d'un facteur 5 à 10, rendant l'usage impraticable pour une équipe.