Probans
Article courtCoût énergétique · 6 min · 27 juillet 2026 · mis à jour le 30 juillet 2026

Le vrai coût énergétique d'une requête LLM : un facteur d'environ 13 sépare un LLM standard d'un LLM de raisonnement

L'essentiel

Une requête coûte 0,31 Wh en médiane sur un LLM standard, contre 3,91 Wh sur un LLM de raisonnement, d'après la mesure la plus récente et la mieux revue par les pairs : l'écart le plus significatif ne sépare pas l'IA du reste, il sépare deux façons d'utiliser l'IA.

Poser la question « combien coûte une requête à une IA, en énergie ? » suppose qu’il existe une seule réponse. Il n’y en a pas. La mesure la plus récente et la mieux revue par les pairs sur le sujet, publiée dans la revue Joule en 2026, situe une requête standard à 0,31 Wh en médiane sur les modèles les plus avancés, et une requête de raisonnement à 3,91 Wh — un facteur d’environ 13, à l’intérieur de la même famille de modèles, avant même de sortir du seul monde des LLM. L’écart le plus significatif ne se situe pas entre « l’IA » et « le reste » : il se situe entre deux façons différentes d’utiliser un LLM.

Ce que mesure l’étude, et ce qu’elle ne mesure pas

Ce que les données établissent. L’étude d’Oviedo et al. (Microsoft Research, arXiv:2509.20241), publiée dans la revue à comité de lecture Joule en 2026, modélise la consommation d’inférence à l’échelle de production pour des modèles frontières (plus de 200 milliards de paramètres). Sur une requête standard, elle situe la médiane à 0,31 Wh, avec un intervalle interquartile de 0,16 à 0,60 Wh. Sur une requête mobilisant un calcul de raisonnement étendu au moment de répondre (test-time scaling), la médiane grimpe à 3,91 Wh, intervalle de 2,15 à 7,05 Wh — un facteur d’environ 13 par rapport à la requête standard. Ce chiffre est corroboré indépendamment par la propre mesure de Google sur son infrastructure de production (arXiv:2508.15734, 2025) : 0,24 Wh pour la requête texte médiane sur Gemini Apps, du même ordre de grandeur que la borne basse d’Oviedo et al. — une mesure qui, en revanche, ne couvre pas les modèles de raisonnement.

Consommation en wattheures d'une requête : 0,31 Wh en médiane pour une requête standard (intervalle 0,16-0,60 Wh) contre 3,91 Wh pour une requête de raisonnement (intervalle 2,15-7,05 Wh), soit un facteur d'environ 13.

Le vrai facteur : entre LLM, pas seulement entre l’IA et le reste

Mon interprétation. Le réflexe commun consiste à chercher un chiffre unique — « une requête IA coûte X » — pour ensuite le comparer à une activité du quotidien. Ce réflexe masque une variance qui existe déjà à l’intérieur du seul périmètre LLM, avant toute comparaison externe. Demander un résumé court à un modèle standard et demander une démonstration mathématique complexe à un modèle de raisonnement ne sont pas deux variantes de la même dépense : ce sont deux ordres de grandeur distincts, avec un facteur d’environ 13 entre eux d’après l’étude citée plus haut. Le choix du modèle et du mode de calcul pèse donc davantage, sur ce plan précis, que le simple fait de recourir ou non à un LLM.

Consommation absolue et efficience : deux questions distinctes

Mon interprétation. Deux questions se cachent sous le mot « coût énergétique », et les confondre entretient une partie du débat public sur le sujet. La première est la consommation absolue : combien d’énergie une tâche donnée consomme-t-elle en valeur brute. La seconde est l’efficience : quel résultat obtient-on rapporté à cette dépense, pour la tâche visée. Un LLM de raisonnement consomme davantage en valeur absolue qu’un LLM standard sur une requête donnée. Cela ne dit rien, en soi, de son efficience : s’il résout en une passe un problème qu’un LLM standard échoue à traiter, ou ne traite qu’après plusieurs itérations correctives de l’utilisateur, la dépense supplémentaire peut se justifier au regard du résultat obtenu. À l’inverse, mobiliser un LLM de raisonnement pour une tâche qu’un modèle standard traite tout aussi bien consomme plus, sans gain d’efficience en face. La question pertinente n’est donc pas seulement « combien ça consomme », mais aussi « pour quoi faire », posée requête par requête.

Et l’entraînement ? Un ordre de grandeur à part

Ce que les données établissent. Les chiffres qui précèdent portent sur l’inférence, c’est-à-dire l’utilisation d’un modèle déjà entraîné pour répondre à une requête. L’entraînement est une dépense distincte, engagée une seule fois avant toute mise en service. Patterson et al. (2021) chiffrent l’entraînement complet de GPT-3 à environ 1 287 000 kWh, soit plus d’un milliard de wattheures pour un seul cycle d’entraînement. Cette dépense se compare mal, terme à terme, aux 0,31 à 3,91 Wh d’une requête individuelle : elle est amortie sur l’ensemble des requêtes traitées par le modèle pendant toute sa durée de service, potentiellement des milliards. Un coût d’entraînement élevé peut ainsi correspondre à un coût d’inférence par requête très inférieur, une fois ramené à l’échelle de l’usage réel.

Le facteur d’environ 13 entre un LLM standard et un LLM de raisonnement existe à l’intérieur de la seule famille des LLM : avant toute comparaison avec une autre technologie, le choix du modèle est déjà, à lui seul, une décision énergétique.

Concrètement, comparer un chiffre isolé de consommation d’IA à une activité du quotidien risque de masquer l’écart le plus actionnable : celui qui existe entre les modèles eux-mêmes. Un usage professionnel ou personnel gagnerait à interroger, avant toute autre question, si la tâche posée exige réellement un LLM de raisonnement, ou si un modèle standard, nettement moins gourmand d’après l’étude citée, suffit à la traiter.

Mes réserves

  • Les chiffres retenus ici (0,31 Wh / 3,91 Wh) proviennent de la mesure la plus récente disponible à la rédaction (Oviedo et al., Joule, 2026), mais restent des estimations modélisées à l’échelle de production, pas des mesures physiques directes sur chaque requête individuelle : ce sont des médianes assorties d’un intervalle interquartile, pas une constante unique.
  • Une étude antérieure, publiée en mai 2025 (How Hungry is AI?, arXiv:2505.09598), mesurait un facteur supérieur à 70 entre un LLM standard (0,45 Wh) et un LLM de raisonnement (33,6 à 39,2 Wh) — un ordre de grandeur nettement supérieur à celui retenu aujourd’hui. Les auteurs de l’étude la plus récente estiment explicitement que ce type d’estimation antérieure était surestimé d’un facteur 4 à 20, du fait d’hypothèses de matériel moins représentatives de l’usage réel en production. Cet écart entre deux études sérieuses, publiées à un an d’intervalle, illustre à quel point ces chiffres restent mouvants d’une publication à l’autre, plus qu’une mesure définitivement stabilisée.
  • L’efficience énergétique des modèles progresse vite, dans les deux catégories (standard et raisonnement). Un facteur mesuré en 2026 peut se resserrer ou se creuser d’ici quelques mois, sans que le mécanisme de fond — un calcul de raisonnement étendu consomme davantage qu’une génération directe — ne change lui-même.
  • Le chiffre d’entraînement de GPT-3 (Patterson et al., 2021) porte sur un modèle antérieur aux modèles couverts par les mesures d’inférence citées ici : les deux chiffres ne mesurent ni la même phase, ni le même modèle, et ne doivent pas être additionnés ou comparés terme à terme.

Aperçu du simulateur : renseignez vos requêtes par jour et le type de requête pour estimer votre consommation annuelle.

Simulateur interactif : calculez votre propre consommation annuelle selon le type de requête et votre volume.

Retour au dossier Comprendre les modèles post-LLM. Voir aussi qu’est-ce qu’un LLM de raisonnement ?

Lexique

LLM· Grand modèle de langage
Modèle d'intelligence artificielle entraîné sur de vastes corpus de texte pour prédire et générer du langage, capable de tâches d'analyse, de synthèse et de raisonnement en langage naturel sans avoir été explicitement programmé pour la tâche demandée.
Coût d'inférence
Coût de calcul associé à l'utilisation d'un modèle déjà entraîné pour produire une réponse.
Axel Morel
Axel Morel
Fondateur & analyste · Probans

Analyse les sujets qui l'intéressent et publie ce qu'il en tire, avec méthodologie, sans jargon inutile. Choix du sujet, validation finale du plan, direction de la rédaction, validation ou modification des sources, validation et retravail du texte et des éléments d'illustration par l'auteur Axel Morel. Rédaction, choix des sources initiales, création du plan de rédaction initial par l'IA.

En savoir plus

Newsletter

Recevoir les prochaines analyses

Choisissez les catégories qui vous intéressent.

Catégories