Probans · outil lié à l'analyse

Quel ordre de grandeur pour mes requêtes IA sur une année ?

Par Axel Morel · Probans · dernière mise à jour le 26 août 2026

Ordre de grandeur estimé sous ces hypothèses

Les coefficients d'équivalence sont les miens (ordres de grandeur usuels ADEME), pas ceux de la source, et ne valent pas empreinte carbone.

À volume de requêtes égal, la longueur de sortie que vous déclenchez pèse davantage que le modèle que vous choisissez : voir le tableau ci-dessous. Les deux médianes portent sur le même panier de trois modèles ouverts de plus de 200 milliards de paramètres.
Médianes estimées sur un panier de trois modèles ouverts de plus de 200 milliards de paramètres (DeepSeek-R1 671B, Llama 3.1 405B, Llama 3.1 Nemotron Ultra 253B), sur un nœud H100, avec 500 tokens d'entrée.
Longueur de sortieWh/requêtekWh/anRapport vs sortie courte

Médianes estimées par Oviedo et al., Energy use of AI inference, efficiency pathways, and test-time scaling, Joule 10(8), article 102430 (2026), DOI 10.1016/j.joule.2026.102430. Ce sont des sorties de simulation Monte-Carlo (10 000 tirages sur la longueur de sortie, la puissance du nœud et le rendement du centre de données), pas des mesures physiques requête par requête, et des médianes assorties d'un intervalle interquartile, pas des constantes. Le facteur 13 est un rapport de médiane à médiane : il ne fixe aucun plafond, et les intervalles publiés autorisent un rapport allant d'environ 3,6 à plus de 40. Les auteurs excluent de leur périmètre l'orchestration entre nœuds, les appels d'outils et la gestion des contextes longs. N'inclut pas non plus l'entraînement du modèle, une dépense distincte amortie sur l'ensemble de ses requêtes. Les huit auteurs sont salariés de Microsoft, seule déclaration d'intérêts fournie.

← Lire l'article complet

Renseignez votre nombre de requêtes par jour et la longueur de sortie que vous déclenchez. Le simulateur projette un ordre de grandeur annuel à partir des deux médianes estimées par Oviedo et al. (Joule, 2026) sur un panier de trois modèles ouverts de plus de 200 milliards de paramètres.

Ce que ce simulateur produit, et ce qu'il ne produit pas

Ce simulateur applique les deux médianes estimées par Oviedo et al. (Joule, 2026) sur un panier de trois modèles ouverts de plus de 200 milliards de paramètres : 0,31 Wh par requête à 300 tokens de sortie médians, contre 3,91 Wh à 5 000 tokens. Il multiplie ce coût unitaire par votre nombre de requêtes quotidien, puis projette sur 365 jours, avant de convertir le résultat en équivalences du quotidien avec des coefficients qui sont les miens et non ceux de la source. Trois hypothèses empilées, donc, sur des médianes dont l'intervalle interquartile couvre déjà un facteur proche de 4. Ce qu'il rend est un ordre de grandeur sous hypothèses, pas un calcul précis, et je préfère le dire plutôt que de laisser croire le contraire. Il ne porte par ailleurs que sur l'inférence (l'usage du modèle déjà entraîné) et non sur l'entraînement initial, une dépense distincte engagée une seule fois et amortie sur l'ensemble des requêtes traitées pendant toute la durée de service du modèle.

Pourquoi comparer deux longueurs de sortie plutôt qu'une seule valeur

Le tableau de comparaison, établi au même volume de requêtes, rend visible l'écart décrit dans l'article : un facteur 13 entre deux médianes, sur les trois mêmes modèles, avant toute comparaison avec une autre technologie. Ce que la source compare, ce sont deux longueurs de sortie, pas deux classes de modèles : rien n'autorise à dire qu'un modèle réputé de raisonnement dépense 3,91 Wh quelle que soit la question, puisque sur une demande courte il produit une sortie courte, et que c'est alors l'autre distribution qui s'applique. Le levier n'est donc pas de trier les modèles une fois pour toutes, mais de savoir quelle longueur de calcul vous déclenchez, requête par requête. C'est aussi le sens de la seule économie que les auteurs chiffrent : sur les modèles qui permettent de couper explicitement le raisonnement, ils estiment que cette bascule divise la consommation par requête par 5 ou plus.

Pour le détail de la simulation, la distinction entre consommation absolue et efficience, et les quatre estimations que les auteurs jugent surestimées, lirel'article complet.

Newsletter

Recevoir les prochaines analyses

Choisissez les catégories qui vous intéressent.

Catégories