Articles courts

21 articles
LLM de raisonnement12 min

Un LLM de raisonnement consomme environ 13 fois plus par requête

Une sous-famille de LLM insère une longue étape de calcul intermédiaire avant de répondre ; selon l'estimation la plus récente disponible (Oviedo et al., Microsoft Research, 2026), la consommation énergétique médiane par requête est multipliée par environ 13 entre un régime de réponse courte et un régime de raisonnement étendu, sur un panel de trois grands modèles ; ce n'est pas le plafond que la même étude mesure.

16 juillet 2026
Test-time compute10 min

Test-time compute : un calcul qui se paie à chaque réponse, pas une fois

Un calcul supplémentaire mobilisé au moment de répondre, pas pendant l'entraînement : Snell et al. (2024) montrent qu'à budget de calcul égal, cette dépense peut battre un modèle plus gros, un principe qui dépasse le nom du modèle en cours à la date de lecture.

16 juillet 2026
Direction stratégique12 min

xAI : les données de X, et 300 MW à Colossus 1 contre 9 GW chez OpenAI

Fondée par Elon Musk en 2023, propriétaire par ailleurs de X, xAI construit Grok sur deux paris stables : l'accès aux publications récentes de la plateforme plutôt qu'un modèle figé à une date de coupure, et un centre de calcul dédié, Colossus, taillé pour la taille plutôt que pour l'efficience. Un choix qui contraste avec celui de Mistral ou DeepSeek, sans qu'aucun des deux ne soit à ce stade démontré comme le bon.

16 juillet 2026
World models9 min

JEPA prédit une représentation, et ne planifie que sur quelques pas

Une architecture pensée pour comprendre et anticiper le monde physique plutôt que générer du texte : avant d'y engager un cas d'usage, l'horizon de planification que le modèle tient sans réamorcer à chaque pas pèse au moins autant que le financement, un critère à lire comme une grille d'analyse plutôt qu'un standard établi par les auteurs de JEPA.

15 juillet 2026
Raisonnement récursif12 min

Le TRM atteint 87,4 % sur Sudoku-Extreme, et 0 % sur les labyrinthes

Sur un Sudoku difficile, un modèle de quelques millions de paramètres atteint 87,4 % là où les LLM testés obtiennent 0 %, pour quelques dizaines d'heures de calcul sur un unique GPU ; mais sur ARC-AGI, deux analyses indépendantes contestent le récit d'un raisonnement inspiré du cerveau.

15 juillet 2026
État sélectif10 min

Mamba : un état de taille fixe, un coût linéaire, et une taxe de compression

Une architecture à état sélectif, déjà en production, pensée pour réduire le coût du contexte long face aux Transformers.

15 juillet 2026
Direction stratégique10 min

Llama et Qwen : que vend vraiment l'éditeur qui donne ses poids

Meta et Alibaba misent sur la diffusion massive de leurs modèles plutôt que sur la vente d'accès. Une stratégie qui ne joue pas sur le même terrain que les labs à modèle propriétaire fermé.

14 juillet 2026
Direction stratégique9 min

OpenAI : trois axes tenus de ChatGPT à GPT-5, et ce que le raisonnement coûte

ChatGPT en 2022, un modèle qui raisonne en 2024, des agents qui agissent depuis 2025 : trois annonces que je relie, à titre d'interprétation, à la même charte (bâtir une IA générale et en distribuer largement les bénéfices), une lecture parmi d'autres possibles. Le numéro de version change ; cette lecture, non.

14 juillet 2026
Architecture10 min

L'attention d'un Transformer : 42 Go de cache pour un contexte de 128 000 tokens

Le mécanisme qui a rendu les Transformers redoutables sur le texte a un coût qui grossit plus vite que le contexte lui-même : précisément le problème que Mamba a été conçu pour contourner.

14 juillet 2026
Déploiement10 min

Jamba alterne Mamba et attention : un débit x3 annoncé par AI21 Labs

Un modèle hybride n'élimine pas l'attention : il la combine avec des blocs Mamba, en alternance dans la plupart des cas recensés ici, parfois en parallèle dans une même couche (Hymba). AI21 Labs en a fait un choix d'ingénierie arbitré, pas une hypothèse de recherche.

13 juillet 2026
Direction stratégique10 min

Mistral AI : un portefeuille à deux étages, et un écart mesuré face à GPT-5

Depuis Mistral 7B en 2023, Mistral AI construit sa gamme autour de deux axes : l'ouverture des poids et l'efficience pour une partie de ses modèles, la capacité de pointe via API propriétaire pour d'autres (dont Mistral Large 3, son modèle phare actuel), et la souveraineté numérique européenne, un axe que le débat public associe à Mistral depuis sa création, sans que cette pièce établisse une déclaration chiffrée et datée de l'entreprise elle-même sur ce point.

13 juillet 2026
Architecture11 min

DeepSeek R1 n'active que 37 de ses 671 milliards de paramètres

Une architecture à mélange d'experts ne met en jeu, pour chaque token, qu'une fraction de ses paramètres, sélectionnée par un mécanisme de routage. C'est ce qui sépare les 671 milliards de paramètres affichés par DeepSeek R1 des 37 milliards que sa fiche donne pour activés.

13 juillet 2026
Coût énergétique15 min

Coût énergétique d'une requête LLM : 0,31 Wh à 300 tokens, 3,91 Wh à 5 000

Oviedo et al. (Joule, 2026) estiment la médiane à 0,31 Wh par requête à 300 tokens de sortie médians, et une médiane de 3,91 Wh à 5 000 tokens de sortie médians, sur un panier de trois modèles ouverts retenus selon un seuil de 200 milliards de paramètres. Ce sont des sorties de simulation Monte-Carlo, pas des mesures physiques. Avant toute comparaison avec une autre technologie, la longueur de calcul que l'on déclenche est déjà, à elle seule, une décision énergétique.

12 juillet 2026
Direction stratégique16 min

DeepSeek : une bande passante NVLink bridée de 900 à 400 Go/s

DeepSeek écrit elle-même que la bande passante NVLink de ses cartes serait tombée de 900 à 400 Go/s pour conformité réglementaire, une cause qu'elle ne nomme pas plus précisément, et qu'elle aurait retenu ses stratégies de parallélisme pour s'y aligner. Deux revendeurs de ce matériel, Lenovo et Tencent Cloud, publient la même valeur de 400 Go/s, pour un autre format de carte ou sans préciser le format. Personne, en dehors d'elle, n'a vérifié ce qu'elle en a tiré.

12 juillet 2026
Direction stratégique7 min

Le TPU de Google a deux prix, pas un

La multimodalité native et la fusion Brain/DeepMind sont connues depuis 2023 et largement documentées ailleurs. Ce qui reste sous-exploré : ce qu'une seule analyse indépendante, non auditée par un tiers, estime pour l'avantage de coût du TPU de Google, et pourquoi une autre mesure indépendante trouve l'inverse sur ce point précis.

12 juillet 2026
Méthode de lecture11 min

Lire un préprint non revu par les pairs : trois réflexes et un biais

Un résultat spectaculaire publié sur arXiv n'a pas encore été vérifié par d'autres chercheurs du domaine. Trois réflexes de lecture et une mise en garde contre le biais de disponibilité, illustrés par le cas du TRM, permettent de juger ce type de papier sans attendre ni le rejeter par principe.

11 juillet 2026
Synthèse11 min

Labs IA : le pivot de Meta, de Llama ouvert à Muse Spark fermé

Sept laboratoires, sept trajectoires. Ce qui prédit la position de chacun sur poids ouverts ou fermés n'est pas un choix technique, mais le mandat économique de son bailleur de capital : le pivot de Meta, de Llama ouvert à Muse Spark fermé, en fournit le test le plus net.

11 juillet 2026
World models11 min

World models : 1,03 et 1,23 milliard levés, aucune preuve de traction

Yann LeCun, Fei-Fei Li et Google DeepMind portent chacun un pari sur les modèles du monde en quelques mois à peine. Le financement dépasse déjà le milliard de dollars pour deux d'entre eux ; la preuve commerciale, elle, reste à établir pour les trois.

11 juillet 2026
Direction stratégique10 min

Anthropic et Claude : quatre jalons datés de 2021 à 2025, classés par source

Fondée en janvier 2021 par sept anciens salariés d'OpenAI, dont la fratrie Amodei notamment partie sur des désaccords de direction, Anthropic aligne ses jalons publics, génération après génération, sur l'alignement traçable et l'autonomie d'action prolongée.

10 juillet 2026
Bancs d'essai11 min

ARC-AGI, le banc d'essai où GPT-4o obtient environ 9 %

Des grilles de couleurs conçues à partir d'a priori proches des a priori humains innés, mais où les grands modèles de langage standards échouent le plus souvent : comprendre ce banc d'essai est la condition pour lire correctement les scores du TRM.

10 juillet 2026
Méthode de réplication10 min

HRM sur ARC-AGI : 20 points pour la supervision profonde, 3,3 pour la récursion

Le préprint qui présente le TRM avance que retirer la supervision profonde fait perdre au HRM l'essentiel de sa précision sur ARC-AGI, alors que retirer la récursion hiérarchique n'en fait perdre qu'une petite part, et il crédite ces chiffres à l'ARC Prize Foundation, dont le billet porte un tout autre découpage. La méthode compte autant que le résultat.

10 juillet 2026

Analyses liées

Recevoir les prochaines analyses

Choix par catégorie · Sans spam · Désabonnement en 1 clic

votre@email.fr
Bibliographie et lexique

Bibliographie

I source primaire indépendante · S secondaire spécialisée · P partie prenante ayant un intérêt commercial sur le sujet traité.

Lexique

LLM· Grand modèle de langage
Modèle d'intelligence artificielle entraîné sur de vastes corpus de texte pour prédire et générer du langage, capable de tâches d'analyse, de synthèse et de génération de texte en langage naturel sans avoir été explicitement programmé pour la tâche demandée.
Date de coupure· knowledge cutoff
Date au-delà de laquelle les données d'entraînement d'un modèle ne contiennent plus d'information. Tout ce qui s'est produit après cette date est, en principe, inconnu du modèle sous sa forme figée : sauf à avoir été introduit via le contexte du prompt.
Transformer
Architecture de réseau de neurones fondée sur le mécanisme d'attention, à la base des grands modèles de langage actuels.
Mécanisme d'attention
Composant permettant à un modèle de pondérer l'importance relative des différentes parties d'une séquence d'entrée.
Fenêtre de contexte· Context window
Quantité maximale de texte qu'un modèle peut prendre en compte simultanément pour produire une réponse.
Coût d'inférence
Coût de calcul associé à l'utilisation d'un modèle déjà entraîné pour produire une réponse.
Modification apportée · mis à jour le 13 août 2026

Ajout d'un encadré précisant le niveau de preuve propre à chaque paradigme (production, préprint non répliqué, pari financé) et la source datée du chiffre de coût d'inférence cité.

Newsletter

Recevoir les prochaines analyses

Choisissez les catégories qui vous intéressent.

Catégories