Probans

Dossier · Intelligence artificielle

Comprendre les modèles post-LLM

Mamba, TRM et JEPA sont présentés comme la suite des LLM. Ce dossier distingue ce qui est déployé, ce qui est un préprint fragile, et ce qui reste un pari financé sans produit.

Décision possible

La synthèse actionnable du dossier

Ce que les preuves permettent réellement de décider — sans le bruit commercial.

Lire la synthèse

Articles courts

21 articles
Direction stratégique5 min

L'open source (Llama, Qwen, et les autres) : une direction collective différente

Meta et Alibaba ne vendent pas l'accès à leurs modèles : ils les diffusent librement. Une stratégie qui ne joue pas sur le même terrain que les labs à modèle propriétaire fermé.

28 juillet 2026
Direction stratégique6 min

Anthropic et Claude : pourquoi la fiabilité vérifiable est le pari, pas l'argument marketing

Fondée en 2021 par des chercheurs partis d'OpenAI sur des désaccords de sécurité, Anthropic pousse la même direction à chaque génération de Claude : rendre l'alignement traçable et donner au modèle une autonomie d'action prolongée, plutôt que viser le modèle le moins cher ou le plus grand public.

27 juillet 2026
Bancs d'essai4 min

ARC-AGI, le banc d'essai que les LLM ratent

Des grilles de couleurs qu'un humain résout en quelques essais, mais où les grands modèles de langage s'effondrent : comprendre ce banc d'essai est la condition pour lire correctement les scores du TRM.

27 juillet 2026
Méthode de réplication6 min

Ce qui explique vraiment la performance du HRM (et donc du TRM)

Une étude d'ablation indépendante démonte l'architecture du HRM pièce par pièce : la supervision profonde explique l'essentiel du gain de précision, la récursion hiérarchique presque rien. La méthode compte autant que le résultat.

27 juillet 2026
Méthode de lecture6 min

Comment lire un préprint non revu par les pairs sans se faire avoir

Un résultat spectaculaire publié sur arXiv n'a pas encore été vérifié par d'autres chercheurs du domaine. Trois réflexes de lecture, illustrés par le cas du TRM, permettent de juger ce type de papier sans attendre ni le rejeter par principe.

27 juillet 2026
Synthèse6 min

Convergence ou divergence : les grands labs IA visent-ils tous la même chose ?

Sept laboratoires, sept trajectoires : produit grand public, souveraineté, échelle de calcul brute, efficience architecturale. Aucun ne vise le même point d'arrivée — et c'est le même désassemblage que celui déjà observé au niveau des modèles eux-mêmes.

27 juillet 2026
World models6 min

La course aux "world models" : qui lève quoi

Yann LeCun, Fei-Fei Li et Google DeepMind portent chacun un pari sur les modèles du monde en quelques mois à peine. Le financement dépasse déjà le milliard de dollars pour deux d'entre eux ; la preuve commerciale, elle, reste à établir pour les trois.

27 juillet 2026
Coût énergétique6 min

Le vrai coût énergétique d'une requête LLM : un facteur d'environ 13 sépare un LLM standard d'un LLM de raisonnement

Une requête coûte 0,31 Wh en médiane sur un LLM standard, contre 3,91 Wh sur un LLM de raisonnement, d'après la mesure la plus récente et la mieux revue par les pairs : l'écart le plus significatif ne sépare pas l'IA du reste, il sépare deux façons d'utiliser l'IA.

27 juillet 2026
Direction stratégique7 min

DeepSeek : la direction choisie n'est pas le prix cassé, c'est l'efficience de calcul comme discipline

DeepSeek n'a pas fait le choix de coûter moins cher par posture commerciale. Adossé au fonds quantitatif High-Flyer et confronté aux restrictions américaines sur l'accès aux puces avancées, le laboratoire a fait de l'efficience de calcul une direction stratégique stable, que chaque génération de modèle pousse plus loin plutôt qu'un coup ponctuel réussi une fois.

27 juillet 2026
Direction stratégique7 min

Google / Gemini : la direction choisie, et comment chaque génération la pousse plus loin

Google ne construit pas Gemini comme un chatbot autonome à faire grandir. La direction choisie tient en trois choix stables : une recherche IA unifiée depuis 2023, une conception multimodale dès l'entraînement, une infrastructure de calcul maison plutôt que louée.

27 juillet 2026
Déploiement5 min

Jamba : la première architecture hybride Mamba-Transformer de qualité production

Un modèle hybride n'élimine pas l'attention, il l'alterne avec des blocs Mamba. AI21 Labs a été le premier à en faire un choix d'ingénierie arbitré, pas une hypothèse de recherche.

27 juillet 2026
Direction stratégique5 min

Mistral AI : la direction choisie, et comment chaque génération la pousse plus loin

Depuis Mistral 7B en 2023, Mistral AI tient la même ligne à travers ses générations de modèles : l'ouverture des poids et l'efficience comme choix de fondation, la souveraineté numérique européenne comme raison d'être, pas comme argument de circonstance.

27 juillet 2026
Architecture5 min

Mixture of experts : pourquoi DeepSeek R1 n'active que 37 des 671 milliards de paramètres

Un LLM dense calcule avec la totalité de ses paramètres à chaque token. Une architecture à mélange d'experts n'en active qu'une fraction, sélectionnée par un mécanisme de routage — ce qui explique l'écart entre les 671 milliards affichés par DeepSeek R1 et les 37 milliards réellement mobilisés par requête.

27 juillet 2026
Direction stratégique6 min

OpenAI : une charte, un même triptyque stratégique répété à chaque génération de modèle

ChatGPT en 2022, un modèle qui raisonne en 2024, des agents qui agissent depuis 2025 : trois annonces d'apparence différente qui poussent la même charte — bâtir une IA générale et en distribuer largement les bénéfices — un cran plus loin à chaque fois. Le numéro de version change ; la direction, non.

27 juillet 2026
Architecture5 min

Pourquoi l'attention d'un Transformer coûte cher sur un contexte long

Le mécanisme qui a rendu les Transformers redoutables sur le texte a un coût qui grossit plus vite que le contexte lui-même — précisément le problème que Mamba a été conçu pour contourner.

27 juillet 2026
Raisonnement récursif5 min

Qu'est-ce que le TRM (Tiny Recursive Model) ?

Un modèle de quelques millions de paramètres bat les LLM sur des puzzles fermés pour moins de 500 dollars d'entraînement — mais pourquoi ça marche ne fait plus consensus.

27 juillet 2026
LLM de raisonnement5 min

Qu'est-ce qu'un LLM "de raisonnement" ?

Une sous-famille de LLM insère une longue étape de calcul intermédiaire avant de répondre, au prix d'une consommation énergétique par requête supérieure d'un facteur d'environ 13 à celle d'un LLM standard.

27 juillet 2026
Test-time compute6 min

Test-time compute : pourquoi certains modèles réfléchissent avant de répondre

Un calcul supplémentaire mobilisé au moment de répondre, pas pendant l'entraînement : Snell et al. (2024) montrent qu'à budget de calcul égal, cette dépense peut battre un modèle plus gros — un principe qui dépasse le nom du modèle en cours à la date de lecture.

27 juillet 2026
Direction stratégique6 min

xAI / Grok : pourquoi ce laboratoire mise sur les données de X et sur l'échelle de calcul brute plutôt que sur l'efficience

Fondée par Elon Musk en 2023, propriétaire par ailleurs de X, xAI construit Grok sur deux paris stables : l'accès aux publications récentes de la plateforme plutôt qu'un modèle figé à une date de coupure, et un centre de calcul dédié, Colossus, taillé pour la taille plutôt que pour l'efficience. Un choix qui s'oppose frontalement à celui de Mistral ou DeepSeek.

27 juillet 2026
World models5 min

Qu'est-ce que JEPA ?

Une architecture pensée pour comprendre et anticiper le monde physique plutôt que générer du texte — un pari financé à plus d'un milliard de dollars, sans produit commercial démontré à ce jour.

19 juillet 2026
État sélectif5 min

Qu'est-ce que Mamba ?

Une architecture à état sélectif, déjà en production, pensée pour réduire le coût du contexte long face aux Transformers.

18 juillet 2026

Analyses liées

Recevoir les prochaines analyses

Choix par catégorie · Sans spam · Désabonnement en 1 clic

votre@email.fr
Bibliographie et lexique

Bibliographie

Lexique

LLM· Grand modèle de langage
Modèle d'intelligence artificielle entraîné sur de vastes corpus de texte pour prédire et générer du langage, capable de tâches d'analyse, de synthèse et de raisonnement en langage naturel sans avoir été explicitement programmé pour la tâche demandée.
Date de coupure· knowledge cutoff
Date au-delà de laquelle les données d'entraînement d'un modèle ne contiennent plus d'information. Tout ce qui s'est produit après cette date est, en principe, inconnu du modèle sous sa forme figée : sauf à avoir été introduit via le contexte du prompt.
Transformer
Architecture de réseau de neurones fondée sur le mécanisme d'attention, à la base des grands modèles de langage actuels.
Mécanisme d'attention
Composant permettant à un modèle de pondérer l'importance relative des différentes parties d'une séquence d'entrée.
Fenêtre de contexte· Context window
Quantité maximale de texte qu'un modèle peut prendre en compte simultanément pour produire une réponse.
Coût d'inférence
Coût de calcul associé à l'utilisation d'un modèle déjà entraîné pour produire une réponse.

Newsletter

Recevoir les prochaines analyses

Choisissez les catégories qui vous intéressent.

Catégories