Dossier · Intelligence artificielle
Comprendre les modèles post-LLM
Mamba, TRM et JEPA sont présentés comme la suite des LLM. Ce dossier distingue ce qui est déployé, ce qui est un préprint fragile, et ce qui reste un pari financé sans produit.
Décision possible
La synthèse actionnable du dossier
Ce que les preuves permettent réellement de décider — sans le bruit commercial.
Lire la synthèse →Articles courts
21 articlesL'open source (Llama, Qwen, et les autres) : une direction collective différente
Meta et Alibaba ne vendent pas l'accès à leurs modèles : ils les diffusent librement. Une stratégie qui ne joue pas sur le même terrain que les labs à modèle propriétaire fermé.
28 juillet 2026Anthropic et Claude : pourquoi la fiabilité vérifiable est le pari, pas l'argument marketing
Fondée en 2021 par des chercheurs partis d'OpenAI sur des désaccords de sécurité, Anthropic pousse la même direction à chaque génération de Claude : rendre l'alignement traçable et donner au modèle une autonomie d'action prolongée, plutôt que viser le modèle le moins cher ou le plus grand public.
27 juillet 2026ARC-AGI, le banc d'essai que les LLM ratent
Des grilles de couleurs qu'un humain résout en quelques essais, mais où les grands modèles de langage s'effondrent : comprendre ce banc d'essai est la condition pour lire correctement les scores du TRM.
27 juillet 2026Ce qui explique vraiment la performance du HRM (et donc du TRM)
Une étude d'ablation indépendante démonte l'architecture du HRM pièce par pièce : la supervision profonde explique l'essentiel du gain de précision, la récursion hiérarchique presque rien. La méthode compte autant que le résultat.
27 juillet 2026Comment lire un préprint non revu par les pairs sans se faire avoir
Un résultat spectaculaire publié sur arXiv n'a pas encore été vérifié par d'autres chercheurs du domaine. Trois réflexes de lecture, illustrés par le cas du TRM, permettent de juger ce type de papier sans attendre ni le rejeter par principe.
27 juillet 2026Convergence ou divergence : les grands labs IA visent-ils tous la même chose ?
Sept laboratoires, sept trajectoires : produit grand public, souveraineté, échelle de calcul brute, efficience architecturale. Aucun ne vise le même point d'arrivée — et c'est le même désassemblage que celui déjà observé au niveau des modèles eux-mêmes.
27 juillet 2026La course aux "world models" : qui lève quoi
Yann LeCun, Fei-Fei Li et Google DeepMind portent chacun un pari sur les modèles du monde en quelques mois à peine. Le financement dépasse déjà le milliard de dollars pour deux d'entre eux ; la preuve commerciale, elle, reste à établir pour les trois.
27 juillet 2026Le vrai coût énergétique d'une requête LLM : un facteur d'environ 13 sépare un LLM standard d'un LLM de raisonnement
Une requête coûte 0,31 Wh en médiane sur un LLM standard, contre 3,91 Wh sur un LLM de raisonnement, d'après la mesure la plus récente et la mieux revue par les pairs : l'écart le plus significatif ne sépare pas l'IA du reste, il sépare deux façons d'utiliser l'IA.
27 juillet 2026DeepSeek : la direction choisie n'est pas le prix cassé, c'est l'efficience de calcul comme discipline
DeepSeek n'a pas fait le choix de coûter moins cher par posture commerciale. Adossé au fonds quantitatif High-Flyer et confronté aux restrictions américaines sur l'accès aux puces avancées, le laboratoire a fait de l'efficience de calcul une direction stratégique stable, que chaque génération de modèle pousse plus loin plutôt qu'un coup ponctuel réussi une fois.
27 juillet 2026Google / Gemini : la direction choisie, et comment chaque génération la pousse plus loin
Google ne construit pas Gemini comme un chatbot autonome à faire grandir. La direction choisie tient en trois choix stables : une recherche IA unifiée depuis 2023, une conception multimodale dès l'entraînement, une infrastructure de calcul maison plutôt que louée.
27 juillet 2026Jamba : la première architecture hybride Mamba-Transformer de qualité production
Un modèle hybride n'élimine pas l'attention, il l'alterne avec des blocs Mamba. AI21 Labs a été le premier à en faire un choix d'ingénierie arbitré, pas une hypothèse de recherche.
27 juillet 2026Mistral AI : la direction choisie, et comment chaque génération la pousse plus loin
Depuis Mistral 7B en 2023, Mistral AI tient la même ligne à travers ses générations de modèles : l'ouverture des poids et l'efficience comme choix de fondation, la souveraineté numérique européenne comme raison d'être, pas comme argument de circonstance.
27 juillet 2026Mixture of experts : pourquoi DeepSeek R1 n'active que 37 des 671 milliards de paramètres
Un LLM dense calcule avec la totalité de ses paramètres à chaque token. Une architecture à mélange d'experts n'en active qu'une fraction, sélectionnée par un mécanisme de routage — ce qui explique l'écart entre les 671 milliards affichés par DeepSeek R1 et les 37 milliards réellement mobilisés par requête.
27 juillet 2026OpenAI : une charte, un même triptyque stratégique répété à chaque génération de modèle
ChatGPT en 2022, un modèle qui raisonne en 2024, des agents qui agissent depuis 2025 : trois annonces d'apparence différente qui poussent la même charte — bâtir une IA générale et en distribuer largement les bénéfices — un cran plus loin à chaque fois. Le numéro de version change ; la direction, non.
27 juillet 2026Pourquoi l'attention d'un Transformer coûte cher sur un contexte long
Le mécanisme qui a rendu les Transformers redoutables sur le texte a un coût qui grossit plus vite que le contexte lui-même — précisément le problème que Mamba a été conçu pour contourner.
27 juillet 2026Qu'est-ce que le TRM (Tiny Recursive Model) ?
Un modèle de quelques millions de paramètres bat les LLM sur des puzzles fermés pour moins de 500 dollars d'entraînement — mais pourquoi ça marche ne fait plus consensus.
27 juillet 2026Qu'est-ce qu'un LLM "de raisonnement" ?
Une sous-famille de LLM insère une longue étape de calcul intermédiaire avant de répondre, au prix d'une consommation énergétique par requête supérieure d'un facteur d'environ 13 à celle d'un LLM standard.
27 juillet 2026Test-time compute : pourquoi certains modèles réfléchissent avant de répondre
Un calcul supplémentaire mobilisé au moment de répondre, pas pendant l'entraînement : Snell et al. (2024) montrent qu'à budget de calcul égal, cette dépense peut battre un modèle plus gros — un principe qui dépasse le nom du modèle en cours à la date de lecture.
27 juillet 2026xAI / Grok : pourquoi ce laboratoire mise sur les données de X et sur l'échelle de calcul brute plutôt que sur l'efficience
Fondée par Elon Musk en 2023, propriétaire par ailleurs de X, xAI construit Grok sur deux paris stables : l'accès aux publications récentes de la plateforme plutôt qu'un modèle figé à une date de coupure, et un centre de calcul dédié, Colossus, taillé pour la taille plutôt que pour l'efficience. Un choix qui s'oppose frontalement à celui de Mistral ou DeepSeek.
27 juillet 2026Qu'est-ce que JEPA ?
Une architecture pensée pour comprendre et anticiper le monde physique plutôt que générer du texte — un pari financé à plus d'un milliard de dollars, sans produit commercial démontré à ce jour.
19 juillet 2026Qu'est-ce que Mamba ?
Une architecture à état sélectif, déjà en production, pensée pour réduire le coût du contexte long face aux Transformers.
18 juillet 2026Analyses liées
Sources (extrait)
- Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971.
- Zuckerberg, M. (2024). « Open Source AI Is the Path Forward ».
- Bai, J. et al. (2023). Qwen Technical Report. arXiv:2309.16609.
- Anthropic (2023). Core Views on AI Safety: When, Why, What, and How.
Recevoir les prochaines analyses
Choix par catégorie · Sans spam · Désabonnement en 1 clic
Bibliographie et lexique
Bibliographie
- Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971.
- Zuckerberg, M. (2024). « Open Source AI Is the Path Forward ».
- Bai, J. et al. (2023). Qwen Technical Report. arXiv:2309.16609.
- Anthropic (2023). Core Views on AI Safety: When, Why, What, and How.
- Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
- Anthropic (2024). Introducing computer use, a new Claude 3.5 Sonnet, and Claude 3.5 Haiku (annonce du 22 octobre 2024).
- Anthropic (2025). Claude 3.7 Sonnet and Claude Code (annonce du lancement de Claude Code en recherche préliminaire, 24 février 2025).
- Chollet, F. (2019). On the Measure of Intelligence. arXiv:1911.01547.
- ARC Prize Foundation. ARC-AGI-1 (banc d'essai officiel et historique des scores).
- ARC Prize Foundation (2024). Introducing the ARC-AGI Public Leaderboard. Scores de référence GPT-4o et Gemini 1.5.
- ARC Prize Foundation (2025). The Hidden Drivers of HRM's Performance on ARC-AGI.
- Jolicoeur-Martineau, A. (2025). Less is More: Recursive Reasoning with Tiny Networks. arXiv:2510.04871.
- Tversky, A., & Kahneman, D. (1973). Availability: A heuristic for judging frequency and probability. Cognitive Psychology, 5(2), 207-232.
- TechCrunch (2026). Yann LeCun's AMI Labs raises $1.03B to build world models.
- Sifted (2026). Yann LeCun's AMI Labs raises $1bn in Europe's biggest seed round.
- TechCrunch (2026, 18 février). World Labs lands $1B, with $200M from Autodesk, to bring world models into 3D workflows.
- Google DeepMind (2025, 5 août). Genie 3: A new frontier for world models.
- TechCrunch (2025, 5 août). DeepMind thinks its new Genie 3 world model presents a stepping stone toward AGI.
- Oviedo, F. et al. (Microsoft Research, 2026). Energy Use of AI Inference, Efficiency Pathways, and Test-Time Scaling. Joule. arXiv:2509.20241.
- Google (2025). Measuring the environmental impact of AI inference. arXiv:2508.15734.
- Patterson, D. et al. (2021). Carbon Emissions and Large Neural Network Training.
- Étude comparative de 30 LLM commerciaux, How Hungry is AI? Benchmarking Energy, Water, and Carbon Footprint of LLM Inference. arXiv:2505.09598 (2025) — estimation antérieure, depuis révisée à la baisse par une mesure plus récente.
- DeepSeek-AI (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948.
- TechCrunch (2025). Nvidia drops $600bn off its market cap amid the rise of DeepSeek, 27 janvier 2025.
- CNBC (2025). China's DeepSeek has some big AI claims, not all experts are convinced, 30 janvier 2025.
- The Wire China (2025). Charting High-Flyer's Rise — sur l'origine de DeepSeek au sein du fonds quantitatif High-Flyer, fondé par Liang Wenfeng.
- Google DeepMind (2023). Announcing Google DeepMind.
- CNBC (2023, 20 avril). Read the internal memo Alphabet sent in merging A.I.-focused groups DeepMind and Google Brain.
- Gemini Team, Google (2023). Gemini: A Family of Highly Capable Multimodal Models. arXiv:2312.11805.
- Gemini Team, Google (2024). Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context. arXiv:2403.05530.
- Lieber et al. (2024). Jamba: A Hybrid Transformer-Mamba Language Model (AI21 Labs).
- Étude de reclassement de documents comparant Mamba et Transformers. arXiv:2412.14354.
- Jiang, A. Q. et al. (2023). Mistral 7B. arXiv:2310.06825.
- Jiang, A. Q. et al. (2024). Mixtral of Experts. arXiv:2401.04088.
- Mistral AI (2024). « Au Large », annonce de Mistral Large, 26 février 2024.
- DeepSeek-AI. Rapport technique DeepSeek-V3, l'architecture à mélange d'experts sous-jacente à DeepSeek-R1 (671 milliards de paramètres au total, 37 milliards activés par token).
- Meta (2024). Llama 3.1, modèle dense de 70 milliards de paramètres utilisé ici comme repère de comparaison.
- OpenAI (2018, révisé depuis). OpenAI Charter.
- OpenAI (2022). Introducing ChatGPT, 30 novembre 2022.
- OpenAI (2024). Introducing OpenAI o1-preview, 12 septembre 2024.
- OpenAI (2024). Video generation models as world simulators (Sora), 15 février 2024.
- OpenAI (2025). Introducing Operator, 23 janvier 2025.
- OpenAI (2025). Introducing ChatGPT agent, 17 juillet 2025.
- Vaswani, A. et al. (2017). Attention Is All You Need. arXiv:1706.03762.
- Gu, A. & Dao, T. (2023). Mamba: Linear-Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
- Note technique (2026). Tiny Recursive Models on ARC-AGI-1: Inductive Biases, Identity Conditioning, and Test-Time Compute. arXiv:2512.11847.
- OpenAI (2024). Learning to Reason with LLMs. Annonce du modèle o1.
- Snell, C., Lee, J., Xu, K., & Kumar, A. (2024). Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Parameters. arXiv:2408.03314.
- CNBC (28 mars 2025). Elon Musk says xAI has acquired X in deal that values social media site at $33 billion.
- Wikipedia. Colossus (data center) — historique, localisation et montée en puissance du site de Memphis.
- SemiAnalysis (2026). xAI's Colossus 2 — First Gigawatt Datacenter In The World, Unique RL Methodology, Capital Raise.
- Assran, M. et al. (2023). I-JEPA: Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture. Meta AI.
- Assran, M. et al. (2025). V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning. Meta AI / AMI Labs.
- TechCrunch (2026). Détails du tour de table AMI Labs et du partenariat Nabla.
- Dao, T. & Gu, A. (2024). Transformers are SSMs. arXiv:2405.21060 (Mamba-2).
- Travaux de suivi du TRM. Document principal : Mixture-of-Recursions (NeurIPS 2025). Autres travaux compilés à titre de faisceau : Probabilistic TRM, Generative Recursive Reasoning Models, Unrolled Policy Iteration for Tiny Recursive Models (ateliers ICLR 2026).
- Sur la capitalisation de Samsung Electronics, 2025-2026. Revue de presse financière convergente sur l'attribution au supercycle mémoire ; faisceau plutôt que source isolée.
- Déploiements Mamba en production. Lieber et al. (2024), Jamba: A Hybrid Transformer-Mamba Language Model (AI21 Labs) ; Codestral Mamba (Mistral, 2024) ; IBM Granite 4.0 (2024).
- TechCrunch (2026). Yann LeCun's AMI Labs raises $1.03B to build world models. Sifted (2026). Yann LeCun's AMI Labs raises $1bn in Europe's biggest seed round.
- Assran, M. et al. (2023, 2025). I-JEPA et V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning. Meta AI / AMI Labs.
- Le Grand Continent (2025). Entretien avec Alexia Jolicoeur-Martineau, Que sont les « TRM » ? Après les LLM, comprendre la future révolution de l'IA.
Lexique
- LLM· Grand modèle de langage↗
- Modèle d'intelligence artificielle entraîné sur de vastes corpus de texte pour prédire et générer du langage, capable de tâches d'analyse, de synthèse et de raisonnement en langage naturel sans avoir été explicitement programmé pour la tâche demandée.
- Date de coupure· knowledge cutoff↗
- Date au-delà de laquelle les données d'entraînement d'un modèle ne contiennent plus d'information. Tout ce qui s'est produit après cette date est, en principe, inconnu du modèle sous sa forme figée : sauf à avoir été introduit via le contexte du prompt.
- Transformer↗
- Architecture de réseau de neurones fondée sur le mécanisme d'attention, à la base des grands modèles de langage actuels.
- Mécanisme d'attention↗
- Composant permettant à un modèle de pondérer l'importance relative des différentes parties d'une séquence d'entrée.
- Fenêtre de contexte· Context window↗
- Quantité maximale de texte qu'un modèle peut prendre en compte simultanément pour produire une réponse.
- Coût d'inférence↗
- Coût de calcul associé à l'utilisation d'un modèle déjà entraîné pour produire une réponse.