Après les LLM : ce que TRM, Mamba et JEPA prouvent vraiment
Mamba équipe déjà des modèles en production, le TRM reste un préprint fragilisé par la réplication, JEPA a levé plus d'un milliard sans produit commercial. Trois niveaux de preuve à ne pas confondre.

Décision concernée
Faut-il regarder TRM, Mamba ou JEPA comme la suite des LLM ?
Pas au même niveau de preuve, ni au même horizon. L'enjeu reste modéré et la vérification proposée reste réversible, ce qui justifie d'agir dès maintenant plutôt que d'attendre. Vérifiez si votre fournisseur LLM utilise déjà une architecture hybride Mamba pour réduire le coût du contexte long, un point actionnable dès le prochain appel d'offres ; ne budgétez pas le TRM avant l'existence d'un produit, il n'y en a aucun à ce jour ; ne suivez JEPA que si vous avez un cas d'usage robotique, de vision industrielle, de santé ou de simulation, et ignorez-le sinon.
L'essentiel en 3 points
- Le TRM, Mamba et JEPA répondent à des besoins différents et ne sont pas substituables : raisonnement structuré étroit à ressources minimales pour le premier, même famille de tâches que les LLM mais optimisée pour le contexte long pour le second, compréhension et prédiction du monde physique pour des usages professionnels pour le troisième.
- Ces trois pistes se situent à des niveaux de preuve très inégaux : Mamba est une architecture établie avec déploiement industriel réel, le TRM reste un préprint dont le mécanisme central a déjà été affaibli deux fois par réplication indépendante, JEPA a levé plus d'un milliard de dollars sans produit commercial démontré à grande échelle.
- Ces éléments invitent à juger chaque paradigme au niveau de preuve qui est le sien plutôt qu'à l'attention médiatique qu'il reçoit, ce qui gagne à devenir un réflexe de lecture chaque fois qu'un nouveau récit « après les LLM » circule.
Depuis l’automne 2025, trois récits distincts prétendent chacun succéder aux grands modèles de langage : un minuscule modèle récursif capable de battre des LLM sur des puzzles, une architecture à mémoire constante déjà glissée dans des modèles de production, et un pari à plus d’un milliard de dollars sur des systèmes qui apprendraient le monde physique plutôt que le texte. Les trois sont réels. Aucun des trois ne joue au même niveau de preuve, et les confondre dans un même récit “après les LLM” empêche de répondre à la question qu’un décideur pose réellement : lequel regarder, lequel ignorer pour l’instant, et est-ce que ça se combine.
Les trois alternatives aux LLM les plus médiatisées de la période, TRM, Mamba et JEPA, ne concourent pas sur le même terrain ni au même niveau de preuve ; les confondre dans un même récit masque qu’on compare un résultat mesuré, une architecture déployée, et un pari financé.
À retenir : Mamba est une piste d’infrastructure déjà actionnable ; TRM est un résultat de recherche remarquable mais non produit ; JEPA est un pari industriel lourdement financé mais encore peu validé commercialement.
Repères pour la décision
Décision concernée. Cette analyse ne répond pas à “faut-il adopter l’IA”, mais à “où regarder maintenant, où attendre”. Trois décisions concrètes en découlent : demander à son fournisseur LLM s’il utilise une architecture hybride Mamba pour réduire le coût du contexte long, un point à vérifier dès le prochain appel d’offres ; ne pas budgéter le TRM avant l’existence d’un produit, puisqu’il n’y en a aucun à ce jour ; ne suivre JEPA que si l’on a un cas d’usage robotique, de vision industrielle, de santé ou de simulation, et l’ignorer sinon, quel que soit le bruit médiatique autour du sujet.
Superposables ou individuelles. Ça dépend du niveau où chaque technologie opère. LLM et Mamba ne sont pas deux choix concurrents : Mamba est un composant d’architecture qui remplace ou complète le Transformer à l’intérieur d’un même modèle, déjà en production chez plusieurs laboratoires. TRM et LLM opèrent à des niveaux différents, l’un généraliste, l’autre spécialiste étroit, ce qui appelle un appel d’outil plutôt qu’une fusion. JEPA et LLM ont déjà été combinés dans une publication de recherche avec un gain mesuré, pas seulement une intuition. Le sens général de ces quatre combinaisons converge : le marché ne va vraisemblablement pas remplacer les LLM par le TRM, Mamba ou JEPA, il va plutôt désassembler l’IA généraliste en briques spécialisées, chaque tâche étant routée vers l’architecture la plus efficiente pour elle. C’est une lecture cohérente avec ce qui est déjà observable, pas encore une prédiction validée.
Cohérence d’une architecture combinée. LLM et Mamba : déjà déployés ensemble en production (Jamba, et des modèles hybrides chez plusieurs laboratoires), le sens est net, gagner en efficacité sur le contexte long sans perdre la qualité du Transformer sur le reste. LLM et TRM : pas encore déployés ensemble, mais proposé explicitement par l’autrice du TRM elle-même, sur le modèle d’un programme général qui appelle un sous-programme spécialisé, un cas d’école puisque les LLM obtiennent 0 % sur les bancs d’essai mêmes où le TRM excelle. LLM et JEPA : une publication de recherche de septembre 2025 combine les deux objectifs d’entraînement dans un seul modèle avec un gain mesuré allant jusqu’à 14 points de précision sur certaines tâches, mais reste une piste de recherche, pas un produit. Mamba et JEPA : la seule combinaison plausible que je n’ai pas trouvée mise en œuvre dans une publication, à traiter comme une extrapolation prudente, pas un fait établi.
Quatre logiques, quatre mécanismes
Note de périmètre. Les trois alternatives retenues ici, TRM, Mamba et JEPA, ne constituent pas un palmarès technique exhaustif des successeurs possibles des LLM. D’autres pistes sérieuses existent, dont RWKV, les modèles de diffusion appliqués au texte, ou d’autres modèles à espace d’état concurrents de Mamba. Le choix de ces trois-là tient à un critère assumé, celui d’avoir le plus mobilisé attention médiatique et capital sur la période automne 2025 à mi-2026, ce qui en fait les objets que le décideur rencontre le plus souvent, pas nécessairement les plus prometteurs sur le plan strictement technique.
Ce que les données établissent. Un LLM génère sa réponse un token à la fois : chaque unité de texte est produite à partir de toutes les précédentes, ce qui expose le modèle à une propagation d’erreur si un seul token est mal choisi. Le TRM (Tiny Recursive Model), proposé par Jolicoeur-Martineau [1], chercheuse au Samsung SAIT AI Lab, ne génère pas un texte : il part d’une réponse initiale et la révise à travers des cycles de raffinement récursif, jusqu’à seize fois, avant de la livrer d’un bloc. Mamba, l’architecture à état sélectif proposée par Gu et Dao [6], remplace le mécanisme d’attention des Transformers par un balayage séquentiel à travers un état de taille fixe, qui ne grandit pas avec la longueur du contexte, contrairement à la mémoire d’un LLM classique. JEPA (Joint Embedding Predictive Architecture), le cadre proposé par LeCun et ses coauteurs [9], ne prédit ni un token ni un pixel : un encodeur transforme l’état observé en représentation abstraite, puis un prédicteur estime la représentation de l’état futur dans cet espace latent, en ignorant les détails non pertinents. Le Schéma 1 restitue ces quatre séquences telles que décrites dans leurs papiers respectifs.
Schéma 1. Quatre mécanismes de traitement de l'information
Chaque panneau restitue l'ordre réel des étapes du mécanisme central de l'architecture, pas une illustration libre.
LLM : génération token par token
Chaque token est produit à partir de tous les précédents, un à la fois (Vaswani et al., 2017).
TRM : raffinement récursif d'une réponse
La même réponse latente est révisée à travers des cycles successifs, jusqu'à 16 fois (Jolicoeur-Martineau, 2025).
Mamba : balayage à état constant
La séquence défile à travers un état de taille fixe, qui ne grandit pas avec le contexte (Gu et Dao, 2023).
fixe
JEPA : prédiction dans l'espace latent
L'état observé est encodé, puis un prédicteur estime la représentation abstraite de l'état futur, sans reconstruire l'image (Assran et al., 2023 ; 2025).
observé
futur
(prédit)
Schéma 1. Sources : Vaswani et al. (2017) [I] ; Jolicoeur-Martineau (2025) [S] ; Gu et Dao (2023) [I] ; Assran et al. (2023, 2025) [P, Meta/AMI Labs].
Un garde-fou nécessaire avant d’aller plus loin. Le résultat brut du TRM sur ses bancs d’essai n’est pas contesté : 87,4 % de précision sur Sudoku-Extreme, contre 55,0 % pour son prédécesseur HRM et 0 % pour les LLM testés, sont des chiffres reproductibles, publiés dans le papier lui-même [1]. Ce qui est contesté, on le détaille en section 5, c’est l’explication de pourquoi ça marche, pas le fait que ça marche. Confondre les deux reviendrait à reproduire, en sens inverse, le problème qu’on reproche à la couverture médiatique du papier — le même réflexe de vérification qui distingue un vrai signal d’un artefact de méthode dans notre analyse sur les LLM en finance s’applique ici : un résultat brut non contesté peut cohabiter avec une explication contestée.
Pour quelle tâche, concrètement
Ce que les données établissent. Le tableau suivant sépare volontairement deux catégories de LLM que la couverture médiatique du TRM confond souvent : les LLM standard, entraînés pour la génération de texte générale, et les LLM de raisonnement (la famille o1, o3, DeepSeek-R1), qui utilisent un calcul de raisonnement étendu au moment de la réponse. C’est cette seconde catégorie, pas les LLM en général, que le TRM prend pour cible directe de sa comparaison [1].
| LLM standard | LLM de raisonnement | TRM | Mamba | JEPA | |
|---|---|---|---|---|---|
| Tâche visée | Génération de texte, dialogue, code, connaissances générales | Les mêmes tâches, avec un calcul de raisonnement étendu avant la réponse | Puzzles structurés étroits et déterministes (Sudoku, labyrinthes, ARC-AGI) | Même famille de tâches que les LLM, optimisée pour le contexte très long | Compréhension et prédiction du monde physique, planification robotique |
| Exemple concret | Rédaction, résumé, assistance conversationnelle | Démonstration mathématique, débogage complexe | Résolution d’une grille de Sudoku extrême, d’un labyrinthe de 30x30 | Analyse d’un document de plusieurs centaines de pages en une passe | Un robot planifie une saisie d’objet jamais vu (V-JEPA 2-AC) |
| Limite documentée | Faible fiabilité sur les tâches à contrainte stricte (0 % sur Sudoku-Extreme et Maze-Hard pour les modèles testés dans [1]) | Coût de calcul et énergétique très supérieur pour le même type de tâche (voir section suivante) | Modèle supervisé à réponse déterministe, pas génératif ; ne traite qu’une tâche à la fois [1] | Gain qui dépend de la longueur du contexte, pas universel (throughput parfois inférieur sur tâches courtes) [7] | Aucun produit commercial déployé à grande échelle à ce jour |
Grand public ou professionnel
Mon interprétation, à partir des éléments disponibles. La matrice de maturité plus bas indique déjà l’acheteur naturel de chaque technologie ; la question “grand public ou professionnel” y ajoute une dimension distincte, celle de savoir si l’utilisateur final voit la technologie ou non. Le tableau suivant sépare ces deux axes.
| Technologie | Visible par l’utilisateur final | Position grand public / professionnel |
|---|---|---|
| LLM (standard et raisonnement) | Oui, directement | Déjà les deux : grand public via les interfaces de conversation, professionnel via les API |
| TRM | Non, aucun produit à ce jour | Argument grand public réel mais non livré : sa très petite taille le rendrait exécutable sur téléphone, sans connexion, mais aucun produit ne l’utilise |
| Mamba | Non, brique d’infrastructure invisible | Ni l’un ni l’autre au sens strict : composant qui rend un produit existant moins coûteux, sans que l’utilisateur le sache |
| JEPA | Non, aucun produit grand public | Professionnel en premier : premier partenaire annoncé d’AMI Labs dans la santé (Nabla) [10], autres cas cités en robotique et industrie ; passerelle grand public évoquée mais non engagée |
Le prix en ressources, ce qui se chiffre et ce qui ne se chiffre pas encore
Ce que les données établissent. Deux questions différentes se cachent sous “ressources”, et les distinguer évite de confondre “consomme peu” et “rentabilise bien ce qu’il consomme”. La première est la ressource absolue : combien d’énergie une tâche donnée consomme-t-elle en valeur brute. La seconde est l’efficience : quel résultat obtient-on rapporté à cette dépense, pour la tâche visée.
Sur la ressource absolue, la mesure la plus récente et la mieux revue par les pairs [11] chiffre une requête standard à 0,31 Wh en médiane sur les modèles les plus avancés, contre 3,91 Wh pour une requête mobilisant un calcul de raisonnement étendu au moment de répondre : un facteur d’environ 13 à l’intérieur même de la famille LLM, avant toute comparaison avec un autre paradigme. Sur l’entraînement, Patterson et al. [12] chiffrent celui de GPT-3 à environ 1 287 000 kWh. Le papier TRM ne publie pas de kWh directement, mais précise le matériel utilisé : un GPU L40S pendant 36 heures pour Sudoku, quatre L40S pendant 24 heures pour les labyrinthes, quatre H100 pendant environ trois jours pour ARC-AGI [1]. En appliquant la puissance nominale de ces cartes (estimation, pas une mesure directe), l’entraînement complet se situe entre une dizaine et environ 200 kWh selon la tâche, cohérent avec le coût annoncé de moins de 500 dollars, soit un écart de quatre ordres de grandeur avec l’entraînement de GPT-3. La Figure 1 situe TRM, JEPA et les deux catégories de LLM sur une même échelle de taille de modèle, le proxy de ressource le plus directement comparable entre les paradigmes. DeepSeek R1 y apparaît en deux barres distinctes plutôt qu’une seule : son architecture à mélange d’experts affiche 671 milliards de paramètres au total, mais n’en active que 37 milliards par token traité, un facteur 18 entre la taille affichée et le calcul réellement mobilisé par requête. Un repère unique dans une seule barre aurait été trompeur sur une échelle logarithmique, où la position visuelle ne restitue pas la proportion réelle ; deux barres séparées évitent ce piège, et font apparaître un résultat qui mérite d’être noté, les 37 milliards de paramètres actifs de DeepSeek R1 sont d’un ordre de grandeur proche des 70 milliards de Llama 3.1, le LLM standard de comparaison.

Le nombre de paramètres reste un indicateur partiel : pour un usage réel, le coût par requête, la latence, la mémoire nécessaire, le débit et la disponibilité commerciale comptent au moins autant. Le tableau suivant rassemble ce qui est sourcé pour chacune de ces dimensions et signale explicitement ce qui ne l’est pas, plutôt que d’estimer par analogie.
| Dimension | LLM standard | LLM raisonnement | TRM | Mamba | JEPA |
|---|---|---|---|---|---|
| Coût énergétique par requête | 0,31 Wh médian, 0,16-0,60 Wh [11] | 3,91 Wh médian, 2,15-7,05 Wh [11] | Non applicable : pas d’usage en requête individuelle à ce jour | Dépend de la longueur du contexte, pas de chiffre absolu universel | Non publié |
| Coût d’entraînement complet | Non systématiquement publié par les éditeurs | Non systématiquement publié par les éditeurs | Environ 10 à 200 kWh estimés, moins de 500 dollars annoncés [1] | Non applicable en tant que tel, c’est un composant, pas un modèle autonome | Non publié |
| Produit disponible aujourd’hui | Oui, à grande échelle | Oui, à grande échelle | Non | Oui, intégré dans des modèles hybrides commerciaux | Non |
| Support commercial ou SLA | Oui | Oui | Non applicable, pas de produit | Oui, via les fournisseurs qui l’intègrent | Non applicable, pas de produit |
Sur Mamba, la bonne unité n’est pas un chiffre absolu mais une courbe : le coût de calcul croît linéairement avec la longueur du contexte, contre une croissance quadratique chez un Transformer classique, et la mémoire nécessaire à l’inférence reste constante plutôt que de croître avec le contexte [6]. Traduit en exemple mesuré et déployé, Jamba affiche un débit environ trois fois supérieur sur les contextes longs par rapport à un modèle Transformer de taille comparable, et le papier fondateur de Mamba annonçait un gain de débit de l’ordre de cinq fois à l’inférence [6], [7]. Un point d’honnêteté à garder : ce gain n’est pas universel. Plusieurs études trouvent une utilisation du GPU (mesurée en MFU) inférieure à celle des Transformers optimisés, et une étude de reclassement de documents trouve même un débit d’entraînement inférieur pour Mamba sur cette tâche précise [13].
Sur JEPA, aucune donnée de consommation énergétique publique équivalente aux études indépendantes sur les LLM n’a été trouvée. V-JEPA 2, le modèle vidéo de Meta, compte 1,2 milliard de paramètres, entraîné sur plus d’un million d’heures de vidéo et un million d’images, avec seulement 62 heures de données robot nécessaires pour la phase de contrôle [9]. Une stratégie d’entraînement à résolution progressive a réduit le temps GPU utilisé d’un facteur 8,4 selon les auteurs, un gain d’efficience réel et chiffré, mais qui ne renseigne pas sur la consommation absolue. C’est un manque à signaler, pas à combler par une estimation fragile de plus.
Sur l’efficience, à séparer donc de ce qui précède : le TRM obtient 87,4 % sur Sudoku-Extreme pour moins de 500 dollars d’entraînement, contre 0 % pour les LLM testés sur la même tâche [1]. C’est un argument d’efficience pour une tâche étroite et déterministe, pas une mesure de ressource absolue généralisable à d’autres usages.
Ce qui est prouvé, ce qui est financé, ce qui reste à démontrer
Ce que les données établissent, état des lieux au 10 juillet 2026, un secteur qui évolue vite. Trois niveaux de preuve, pas un seul, coexistent sous le même récit “après les LLM”. La matrice suivante les résume ; les deux horizons non datés par une source sont marqués comme tels plutôt que présentés comme des faits.
| Technologie | Maturité marché | Acheteur naturel | Horizon |
|---|---|---|---|
| Mamba / hybrides | Élevée | Fournisseurs IA, cloud, infrastructure, modèles à contexte long | Maintenant |
| LLM de raisonnement | Élevée | Entreprises, développeurs, agents, copilotes | Maintenant |
| TRM | Faible | Recherche, laboratoires, bancs d’essai, IA embarquée spécialisée | Estimation, non sourcée : horizon de recherche, aucun calendrier produit annoncé à ce jour |
| JEPA / world models | Moyenne côté financement, faible côté produit | Robotique, santé, industrie, simulation | Estimation partiellement sourcée : “plusieurs années” selon le PDG d’AMI Labs lui-même [10], sans chiffre précis avancé |
Mamba est le plus établi des trois : littérature académique continue depuis 2023, et surtout des modèles hybrides Mamba-Transformer déjà en production, dont Jamba (AI21 Labs), le premier modèle hybride de qualité production, Codestral Mamba (Mistral) pour le code, et IBM Granite 4.0 [7]. Ce n’est plus une hypothèse de recherche, c’est un choix d’ingénierie déjà arbitré par plusieurs acteurs.
Le TRM est le plus jeune et le plus contesté. Une analyse indépendante de l’ARC Prize Foundation [2] a montré, sur le prédécesseur direct du TRM, que le mécanisme mis en avant par la couverture médiatique, le raisonnement hiérarchique inspiré du cerveau, expliquait très peu du résultat : c’est la supervision profonde, une technique d’entraînement, qui portait l’essentiel du gain (de 19 % à 39 % de précision, contre 35,7 % à 39,0 % pour l’apport de la récursion hiérarchique seule). Une seconde analyse indépendante, datée de janvier 2026 [3], porte cette fois directement sur le TRM et conclut que son succès sur ARC-AGI-1 s’explique surtout par l’efficience de l’architecture, un conditionnement fort par identifiant de tâche, et un usage agressif de calcul au moment du test, plutôt que par un raisonnement interne profond. Le récit “un tout petit modèle qui raisonne comme un cerveau” a donc été affaibli deux fois par la communauté elle-même en quelques mois. Ce qui n’empêche pas le TRM d’avoir suscité un vrai courant de recherche actif : une dizaine de travaux de suivi sont parus depuis, dont un accepté à NeurIPS 2025 et deux présentés à des ateliers ICLR 2026 [4]. Un chiffre associé au papier mérite par ailleurs une correction : la couverture médiatique lui attribue une hausse de 10 % de la capitalisation de Samsung, environ 60 milliards de dollars, au moment de sa publication. Aucune source financière consultée ne corrobore ce lien ; la performance boursière de Samsung sur la période est attribuée de façon convergente par la presse financière au supercycle des puces mémoire porté par la demande d’infrastructure des LLM eux-mêmes [5], jamais au papier TRM.
JEPA occupe une position à part : ni établi par le déploiement comme Mamba, ni jeune et contesté comme le TRM, mais porté par un pari financier d’une ampleur inédite. Yann Le Cun, quittant Meta le 19 novembre 2025 après douze ans à la tête de la FAIR [8], a fondé AMI Labs et levé 1,03 milliard de dollars en mars 2026, la plus grosse levée d’amorçage jamais réalisée par une entreprise européenne, avec Nvidia, Samsung, Bezos Expeditions, Temasek et Eric Schmidt au tour de table [8], [10]. Fei-Fei Li (World Labs, 1,23 milliard de dollars levés) et Google DeepMind (Genie 3) occupent le même terrain : une catégorie entière s’est constituée en quelques mois. Mais à la date de rédaction, aucun de ces acteurs n’a livré de produit commercial validé à grande échelle : le financement précède la preuve, ce qui n’invalide pas la thèse mais change son statut, celui d’un pari assumé plutôt que d’un résultat démontré.
Extrapolation prudente, ce qui ferait basculer le diagnostic. Cette lecture est datée et faite pour être révisée. Trois signaux concrets feraient monter l’un ou l’autre paradigme d’un cran sur l’échelle de preuve. Pour le TRM, une réplication indépendante revue par les pairs qui confirmerait le résultat sans le réduire à un artefact d’entraînement le ferait passer de curiosité contestée à résultat consolidé. Pour JEPA, le premier produit commercial déployé à grande échelle, en robotique ou en santé, le ferait passer de pari financé à technologie en validation. Pour Mamba, une adoption dans un modèle grand public de premier plan, plutôt que dans des modèles hybrides encore de niche, confirmerait le passage du choix d’ingénierie spécialisé au standard par défaut. Aucun de ces trois signaux n’est acquis à la date de publication ; leur survenue, ou leur absence prolongée, est précisément ce qu’un lecteur décideur gagne à surveiller.
Application par profil de décision
| Profil | Ce qui mérite une action maintenant | Ce qui mérite une veille sans budget | Point de vigilance | Enjeu | Réversibilité |
|---|---|---|---|---|---|
| DSI ou CTO évaluant une infrastructure IA | Vérifier si les fournisseurs utilisent des architectures hybrides Mamba pour les contextes longs | TRM, faute de produit disponible | Ne pas confondre le résultat du TRM (non contesté) avec l’explication de ce résultat (contestée) | Modéré | Réversible |
| Investisseur exposé à un pari IA | Distinguer, dans tout dossier “après les LLM”, le niveau de preuve réel du narratif de levée de fonds | JEPA en particulier, dont la valorisation précède la preuve de produit | Le financement massif d’un pari n’est pas une validation empirique de sa thèse | Critique | Irréversible |
| Dirigeant cherchant à limiter l’empreinte énergétique de ses usages IA | Comparer le coût par requête des LLM de raisonnement (3,91 Wh médian) à celui des LLM standard (0,31 Wh médian) avant de généraliser un modèle de raisonnement | Les paradigmes non encore déployés (TRM, JEPA), dont l’empreinte réelle en usage n’est pas mesurable | Un facteur d’environ 13 existe déjà à l’intérieur de la seule famille LLM, avant toute comparaison de paradigme | Modéré | Partiellement réversible |
| Décideur exposé au récit médiatique | Appliquer la même question à chaque nouveau paradigme annoncé : est-ce déployé, préprint, ou financé | Rien de spécifique, la vigilance elle-même est l’action | Le volume de couverture médiatique n’est pas corrélé au niveau de preuve | Faible | Réversible |
Lexique
LLM (Large Language Model) : modèle génératif entraîné à produire du texte token par token à partir de vastes corpus. LLM de raisonnement : sous-famille de LLM (o1, o3, DeepSeek-R1) utilisant un calcul de raisonnement étendu au moment de la réponse, au coût énergétique nettement supérieur. TRM (Tiny Recursive Model) : modèle supervisé de quelques millions de paramètres qui améliore une réponse par cycles de raffinement récursif plutôt que par génération séquentielle. HRM (Hierarchical Reasoning Model) : modèle prédécesseur direct du TRM, fondé sur une architecture à deux réseaux récursant à des fréquences différentes. Mamba / modèle à état sélectif (SSM) : architecture alternative au Transformer, à mémoire d’inférence constante et coût de calcul linéaire avec la longueur du contexte. JEPA (Joint Embedding Predictive Architecture) : cadre d’apprentissage qui prédit la représentation latente d’un état futur plutôt que ses pixels ou tokens. ARC-AGI : jeu de bancs d’essai de raisonnement géométrique conçu pour être facile pour un humain et difficile pour un modèle d’IA. Deep supervision (supervision profonde) : technique d’entraînement consistant à réviser une réponse à travers plusieurs étapes de supervision successives. Test-time compute (calcul au moment du test) : calcul supplémentaire mobilisé au moment de répondre plutôt que pendant l’entraînement. MFU (Model FLOPs Utilization) : mesure du taux d’utilisation réelle de la puissance de calcul théorique d’un GPU. FLOP : opération à virgule flottante, unité de mesure du volume de calcul requis par un modèle.
Jolicoeur-Martineau, A. (2025). « Less is More: Recursive Reasoning with Tiny Networks ». arXiv:2510.04871. https://arxiv.org/abs/2510.04871
ARC Prize Foundation (2025). « The Hidden Drivers of HRM’s Performance on ARC-AGI ».
Note technique (2026). « Tiny Recursive Models on ARC-AGI-1: Inductive Biases, Identity Conditioning, and Test-Time Compute ». arXiv:2512.11847. https://arxiv.org/abs/2512.11847
Travaux de suivi du TRM. Document principal : Mixture-of-Recursions (NeurIPS 2025). Autres travaux compilés à titre de faisceau, non exhaustif : Probabilistic TRM, Generative Recursive Reasoning Models et Unrolled Policy Iteration for Tiny Recursive Models (ateliers ICLR 2026).
Sur la capitalisation de Samsung Electronics, 2025-2026. La revue de presse financière est convergente sur l’attribution au supercycle mémoire ; aucun document primaire unique ne fait autorité, la mention vaut comme faisceau et non comme source isolée.
Gu, A., Dao, T. (2023). « Mamba: Linear-Time Sequence Modeling with Selective State Spaces ». arXiv:2312.00752. Et Dao, T., Gu, A. (2024). « Transformers are SSMs ». arXiv:2405.21060 (Mamba-2). https://arxiv.org/abs/2312.00752
Déploiements Mamba en production. Lieber et al. (2024), « Jamba: A Hybrid Transformer-Mamba Language Model » (AI21 Labs), premier modèle hybride Mamba-Transformer de qualité production ; Codestral Mamba (Mistral, 2024) ; IBM Granite 4.0 (2024).
TechCrunch (2026). « Yann LeCun’s AMI Labs raises $1.03B to build world models ». Sifted (2026). « Yann LeCun’s AMI Labs raises $1bn in Europe’s biggest seed round ».
Assran, M. et al. (2023, 2025). « I-JEPA » et « V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning ». Meta AI / AMI Labs.
TechCrunch (2026). Détails du tour de table AMI Labs et du partenariat Nabla.
Étude comparative de 30 LLM commerciaux, « How Hungry is AI? Benchmarking Energy, Water, and Carbon Footprint of LLM Inference ». arXiv:2505.09598 (2025). https://arxiv.org/abs/2505.09598
Patterson, D. et al. (2021). « Carbon Emissions and Large Neural Network Training ».
Étude de reclassement de documents comparant Mamba et Transformers. arXiv:2412.14354. https://arxiv.org/abs/2412.14354
Le Grand Continent (2025). Entretien avec Alexia Jolicoeur-Martineau, « Que sont les “TRM” ? Après les LLM, comprendre la future révolution de l’IA ».
Mes réserves
Ce qui invaliderait cette lecture
- Le TRM repose sur un unique papier non revu par les pairs, dont l'autrice appartient à Samsung : un intérêt institutionnel existe à faire connaître ce résultat, ce qui ne l'invalide pas mais doit être nommé.
- Les deux réplications indépendantes citées ici pour nuancer le TRM et son prédécesseur sont elles-mêmes non revues par les pairs à ce jour, l'ARC Prize Foundation étant un organisme indépendant mais avec son propre intérêt à la visibilité de son benchmark ARC-AGI.
- Les chiffres énergétiques attribués au TRM dans cet article sont dérivés de la puissance nominale des GPU utilisés, pas d'une mesure directe publiée, et doivent être lus comme un majorant indicatif.
- Les gains de Mamba dépendent de la longueur du contexte et ne sont pas universels, avec des contre-exemples publiés de débit d'entraînement inférieur à un Transformer sur certaines tâches.
- JEPA est porté par un syndicat d'investisseurs, dont plusieurs (Nvidia, Samsung) ont un intérêt commercial direct à l'infrastructure que ce paradigme consommerait, indépendamment de la question de savoir si JEPA est effectivement le paradigme gagnant.
- Les deux horizons de la matrice de maturité qui ne s'appuient pas sur une source explicite sont des estimations de lecture, pas des calendriers annoncés, et doivent être révisés dès qu'une donnée plus solide sera disponible.
Biais cognitifs que cette situation peut déclencher
- Heuristique de disponibilité (Tversky et Kahneman, 1973) : la répétition médiatique d'un même récit "après les LLM" peut donner l'impression d'un niveau de preuve croissant, indépendamment de ce que les papiers démontrent réellement.
- Biais d'ancrage (Tversky et Kahneman, 1974) : la première annonce spectaculaire, un petit modèle qui bat les LLM sur des puzzles, peut rester l'ancre mentale même après que deux réplications indépendantes en aient réduit la portée.
- Effet de halo lié au financement, proche de l'argument d'autorité : un tour de table d'un milliard de dollars, porté par des investisseurs reconnus, peut être lu comme une validation de la thèse technique, alors qu'il mesure une conviction d'investisseurs, pas un résultat démontré.

Analyse les sujets qui l'intéressent et publie ce qu'il en tire, avec méthodologie, sans jargon inutile. Choix du sujet, validation finale du plan, direction de la rédaction, validation ou modification des sources, validation et retravail du texte et des éléments d'illustration par l'auteur Axel Morel. Rédaction, choix des sources initiales, création du plan de rédaction initial par l'IA.
En savoir plusNewsletter Probans
Recevoir les prochaines analyses
Choix par catégorie · Sans spam · Désabonnement en 1 clic