Intelligence artificielle · 10 juillet 2026 · mis à jour le 4 septembre 2026

Après les LLM : Mamba en production, TRM en préprint, JEPA en laboratoire

Mamba équipe déjà des modèles en production, le TRM reste un préprint dont le mécanisme est contesté, JEPA est validé en laboratoire mais financé bien avant d'être commercialisé. Trois axes pour ne pas les confondre : validation scientifique, maturité opérationnelle, conviction économique.

Télécharger

Télécharger cette analyse

Choisissez un format.

Format

Je dispose de

Décision concernée

Faut-il regarder TRM, Mamba ou JEPA comme la suite des LLM ?

Pas au même niveau de preuve, ni au même horizon. Pour la vérification fournisseur proposée ici, l'enjeu reste modéré et l'action reste réversible : rien n'empêche d'agir dès maintenant. Pour un investisseur exposé à la thèse JEPA, l'enjeu est critique et la décision quasi irréversible : la prudence prime. Demandez à vos fournisseurs LLM des métriques de coût, de latence, de mémoire et de qualité sur vos longueurs de contexte réelles, dès le prochain appel d'offres : le recours à Mamba ou à une architecture hybride explique une partie de ces chiffres, ce n'est pas un critère d'achat en soi. Ne budgétez pas le TRM avant l'existence d'un produit, il n'y en a aucun à ce jour. JEPA est surtout pertinent aujourd'hui pour les cas d'usage visuels, physiques, robotiques ou multimodaux ; pour les autres usages, une veille légère suffit à ce stade.

L'essentiel en 3 points

  1. Les trois ne sont pas substituables. Le TRM, Mamba et JEPA répondent à des besoins différents et ne sont pas substituables : raisonnement structuré étroit à ressources minimales pour le premier, architecture générale de séquence conçue pour réduire certains coûts de l'attention pour le second, compréhension et prédiction du monde physique pour des usages professionnels pour le troisième.
  2. Leurs niveaux de preuve sont très inégaux. Ces trois pistes se situent à des niveaux de preuve très inégaux : Mamba est une architecture établie avec déploiement industriel réel, le TRM reste un préprint dont le récit mécanistique a été fragilisé d'abord sur son prédécesseur HRM puis directement par une analyse indépendante, JEPA dispose d'une validation expérimentale documentée mais d'aucun produit commercial à grande échelle malgré plus d'un milliard de dollars levés.
  3. Trois axes valent mieux que l'attention médiatique. Ces éléments invitent à classer chaque paradigme sur trois axes indépendants, validation scientifique, maturité opérationnelle et conviction économique, plutôt qu'à l'attention médiatique qu'il reçoit : un triage réutilisable chaque fois qu'un nouveau récit « après les LLM » circule.

Depuis l’automne 2025, trois récits distincts prétendent chacun succéder aux grands modèles de langage : un minuscule modèle récursif capable de battre des LLM sur des puzzles, une architecture à mémoire constante déjà glissée dans des modèles de production, et un pari à plus d’un milliard de dollars sur des systèmes qui apprendraient le monde physique plutôt que le texte. Les trois sont réels. Aucun des trois ne joue au même niveau de preuve. Les confondre dans un même récit “après les LLM” empêche de répondre à la question qu’un décideur pose réellement : lequel regarder, lequel ignorer pour l’instant, et est-ce que ça se combine.

À retenir : Mamba est une piste d’infrastructure déjà actionnable ; TRM est un résultat de recherche remarquable, non produit, et dont l’explication reste discutée ; JEPA dispose d’une validation expérimentale sérieuse mais d’aucun produit commercial, avec un financement sans commune mesure avec les deux autres.

Trois axes plutôt qu’une échelle unique. Ranger ces paradigmes sur une seule échelle « déployé, contesté, financé » ne tient pas : ces trois mots ne répondent pas à la même question et un même paradigme peut cocher les trois à la fois. Mamba est déployé, soutenu par des acteurs très financés, et toujours discuté sur l’ampleur réelle de son avantage selon les tâches. La grille utile ici croise donc trois axes indépendants, applicables à tout futur paradigme présenté comme la suite des LLM. Validation scientifique : le mécanisme avancé résiste-t-il à un examen indépendant, ou seulement le résultat brut ? Maturité opérationnelle : existe-t-il un produit commercial vérifiable, et à quelle échelle ? Conviction économique : combien de capital est engagé sur la thèse, sachant que le capital mesure une conviction d’investisseurs, jamais une preuve. Un paradigme peut être fort sur un axe et nul sur un autre : c’est précisément ce que la lecture médiatique écrase. Avant de lire la couverture d’un nouveau paradigme, le situer sur les trois axes change la question posée : plus « est-ce révolutionnaire ? » mais « fort sur quel axe, faible sur quel autre, et depuis quand ? ».

Repères pour la décision

Décision concernée. Cette analyse ne répond pas à “faut-il adopter l’IA”, mais à “où regarder maintenant, où attendre”. Trois décisions concrètes en découlent. Demander à ses fournisseurs LLM des métriques de coût, de latence, de mémoire et de qualité sur ses propres longueurs de contexte, dès le prochain appel d’offres : le recours à Mamba ou à une architecture hybride explique une partie de ces chiffres, il ne remplace pas leur mesure, et un fournisseur Transformer bien optimisé peut battre un fournisseur Mamba médiocre. Ne pas budgéter le TRM avant l’existence d’un produit, puisqu’il n’y en a aucun à ce jour. Regarder JEPA en priorité pour les cas d’usage visuels, physiques, robotiques ou multimodaux ; pour les autres usages, une veille légère suffit à ce stade, sans se laisser dicter le rythme par le bruit médiatique.

Superposables ou individuelles. Ça dépend du niveau où chaque technologie opère. LLM et Mamba ne sont pas deux choix concurrents : Mamba est un composant d’architecture qui remplace ou complète le Transformer à l’intérieur d’un même modèle, déjà en production chez plusieurs laboratoires. TRM et LLM opèrent à des niveaux différents, l’un généraliste, l’autre spécialiste étroit, ce qui appelle un appel d’outil plutôt qu’une fusion. JEPA et LLM ont déjà été combinés dans une publication de recherche avec un gain mesuré, pas seulement une intuition. Le sens général de ces quatre combinaisons converge : le marché ne va vraisemblablement pas remplacer les LLM par le TRM, Mamba ou JEPA, il va plutôt désassembler l’IA généraliste en briques spécialisées, chaque tâche étant routée vers l’architecture la plus efficiente pour elle. C’est une lecture cohérente avec ce qui est déjà observable, pas encore une prédiction validée.

Cohérence d’une architecture combinée. LLM et Mamba : déjà déployés ensemble en production (Jamba, et des modèles hybrides chez plusieurs laboratoires), le sens est net, gagner en efficacité sur le contexte long sans perdre la qualité du Transformer sur le reste. LLM et TRM : pas encore déployés ensemble, mais proposé explicitement par l’autrice du TRM elle-même, sur le modèle d’un programme général qui appelle un sous-programme spécialisé, un cas d’école puisque les LLM obtiennent 0 % sur les bancs d’essai mêmes où le TRM excelle. LLM et JEPA : une publication de recherche de septembre 2025 combine les deux objectifs d’entraînement dans un seul modèle avec un gain mesuré allant jusqu’à 14 points de précision sur certaines tâches, mais reste une piste de recherche, pas un produit. Mamba et JEPA : la seule combinaison plausible que je n’ai pas trouvée mise en œuvre dans une publication, à traiter comme une extrapolation prudente, pas un fait établi.

Quatre logiques, quatre mécanismes

Note de périmètre. Les trois alternatives retenues ici, TRM, Mamba et JEPA, ne constituent pas un palmarès technique exhaustif des successeurs possibles des LLM. D’autres pistes sérieuses existent, dont RWKV, les modèles de diffusion appliqués au texte, ou d’autres modèles à espace d’état concurrents de Mamba. Le choix de ces trois-là tient à un critère assumé, celui d’avoir le plus mobilisé attention médiatique et capital sur la période automne 2025 à mi-2026, ce qui en fait les objets que le décideur rencontre le plus souvent, pas nécessairement les plus prometteurs sur le plan strictement technique.

Ce que les données établissent. Un LLM génère sa réponse un token à la fois : chaque unité de texte est produite à partir de toutes les précédentes, ce qui expose le modèle à une propagation d’erreur si un seul token est mal choisi. Le TRM (Tiny Recursive Model), proposé par Jolicoeur-Martineau [1], chercheuse au Samsung SAIT AI Lab, ne génère pas un texte : il part d’une réponse initiale et la révise à travers des cycles de raffinement récursif, jusqu’à seize fois, avant de la livrer d’un bloc. Mamba, l’architecture à état sélectif proposée par Gu et Dao [6], remplace le mécanisme d’attention des Transformers par un balayage séquentiel à travers un état de taille fixe : la mémoire d’état nécessaire pendant l’inférence ne croît pas avec la longueur de la séquence, contrairement au cache clé-valeur d’un Transformer autoregressif standard. JEPA (Joint Embedding Predictive Architecture), le cadre proposé par LeCun et ses coauteurs [9], ne prédit ni un token ni un pixel : un encodeur transforme l’état observé en représentation abstraite, puis un prédicteur estime la représentation de l’état futur dans cet espace latent, en ignorant les détails non pertinents. Le Schéma 1 restitue ces quatre séquences telles que décrites dans leurs papiers respectifs.

Schéma 1. Quatre mécanismes de traitement de l'information

Chaque panneau restitue l'ordre réel des étapes du mécanisme central de l'architecture, pas une illustration libre.

LLM : génération token par token

Chaque token est produit à partir de tous les précédents, un à la fois (Vaswani et al., 2017).

TRM : raffinement récursif d'une réponse

La même réponse latente est révisée à travers des cycles successifs, jusqu'à 16 fois (Jolicoeur-Martineau, 2025).

Mamba : balayage à état constant

La séquence défile à travers un état de taille fixe, qui ne grandit pas avec le contexte (Gu et Dao, 2023).

état
fixe

JEPA : prédiction dans l'espace latent

L'état observé est encodé, puis un prédicteur estime la représentation abstraite de l'état futur, sans reconstruire l'image (Assran et al., 2023 ; 2025).

état
observé
état
futur
(prédit)

Schéma 1. Sources : Vaswani et al. (2017) [I] ; Jolicoeur-Martineau (2025) [S] ; Gu et Dao (2023) [I] ; Assran et al. (2023, 2025) [P, Meta/AMI Labs].

Les scores publiés par le papier original sont élevés : 87,4 % de précision sur Sudoku-Extreme, contre 55,0 % pour son prédécesseur HRM et 0 % pour les LLM testés [1]. Ces chiffres viennent du papier lui-même, ce qui n’est pas une reproduction indépendante. Plusieurs travaux ultérieurs confirment que le système exploite effectivement des mécanismes efficaces ; la part attribuable spécifiquement à la récursion propre au TRM, et la généralisation du résultat au-delà de ses bancs d’essai, restent en revanche contestées, je le détaille plus bas. Le même réflexe de vérification qui distingue un vrai signal d’un artefact de méthode dans mon analyse sur les LLM en finance s’applique ici.

87,4 %
Précision du TRM sur Sudoku-Extreme, selon le papier original
55,0 %
Précision de son prédécesseur HRM sur la même tâche
0 %
Précision des LLM testés sur la même tâche

Jolicoeur-Martineau (2025), arXiv:2510.04871. Ces chiffres viennent du papier lui-même, ce qui n'est pas une reproduction indépendante ; la part attribuable spécifiquement à la récursion propre au TRM, et la généralisation du résultat au-delà de ses bancs d'essai, restent contestées.

Pour quelle tâche, concrètement

Ce que les données établissent. Le tableau suivant sépare volontairement deux catégories de LLM que la couverture médiatique du TRM confond souvent : les LLM standard, entraînés pour la génération de texte générale, et les LLM de raisonnement (la famille o1, o3, DeepSeek-R1), qui utilisent un calcul de raisonnement étendu au moment de la réponse. C’est cette seconde catégorie, pas les LLM en général, que le TRM prend pour cible directe de sa comparaison [1].

LLM standardLLM de raisonnementTRMMambaJEPA
Tâche viséeGénération de texte, dialogue, code, connaissances généralesLes mêmes tâches, avec un calcul de raisonnement étendu avant la réponsePuzzles structurés étroits et déterministes (Sudoku, labyrinthes, ARC-AGI)Modélisation générale de séquence (langage, audio, génomique), conçue pour réduire certains coûts de l’attention ; l’intérêt grandit avec la longueur de contexte et la mémoire d’inférenceCompréhension et prédiction du monde physique, planification robotique
Exemple concretRédaction, résumé, assistance conversationnelleDémonstration mathématique, débogage complexeRésolution d’une grille de Sudoku extrême, d’un labyrinthe de 30x30Analyse d’un document de plusieurs centaines de pages en une passe, à mémoire d’inférence constanteUn robot planifie une saisie d’objet jamais vu (V-JEPA 2-AC)
Limite documentéeFaible fiabilité sur les tâches à contrainte stricte (0 % sur Sudoku-Extreme et Maze-Hard pour les modèles testés dans [1])Coût de calcul et énergétique très supérieur pour le même type de tâche (voir section suivante)Modèle supervisé à réponse déterministe, pas génératif ; spécialisé sur une famille de problèmes structurés, sans capacité généraliste démontrée comparable à un LLM [1]Gain qui dépend de la longueur du contexte, pas universel (throughput parfois inférieur sur tâches courtes) [7]Aucun produit commercial déployé à grande échelle à ce jour

Grand public ou professionnel

Ce que la méthode interprète, à partir des éléments disponibles. La matrice de maturité plus bas indique déjà l’acheteur naturel de chaque technologie ; la question “grand public ou professionnel” y ajoute une dimension distincte, celle de savoir si l’utilisateur final voit la technologie ou non.

TechnologieVisible par l’utilisateur finalPosition grand public / professionnel
LLM (standard et raisonnement)Oui, directementDéjà les deux : grand public via les interfaces de conversation, professionnel via les API
TRMNon, aucun produit à ce jourArgument grand public réel mais non livré : sa très petite taille le rendrait exécutable sur téléphone, sans connexion, mais aucun produit ne l’utilise
MambaNon, brique d’infrastructure invisibleNi l’un ni l’autre au sens strict : composant qui rend un produit existant moins coûteux, sans que l’utilisateur le sache
JEPANon, aucun produit grand publicProfessionnel en premier : premier partenaire annoncé d’AMI Labs dans la santé (Nabla) [10], autres cas cités en robotique et industrie ; passerelle grand public évoquée mais non engagée

Le prix en ressources, ce qui se chiffre et ce qui ne se chiffre pas encore

Ce que les données établissent. Deux questions différentes se cachent sous “ressources”, et les distinguer évite de confondre “consomme peu” et “rentabilise bien ce qu’il consomme”. La première est la ressource absolue : combien d’énergie une tâche donnée consomme-t-elle en valeur brute. La seconde est l’efficience : quel résultat obtient-on rapporté à cette dépense, pour la tâche visée.

Sur la ressource absolue, la mesure la plus récente et la mieux revue par les pairs [11] chiffre une requête standard à 0,31 Wh en médiane sur les modèles les plus avancés, contre 3,91 Wh pour une requête mobilisant un calcul de raisonnement étendu au moment de répondre : un facteur d’environ 13 à l’intérieur même de la famille LLM, avant toute comparaison avec un autre paradigme. Sur l’entraînement, Patterson et al. [12] chiffrent celui de GPT-3 à environ 1 287 000 kWh. Le papier TRM ne publie pas de kWh directement, mais précise le matériel utilisé : un GPU L40S pendant 36 heures pour Sudoku, quatre L40S pendant 24 heures pour les labyrinthes, quatre H100 pendant environ trois jours pour ARC-AGI [1]. Ce que ces chiffres établissent, c’est une échelle de calcul radicalement inférieure à celle d’un foundation model généraliste, cohérente avec le coût annoncé de moins de 500 dollars [1]. Ils ne permettent pas d’aller plus loin. Convertir ces heures GPU en kWh à partir de la puissance nominale des cartes ignorerait l’utilisation réelle des processeurs graphiques, le reste de la machine, le refroidissement et le rendement du centre de données. Et chiffrer précisément l’écart avec l’entraînement de GPT-3 serait trompeur : les tâches et le périmètre de capacité ne sont pas comparables. La Figure 1 situe TRM, JEPA et les deux catégories de LLM sur une même échelle de taille de modèle, le proxy de ressource le plus directement comparable entre les paradigmes. DeepSeek R1 y apparaît en deux barres distinctes plutôt qu’une seule : son architecture à mélange d’experts affiche 671 milliards de paramètres au total, mais n’en active que 37 milliards par token traité, un facteur 18 entre la taille affichée et le nombre de paramètres activés par token. Ce facteur ne dit pas le coût total d’une requête, qui dépend aussi du nombre de tokens d’entrée et de sortie, de l’attention, du batching et du matériel. Un repère unique dans une seule barre aurait été trompeur sur une échelle logarithmique, où la position visuelle ne restitue pas la proportion réelle. Les deux barres font aussi apparaître un résultat qui mérite d’être noté : les 37 milliards de paramètres actifs de DeepSeek R1 sont d’un ordre de grandeur proche des 70 milliards de Llama 3.1, le LLM standard de comparaison.

Comparaison du nombre de paramètres entre TRM, JEPA, LLM standard et LLM de raisonnement, échelle logarithmique de 10⁶ à 10¹³.

Le nombre de paramètres reste un indicateur partiel : pour un usage réel, le coût par requête, la latence, la mémoire nécessaire, le débit et la disponibilité commerciale comptent au moins autant. Ce qui n’est sourcé nulle part est marqué comme tel plutôt qu’estimé par analogie.

DimensionLLM standardLLM raisonnementTRMMambaJEPA
Coût énergétique par requête0,31 Wh médian, 0,16-0,60 Wh [11]3,91 Wh médian, 2,15-7,05 Wh [11]Non applicable : pas d’usage en requête individuelle à ce jourDépend de la longueur du contexte, pas de chiffre absolu universelNon publié
Coût d’entraînement completNon systématiquement publié par les éditeursNon systématiquement publié par les éditeursUn à quatre GPU pendant un à trois jours selon la tâche, moins de 500 dollars annoncés [1] ; aucune mesure énergétique publiéeNon applicable en tant que tel, c’est un composant, pas un modèle autonomeNon publié
Produit disponible aujourd’huiOui, à grande échelleOui, à grande échelleNonOui, intégré dans des modèles hybrides commerciauxNon
Support commercial ou SLAOuiOuiNon applicable, pas de produitOui, via les fournisseurs qui l’intègrentNon applicable, pas de produit

Sur Mamba, la bonne unité n’est pas un chiffre absolu mais une courbe : le coût de calcul croît linéairement avec la longueur du contexte, contre une croissance quadratique chez un Transformer classique, et la mémoire nécessaire à l’inférence reste constante plutôt que de croître avec le contexte [6]. Traduit en exemple mesuré et déployé, Jamba affiche un débit environ trois fois supérieur sur les contextes longs par rapport à un modèle Transformer de taille comparable, et le papier fondateur de Mamba annonçait un gain de débit de l’ordre de cinq fois à l’inférence [6], [7]. Ce gain n’est pas universel. Plusieurs études trouvent une utilisation du GPU (mesurée en MFU) inférieure à celle des Transformers optimisés, et une étude de reclassement de documents trouve même un débit d’entraînement inférieur pour Mamba sur cette tâche précise [13].

environ ×3
Débit de Jamba sur les contextes longs, par rapport à un modèle Transformer de taille comparable
de l'ordre de ×5
Gain de débit à l'inférence annoncé par le papier fondateur de Mamba

Gu et Dao (2023), arXiv:2312.00752 ; Lieber et al. (2024), Jamba. Ce gain n'est pas universel : plusieurs études trouvent une utilisation du GPU (MFU) inférieure à celle des Transformers optimisés, et une étude de reclassement de documents trouve même un débit d'entraînement inférieur pour Mamba sur cette tâche précise.

Sur JEPA, aucune donnée de consommation énergétique publique équivalente aux études indépendantes sur les LLM n’a été trouvée. V-JEPA 2, le modèle vidéo de Meta, compte 1,2 milliard de paramètres, entraîné sur plus d’un million d’heures de vidéo et un million d’images, avec seulement 62 heures de données robot nécessaires pour la phase de contrôle [9]. Une stratégie d’entraînement à résolution progressive a réduit le temps GPU utilisé d’un facteur 8,4 selon les auteurs, un gain d’efficience réel et chiffré, mais qui ne renseigne pas sur la consommation absolue. C’est un manque à signaler, pas à combler par une estimation fragile de plus.

> 1 million d'heures
Vidéo sur laquelle V-JEPA 2 a été entraîné
1 million d'images
Images utilisées en complément de la vidéo
62 heures
Données robot nécessaires pour la phase de contrôle
facteur 8,4
Réduction du temps GPU obtenue par une stratégie d'entraînement à résolution progressive, selon les auteurs

Assran et al. (2025), V-JEPA 2. Aucune donnée de consommation énergétique publique équivalente aux études indépendantes sur les LLM n'a été trouvée : le facteur 8,4 est un gain d'efficience réel et chiffré, il ne renseigne pas sur la consommation absolue.

Sur l’efficience : le TRM obtient 87,4 % sur Sudoku-Extreme pour moins de 500 dollars d’entraînement, contre 0 % pour les LLM testés sur la même tâche [1]. C’est un argument d’efficience pour une tâche étroite et déterministe, pas une mesure de ressource absolue généralisable à d’autres usages.

Ce qui est prouvé, ce qui est financé, ce qui reste à démontrer

Ce que les données établissent, état des lieux au 10 juillet 2026, un secteur qui évolue vite. Trois niveaux de preuve, pas un seul, coexistent sous le même récit “après les LLM”. Les deux horizons qu’aucune source ne date sont marqués comme tels plutôt que présentés comme des faits.

TechnologieValidation scientifiqueMaturité opérationnelleConviction économiqueAcheteur naturelHorizon
Mamba / hybridesSolide sur le mécanisme, littérature continue depuis 2023 [6] ; ampleur du gain encore débattue selon les tâches [13]Élevée : modèles hybrides en production (Jamba, IBM Granite 4.0) [7]Indirecte : portée par des éditeurs déjà financés, sans levée dédiée à l’architecture elle-mêmeFournisseurs IA, cloud, infrastructure, modèles à contexte longMaintenant
LLM de raisonnementFamille largement diffusée, dont le surcoût de calcul a été mesuré indépendamment [11]Élevée : produits commerciaux à grande échelleMaximale : cœur des investissements du secteurEntreprises, développeurs, agents, copilotesMaintenant
TRMScores publiés élevés [1], mécanisme fragilisé sur son prédécesseur [2] puis directement sur le TRM [3]Nulle : aucun produit à ce jourFaible : aucun financement dédié identifié, mais un courant de recherche actif [4]Recherche, laboratoires, bancs d’essai, IA embarquée spécialiséeEstimation, non sourcée : horizon de recherche, aucun calendrier produit annoncé à ce jour
JEPA / world modelsValidation expérimentale documentée : I-JEPA en apprentissage auto-supervisé d’images (2023), V-JEPA 2 en compréhension, prédiction et planification, avec contrôle robotique zero-shot (2025) [9]Faible : aucun produit commercial déployé à grande échelleMaximale : plus d’un milliard de dollars levés en amorçage [8], [10]Robotique, santé, industrie, simulationEstimation partiellement sourcée : “plusieurs années” selon le PDG d’AMI Labs lui-même [10], sans chiffre précis avancé

Lue ligne par ligne, cette matrice défait le raccourci le plus fréquent sur le sujet. JEPA n’est pas un pari sans preuve : il est expérimentalement démontré et non commercialisé, ce qui n’est pas la même faiblesse. Le TRM n’est pas un résultat faux : c’est un résultat publié dont l’explication est contestée et que personne ne vend. Et Mamba, le seul à être fort sur l’axe opérationnel, reste le moins spectaculaire des trois sur l’axe du financement. Un paradigme faible sur un axe n’est pas disqualifié, il est simplement à surveiller sur cet axe-là.

Mamba est le plus établi des trois : littérature académique continue depuis 2023, et surtout des modèles hybrides Mamba-Transformer déjà en production. Deux exemples sont disponibles aujourd’hui. Jamba (AI21 Labs) est le premier modèle hybride de qualité production. IBM Granite 4.0, lancé le 2 octobre 2025, est présenté par IBM comme une architecture hybride Mamba/Transformer [7]. Un troisième exemple, Codestral Mamba (Mistral, juillet 2024) pour le code, vaut comme jalon historique et non comme disponibilité actuelle : la documentation Mistral le donne retiré depuis le 6 juin 2025 et recommande Codestral pour les nouvelles intégrations [7]. Ce n’est plus une hypothèse de recherche, c’est un choix d’ingénierie déjà arbitré par plusieurs acteurs.

Le TRM est le plus jeune et le plus contesté. Le papier TRM lui-même [1] avance, sur le prédécesseur direct du modèle, le HRM, que le mécanisme mis en avant par la couverture médiatique, le raisonnement hiérarchique inspiré du cerveau, explique très peu du résultat : ce serait la supervision profonde, une technique d’entraînement, qui porterait l’essentiel du gain, la retirer faisant chuter la précision de 39 % à 19 %, vingt points, contre seulement 3,3 points (de 39,0 % à 35,7 %) quand c’est la récursion hiérarchique qui est retirée. Ce sont deux mesures distinctes, chacune isolant un seul composant à la fois, non une soustraction entre les deux plages, puisque les deux ablations partent du même modèle complet, autour de 39 % de précision, et y reviennent chacune à sa façon. Le papier TRM crédite ces quatre valeurs à une analyse de l’ARC Prize Foundation, mais le billet que la fondation a publié [2] porte d’autres chiffres et un autre découpage : il compare le HRM à un transformeur classique de taille équivalente, lequel arrive à environ 5 points du HRM sans la moindre optimisation d’hyperparamètres, et il désigne la boucle de raffinement externe, pas l’architecture à deux réseaux, comme le principal moteur de gain, puisque passer d’aucun raffinement à un seul raffinement fait gagner 13 points et que passer de 1 à 8 boucles double la performance sur le jeu d’évaluation public. Les deux documents vont dans le même sens sur la direction de l’effet, le récit hiérarchique explique peu du résultat, mais les quatre valeurs citées ici sont celles du papier TRM, pas celles de la fondation. Cette première analyse ne porte donc pas sur le TRM, mais sur ce qui l’a précédé. Une seconde analyse indépendante, datée de janvier 2026 [3], porte cette fois directement sur le TRM et conclut que son succès sur ARC-AGI-1 s’explique surtout par l’efficience de l’architecture, un conditionnement fort par identifiant de tâche, et un usage agressif de calcul au moment du test, plutôt que par un raisonnement interne profond. Aucune des deux n’est une réplication indépendante du résultat lui-même : ce sont des analyses de ce qui produit le résultat. Ce qui n’empêche pas le TRM d’avoir suscité un vrai courant de recherche actif : une dizaine de travaux de suivi sont parus depuis, dont un accepté à NeurIPS 2025 et deux présentés à des ateliers ICLR 2026 [4]. Un chiffre associé au papier mérite par ailleurs une correction : la couverture médiatique lui attribue une hausse de 10 % de la capitalisation de Samsung, environ 60 milliards de dollars, au moment de sa publication. Aucune source financière consultée ne corrobore ce lien ; la performance boursière de Samsung sur la période est attribuée de façon convergente par la presse financière au supercycle des puces mémoire porté par la demande d’infrastructure des LLM eux-mêmes [5], jamais au papier TRM.

Porte sur le prédécesseur HRM

Ablation sur le prédécesseur HRM, avancée par le papier TRM

  • Le mécanisme mis en avant par la couverture médiatique, le raisonnement hiérarchique inspiré du cerveau, expliquerait très peu du résultat
  • Ce serait la supervision profonde qui porterait l'essentiel du gain : la retirer coûterait vingt points de précision (de 39 % à 19 %), contre 3,3 points (de 39,0 % à 35,7 %) pour la récursion hiérarchique seule, les deux ablations partant du même modèle complet
  • Ces quatre valeurs sont celles du papier TRM, qui les crédite à l'ARC Prize Foundation ; le billet publié par la fondation porte d'autres mesures, un transformeur classique à environ 5 points du HRM et la boucle de raffinement externe comme principal moteur de gain
Porte directement sur le TRM

Seconde analyse indépendante, datée de janvier 2026

  • Conclut que son succès sur ARC-AGI-1 s'explique surtout par l'efficience de l'architecture, un conditionnement fort par identifiant de tâche et un usage agressif de calcul au moment du test
  • Plutôt que par un raisonnement interne profond
  • Aucune des deux analyses n'est une réplication indépendante du résultat lui-même : ce sont des analyses de ce qui produit le résultat

JEPA occupe une position à part : ni établi par le déploiement comme Mamba, ni jeune et contesté comme le TRM, mais porté par un pari financier d’une ampleur inédite. Yann Le Cun, quittant Meta le 19 novembre 2025 après douze ans à la tête de la FAIR [8], a fondé AMI Labs et levé 1,03 milliard de dollars en mars 2026, la plus grosse levée d’amorçage jamais réalisée par une entreprise européenne, avec Nvidia, Samsung, Bezos Expeditions, Temasek et Eric Schmidt au tour de table [8], [10]. Fei-Fei Li (World Labs, 1,23 milliard de dollars levés au total dont 1 milliard en février 2026 [15]) et Google DeepMind (Genie 3) occupent le même terrain : une catégorie entière s’est constituée en quelques mois. Ce financement ne se substitue pas à une preuve technique, et il ne faut pas non plus lire l’inverse : la validation expérimentale existe déjà. I-JEPA a produit dès 2023 des résultats sérieux en apprentissage auto-supervisé d’images, et V-JEPA 2 démontre en 2025 compréhension vidéo, prédiction et planification, jusqu’au contrôle zero-shot de bras robotisés Franka dans deux laboratoires distincts, avec manipulation d’objets sans entraînement spécifique [9]. Ce qui manque n’est donc pas la démonstration expérimentale, c’est le produit : à la date de rédaction, aucun de ces acteurs n’a livré de produit commercial validé à grande échelle. Le capital précède la commercialisation, ce qui n’invalide pas la thèse mais situe précisément où elle reste à prouver.

Extrapolation prudente, ce qui ferait basculer le diagnostic. Cette lecture est datée et faite pour être révisée. Trois signaux concrets feraient monter l’un ou l’autre paradigme d’un cran sur l’échelle de preuve. Pour le TRM, une réplication indépendante revue par les pairs qui confirmerait le résultat sans le réduire à un artefact d’entraînement le ferait passer de curiosité contestée à résultat consolidé. Pour JEPA, le premier produit commercial déployé à grande échelle, en robotique ou en santé, le ferait passer d’une validation de laboratoire à une technologie éprouvée en conditions réelles. Pour Mamba, une adoption dans un modèle grand public de premier plan, plutôt que dans des modèles hybrides encore de niche, confirmerait le passage du choix d’ingénierie spécialisé au standard par défaut. Aucun de ces trois signaux n’est acquis à la date de publication. Leur survenue, ou leur absence prolongée, est précisément ce qu’un lecteur décideur gagne à surveiller.

Application par profil de décision

ProfilCe qui mérite une action maintenantCe qui mérite une veille sans budgetPoint de vigilanceEnjeuRéversibilité
DSI ou CTO évaluant une infrastructure IAExiger des fournisseurs des métriques de coût, latence, mémoire et qualité sur ses propres longueurs de contexteTRM, faute de produit disponibleNe pas confondre le score publié du TRM avec le mécanisme censé l’expliquer, qui est contesté ; ne pas confondre non plus une architecture (Mamba) avec une performance mesuréeModéréRéversible
Investisseur exposé à un pari IADistinguer, dans tout dossier “après les LLM”, le niveau de preuve réel du narratif de levée de fondsJEPA en particulier, dont la valorisation précède la preuve de produitLe financement massif d’un pari n’est pas une validation empirique de sa thèseCritiqueIrréversible
Dirigeant cherchant à limiter l’empreinte énergétique de ses usages IAComparer le coût par requête des LLM de raisonnement (3,91 Wh médian) à celui des LLM standard (0,31 Wh médian) avant de généraliser un modèle de raisonnementLes paradigmes non encore déployés (TRM, JEPA), dont l’empreinte réelle en usage n’est pas mesurableUn facteur d’environ 13 existe déjà à l’intérieur de la seule famille LLM, avant toute comparaison de paradigmeModéréPartiellement réversible
Décideur exposé au récit médiatiqueAppliquer les mêmes trois questions à chaque nouveau paradigme annoncé : qu’est-ce qui est validé indépendamment, qu’est-ce qui est réellement déployé, qu’est-ce qui n’est encore que financéRien de spécifique, la vigilance elle-même est l’actionLe volume de couverture médiatique n’est pas corrélé au niveau de preuveFaibleRéversible

Lexique

LLM (Large Language Model) : modèle génératif entraîné à produire du texte token par token à partir de vastes corpus. LLM de raisonnement : sous-famille de LLM (o1, o3, DeepSeek-R1) utilisant un calcul de raisonnement étendu au moment de la réponse, au coût énergétique nettement supérieur. TRM (Tiny Recursive Model) : modèle supervisé de quelques millions de paramètres qui améliore une réponse par cycles de raffinement récursif plutôt que par génération séquentielle. HRM (Hierarchical Reasoning Model) : modèle prédécesseur direct du TRM, fondé sur une architecture à deux réseaux récursant à des fréquences différentes. Mamba / modèle à état sélectif (SSM) : architecture alternative au Transformer, à mémoire d’inférence constante et coût de calcul linéaire avec la longueur du contexte. JEPA (Joint Embedding Predictive Architecture) : cadre d’apprentissage qui prédit la représentation latente d’un état futur plutôt que ses pixels ou tokens. ARC-AGI : jeu de bancs d’essai de raisonnement géométrique conçu pour être facile pour un humain et difficile pour un modèle d’IA. Deep supervision (supervision profonde) : technique d’entraînement consistant à réviser une réponse à travers plusieurs étapes de supervision successives. Test-time compute (calcul au moment du test) : calcul supplémentaire mobilisé au moment de répondre plutôt que pendant l’entraînement. MFU (Model FLOPs Utilization) : mesure du taux d’utilisation réelle de la puissance de calcul théorique d’un GPU. FLOP : opération à virgule flottante, unité de mesure du volume de calcul requis par un modèle.


Jolicoeur-Martineau, A. (2025). « Less is More: Recursive Reasoning with Tiny Networks ». arXiv:2510.04871. https://arxiv.org/abs/2510.04871

ARC Prize Foundation (2025). « The Hidden Drivers of HRM’s Performance on ARC-AGI ».

Note technique (2026). « Tiny Recursive Models on ARC-AGI-1: Inductive Biases, Identity Conditioning, and Test-Time Compute ». arXiv:2512.11847. https://arxiv.org/abs/2512.11847

Travaux de suivi du TRM. Document principal : Mixture-of-Recursions (NeurIPS 2025). Autres travaux compilés à titre de faisceau, non exhaustif : Probabilistic TRM, Generative Recursive Reasoning Models et Unrolled Policy Iteration for Tiny Recursive Models (ateliers ICLR 2026).

Sur la capitalisation de Samsung Electronics, 2025-2026. La revue de presse financière est convergente sur l’attribution au supercycle mémoire ; aucun document primaire unique ne fait autorité, la mention vaut comme faisceau et non comme source isolée.

Gu, A., Dao, T. (2023). « Mamba: Linear-Time Sequence Modeling with Selective State Spaces ». arXiv:2312.00752. Et Dao, T., Gu, A. (2024). « Transformers are SSMs ». arXiv:2405.21060 (Mamba-2). https://arxiv.org/abs/2312.00752

Déploiements Mamba en production. Lieber et al. (2024), « Jamba: A Hybrid Transformer-Mamba Language Model » (AI21 Labs), premier modèle hybride Mamba-Transformer de qualité production ; IBM Granite 4.0 (IBM, octobre 2025), présenté par IBM comme une architecture hybride Mamba/Transformer ; Codestral Mamba (Mistral, juillet 2024), retiré du catalogue le 6 juin 2025 d’après la documentation Mistral, qui recommande Codestral pour les nouvelles intégrations.

TechCrunch (2026). « Yann LeCun’s AMI Labs raises $1.03B to build world models ». Sifted (2026). « Yann LeCun’s AMI Labs raises $1bn in Europe’s biggest seed round ».

Assran, M. et al. (2023, 2025). « I-JEPA » et « V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning ». Meta AI / AMI Labs.

TechCrunch (2026). Détails du tour de table AMI Labs et du partenariat Nabla.

Étude comparative de 30 LLM commerciaux, « How Hungry is AI? Benchmarking Energy, Water, and Carbon Footprint of LLM Inference ». arXiv:2505.09598 (2025). https://arxiv.org/abs/2505.09598

Patterson, D. et al. (2021). « Carbon Emissions and Large Neural Network Training ».

Étude de reclassement de documents comparant Mamba et Transformers. arXiv:2412.14354. https://arxiv.org/abs/2412.14354

Le Grand Continent (2025). Entretien avec Alexia Jolicoeur-Martineau, « Que sont les “TRM” ? Après les LLM, comprendre la future révolution de l’IA ».

Bloomberg (2026). « AI Pioneer Fei-Fei Li’s Startup World Labs Raises $1 Billion », 18 février 2026. https://www.bloomberg.com/news/articles/2026-02-18/ai-pioneer-fei-fei-li-s-startup-world-labs-raises-1-billion

Mes réserves

Ce qui invaliderait cette lecture

  • Je n'ai qu'un seul papier sur le TRM, non revu par les pairs, et son autrice appartient à Samsung. Cet intérêt institutionnel n'invalide pas le résultat, mais il doit être nommé plutôt que passé sous silence.
  • Les deux analyses indépendantes que je cite, l'une portant sur le prédécesseur HRM et l'autre sur le TRM lui-même, ne sont pas davantage revues par les pairs à ce jour. L'ARC Prize Foundation est un organisme indépendant, mais elle a son propre intérêt à la visibilité de son benchmark ARC-AGI.
  • Je n'ai aucune mesure énergétique directe de l'entraînement du TRM. Je m'en tiens donc au matériel et à la durée rapportés par le papier, sans les convertir en kWh : une telle conversion ignorerait l'utilisation réelle des GPU, le reste de la machine et le rendement du centre de données.
  • La validation expérimentale de JEPA est établie en laboratoire, sur des tâches et des plateformes robotiques choisies par ses auteurs. Rien ici ne dit comment ces résultats tiennent en production, ni comment ils passent à l'échelle commerciale.
  • Les gains de Mamba dépendent de la longueur du contexte et ne sont pas universels : des contre-exemples publiés donnent un débit d'entraînement inférieur à celui d'un Transformer sur certaines tâches.
  • JEPA est porté par un syndicat d'investisseurs dont plusieurs, Nvidia et Samsung notamment, ont un intérêt commercial direct à l'infrastructure que ce paradigme consommerait. Cela reste vrai que JEPA soit ou non le paradigme gagnant.
  • Deux des horizons de ma matrice de maturité ne s'appuient sur aucune source explicite. Ce sont des estimations de ma part, pas des calendriers annoncés, et je les réviserai dès qu'une donnée plus solide sera disponible.

Biais cognitifs que cette situation peut déclencher

  • Heuristique de disponibilité (Tversky et Kahneman, 1973) : la répétition médiatique d'un même récit « après les LLM » peut donner l'impression d'un niveau de preuve croissant, indépendamment de ce que les papiers démontrent réellement.
  • Biais d'ancrage (Tversky et Kahneman, 1974) : la première annonce spectaculaire, un petit modèle qui bat les LLM sur des puzzles, peut rester l'ancre mentale même après que deux analyses indépendantes en ont réduit la portée.
  • Effet de halo lié au financement, proche de l'argument d'autorité : un tour de table d'un milliard de dollars porté par des investisseurs reconnus peut se lire comme une validation de la thèse technique, alors qu'il mesure une conviction d'investisseurs et non un résultat démontré.

Indice de solidité des preuves · le détail

55 / 100 · Preuves limitées · fourchette 31-55 %

Score établi le 27 août 2026. Une révision ultérieure est une réévaluation datée, pas une correction masquée.

Type de preuve · 40 %Faisceau de sources primaires convergentes50
Convergence · 30 %Résultats mixtes25
Réplication · 20 %Répliquée indépendamment100
Effectif observé · 10 %Modérée (1 000 – 10 000)70
Ce que le champ n'a pas produit
  • Le résultat central du TRM serait ré-exécuté de bout en bout à partir du code, des poids et des graines publiés, par une équipe sans lien avec son autrice ni avec l'entreprise à laquelle elle appartient, avec plusieurs graines et un intervalle rapportés.Une équipe de réplication indépendante, du type ML Reproducibility Challenge · un dispositif approchant existe, sans remplir la condition
  • Les valeurs d'ablation sur le prédécesseur HRM, celles qui fondent ici l'affaiblissement du récit mécanistique, seraient publiées par l'ARC Prize Foundation elle-même sous une forme citable, plutôt que rapportées par le papier qui s'en prévaut.L'ARC Prize Foundation · un dispositif approchant existe, sans remplir la condition
  • Les gains de coût, de latence et de mémoire attribués à Mamba seraient mesurés à budget de calcul égal et sur des longueurs de contexte déclarées, par une équipe sans lien avec ses auteurs ni avec les fournisseurs qui l'embarquent en production.Une équipe académique d'évaluation sans intérêt dans l'architecture ni dans les modèles qui l'intègrent · un dispositif approchant existe, sans remplir la condition
  • Les résultats de compréhension, de prédiction et de planification de V-JEPA 2 seraient ré-exécutés à partir des artefacts publiés, sur des tâches et des plateformes robotiques choisies par une équipe sans intérêt dans le paradigme, plutôt que sur celles retenues par ses auteurs.Une équipe de robotique académique sans lien avec Meta ni AMI Labs · un dispositif approchant existe, sans remplir la condition

Ce dispositif porterait l'indice à 63 sur 100, dans le palier « Preuves modérées ». Les trois autres axes restent à leur valeur actuelle : un dispositif ne fait monter ni la convergence d'une littérature ni sa réplication.

Bibliographie
Sur la capitalisation de Samsung Electronics, 2025-2026. Revue de presse financière convergente sur l'attribution au supercycle mémoire ; faisceau plutôt que source isolée.
Modification apportée · mis à jour le 4 septembre 2026
  • Les deux chutes de précision de l'étude d'ablation sur le prédécesseur HRM (supervision profonde : -20 points ; récursion hiérarchique : -3,3 points) étaient présentées comme deux plages à comparer l'une à l'autre. Ce sont deux mesures distinctes, chacune isolant un seul composant à partir du même modèle complet à environ 39 % de précision : la seconde n'est pas « l'apport isolé » de la récursion hiérarchique par soustraction, c'est une chute propre à son propre retrait.
  • Ma grille Déployé / Contesté / Financé mélangeait trois questions qui ne s'excluent pas. Elle devient une matrice à trois axes indépendants : validation scientifique, maturité opérationnelle, conviction économique.
  • JEPA passe de « financé sans preuve » à « validé expérimentalement, non commercialisé » : I-JEPA et V-JEPA 2 ont une validation expérimentale documentée.
Voir les 9 autres
  • Le résultat brut du TRM n'est plus donné pour « non contesté » ni « reproductible ». Une publication dans le papier d'origine n'est pas une reproduction indépendante.
  • L'analyse portant sur le prédécesseur HRM et celle portant sur le TRM sont deux fragilisations successives, pas deux réplications du TRM.
  • IBM Granite 4.0 est daté de 2025. Codestral Mamba redevient un déploiement historique : il a été retiré du catalogue Mistral le 6 juin 2025.
  • L'estimation énergétique du TRM en kWh est retirée au profit du matériel et de la durée réellement publiés.
  • « Calcul réellement mobilisé par requête » devient « paramètres activés par token », qui est ce que la source mesure.
  • Mes recommandations d'achat sont reformulées en coût, latence, mémoire et qualité plutôt qu'en choix d'architecture, et « ignorez JEPA sinon » devient une veille légère.
  • Huit citations de la bibliographie qui n'avaient pas d'adresse en reçoivent une, après vérification que le document ouvert correspond bien aux auteurs, à l'année et au titre cités. Une neuvième, sur la capitalisation de Samsung Electronics, reste volontairement sans adresse unique : elle désigne un ensemble d'articles de presse financière convergents, pas un document identifiable.
  • Les quatre valeurs d'ablation sur le prédécesseur HRM (19 %, 39 %, 35,7 % et 39,0 %) étaient attribuées au billet de l'ARC Prize Foundation. Elles viennent du papier TRM, qui les crédite à la fondation, et c'est ainsi qu'elles sont désormais présentées. Le billet que la fondation a publié porte d'autres mesures, que je cite maintenant à leur place : un transformeur classique de taille équivalente arrive à environ 5 points du HRM sans optimisation d'hyperparamètres, et c'est le nombre de boucles de raffinement externe qui pèse sur la performance, pas l'architecture à deux réseaux.
  • Deux phrases qui annonçaient un compte (« deux exemples », « deux plages ») puis énuméraient un troisième élément à cause d'un chiffre décimal dans le texte sont reformulées sans changer les faits qu'elles rapportent.
LinkedIn
Axel Morel

Axel Morel · Fondateur & analyste, Probans

Développe une méthode d'analyse destinée à distinguer ce que les preuves établissent, ce qu'elles suggèrent et ce qu'elles ne permettent pas de conclure, puis à traduire cette distinction en décisions professionnelles.

Choix du sujet, direction de la rédaction, validation ou modification des sources, validation et retravail du texte et des illustrations : Axel Morel. Rédaction, choix des sources initiales et plan de rédaction initial : assistance IA.

Responsabilité éditoriale : Axel Morel. Recherche et rédaction assistées par IA selon la méthodologie Probans, sources vérifiées avant publication. Charte éditoriale.

En savoir plus

Newsletter Probans

Recevoir les prochaines analyses

Choix par catégorie · Sans spam · Désabonnement en 1 clic

Fait partie du dossier

Comprendre les modèles post-LLM · 21 articles courts, axe par axe

Voir le dossier →

À lire ensuite

Newsletter

Recevoir les prochaines analyses

Choisissez les catégories qui vous intéressent.

Catégories