Article courtRaisonnement récursif · 15 juillet 2026 · mis à jour le 4 septembre 2026

Le TRM atteint 87,4 % sur Sudoku-Extreme, et 0 % sur les labyrinthes

Axel MorelAxel Morel · Fondateur & analyste, Probans
Je dispose de

L'essentiel

Sur un Sudoku difficile, un modèle de quelques millions de paramètres atteint 87,4 % là où les LLM testés obtiennent 0 %, pour quelques dizaines d'heures de calcul sur un unique GPU ; mais sur ARC-AGI, deux analyses indépendantes contestent le récit d'un raisonnement inspiré du cerveau.

  1. Le chiffre tient, avec une réserve. 87,4 % de précision sur Sudoku-Extreme pour la variante spécialisée du TRM, qui tombe à 0 % sur les labyrinthes (Maze-Hard), un banc voisin du même papier, contre 55,0 % pour le HRM et 0 % pour les LLM testés : ces chiffres bruts n'ont, à ce jour, pas été remis en cause, mais ce ne sont pas des régimes d'évaluation comparables.
  2. L'explication d'origine, elle, ne tient plus. Le récit d'un raisonnement hiérarchique inspiré du cerveau a été affaibli deux fois par des analyses indépendantes, qui pointent plutôt une technique d'entraînement (supervision profonde) et un usage massif de calcul au moment de répondre.
  3. Ça ne fait pas du TRM un concurrent des LLM. C'est un modèle supervisé, entraîné en quelques dizaines d'heures de calcul sur du matériel modeste, réservé à des tâches fermées, déterministes et dont il a vu l'identifiant à l'entraînement : un argument d'efficience ciblée, pas de substitution.

Un modèle de quelques millions de paramètres, entraîné en quelques dizaines d’heures de calcul sur un unique GPU, obtient un score bien supérieur à celui de grands modèles de langage à cent milliards de paramètres et plus sur un jeu de Sudoku particulièrement difficile, même si la comparaison mélange deux régimes d’évaluation différents (voir plus loin). Ce résultat brut est réel et publié. Ce qui l’explique, en revanche, ne fait plus consensus depuis que deux analyses indépendantes s’y sont penchées. Comprendre cette nuance change ce qu’on peut raisonnablement attendre du TRM (Tiny Recursive Model).

Ce que le TRM fait, concrètement

Ce que les données établissent. Le TRM a été proposé en 2025 par Alexia Jolicoeur-Martineau, chercheuse chez Samsung SAIL (Montréal), dans un article intitulé « Less is More: Recursive Reasoning with Tiny Networks ». Le TRM part d’une réponse initiale, souvent grossière, et la révise par cycles successifs (jusqu’à seize fois) avant de livrer une version finale d’un bloc, à l’inverse d’un LLM classique qui génère l’essentiel de sa réponse en une seule passe, token après token. C’est un raffinement récursif d’un brouillon, pas une génération séquentielle mot par mot.

Le résultat qui n’est pas contesté

Ce que les données établissent. Sur Sudoku-Extreme, un jeu de grilles conçues pour être difficiles, la variante du TRM sans self-attention (TRM-MLP) atteint 87,4 % de précision ; la variante à self-attention, qui généralise mieux, plafonne à 74,7 % sur ce même banc. Son prédécesseur direct, le HRM (Hierarchical Reasoning Model), plafonne à 55,0 %. Les grands modèles de langage testés (Deepseek R1, Claude 3.7, o3-mini-high) obtiennent 0 %. Ces chiffres viennent du papier original et n’ont, à ce jour, pas été remis en cause. La variante TRM-MLP, en revanche, échoue totalement (0 %) sur Maze-Hard, un banc de labyrinthes du même papier : sa performance ne généralise pas au-delà du Sudoku, ce que le chiffre isolé de 87,4 % ne montre pas.

Comparaison de la précision sur Sudoku-Extreme : TRM (variante MLP) 87,4 %, HRM 55,0 %, LLM testés 0 %.

Ce qui, en revanche, est contesté

Ce que les données établissent. Ce qui divise, sur ARC-AGI, ce n’est pas le résultat, c’est son explication. La couverture médiatique du TRM et de son prédécesseur a mis en avant l’idée d’un raisonnement hiérarchique inspiré du fonctionnement du cerveau. VentureBeat, par exemple, documente le chiffre (un modèle jusqu’à 10 000 fois plus petit qui égale des modèles bien plus gros sur des tâches spécifiques) et rapporte, selon une lecture indirecte, l’accès direct à l’article ayant été bloqué au moment de la relecture, que Jolicoeur-Martineau elle-même juge inutilement compliqué le cadre biologique et hiérarchique de son prédécesseur, le HRM, ce qui a motivé la simplification vers le TRM. Deux analyses indépendantes viennent nuancer fortement le récit d’un raisonnement inspiré du cerveau.

La première nuance vient d’une analyse d’ablation que le papier TRM lui-même attribue à l’ARC Prize Foundation, sur le HRM. Selon ce compte-rendu, ajouter la seule supervision profonde (une technique d’entraînement) à un modèle de référence fait passer le score de 19 % à 39 %, un gain net d’environ 20 points. Ajouter par-dessus la récursion hiérarchique elle-même, sur un autre modèle de référence à passe unique, ne fait passer le score que de 35,7 % à 39,0 %, un gain d’environ 3 points : deux écarts distincts, pas deux plages qui se recoupent. L’apport propre de la récursion hiérarchique paraît donc nettement plus faible que celui de la supervision profonde. Ces quatre chiffres précis, je ne les ai pas retrouvés tels quels dans le texte que l’ARC Prize Foundation a publié elle-même sur son propre site : je ne les tiens que du compte-rendu qu’en fait le papier TRM, pas d’une lecture directe et confirmée à la source. La seconde analyse, une note technique publiée en décembre 2025 (révisée en janvier 2026) et portant cette fois directement sur le TRM, conclut, sur le seul checkpoint public qu’elle a testé (profondeur de récursion 4, contre 6 pour la configuration la plus performante du papier d’origine, et 40,00 % sur ARC-AGI-1 contre 44,6 % pour cette configuration d’origine), que la performance de cette instance particulière tient surtout à l’efficience de son architecture, à un conditionnement fort par identifiant de tâche, et à un usage massif de calcul au moment de répondre, pas à un raisonnement interne profond. La note ne réconcilie jamais ses 40,00 % avec les 44,6 % du papier d’origine : ses conclusions valent pour ce checkpoint précis, pas pour toutes les configurations possibles du TRM.

Ce que la méthode interprète. Ce n’est pas une invalidation du TRM, c’est un déplacement de l’explication. « Un tout petit modèle qui raisonne comme un cerveau » est une histoire plus vendable que « une architecture bien conçue, combinée à beaucoup de calcul mobilisé au bon moment ». La seconde version est moins spectaculaire, mais elle correspond mieux à ce que les deux analyses indépendantes montrent. Ce déplacement a un nom utile au-delà du TRM : un résultat orphelin. Le test tient en deux questions. Le chiffre brut a-t-il survécu à un examen indépendant ? Ici, oui : 87,4 % reste vrai. L’explication causale d’origine a-t-elle, elle aussi, survécu à une étude d’ablation indépendante ? Ici, non : le récit du raisonnement hiérarchique a été affaibli deux fois, d’abord par l’étude d’ablation de l’ARC Prize Foundation sur le HRM, ensuite par la note technique de janvier 2026 sur le TRM lui-même, toutes deux sur ARC-AGI. Un résultat qui répond oui puis non à ces deux questions est un résultat orphelin : un fait qui tient, privé du mécanisme qu’on lui avait attribué. Les deux questions ne portent pas sur le même chiffre : la première, sur le chiffre brut, porte sur 87,4 % en Sudoku-Extreme ; la seconde, sur l’explication, porte sur les scores ARC-AGI (44,6 % puis 40,00 %) que les deux études d’ablation ont directement testés. C’est la direction de l’explication qui se transpose d’un banc à l’autre, pas le chiffre lui-même. Ce n’est pas la même chose qu’un simple rappel que « corrélation n’est pas causalité » : ce dernier doute d’un lien qui n’a jamais été établi, alors qu’un résultat orphelin a bien eu une explication causale publiée, défendue, puis démontée pièce par pièce par une étude d’ablation indépendante qui isole chaque composant. Ce test se transpose à tout papier de recherche IA au récit spectaculaire, pas seulement au TRM.

Un coût d’entraînement dérisoire

Ce que les données établissent. Là où l’entraînement d’un grand modèle de langage nécessite des clusters de calcul considérables, celui du TRM tient sur du matériel modeste et des durées courtes : un GPU L40S pendant moins de 36 heures pour le Sudoku, quatre L40S pendant moins de 24 heures pour les labyrinthes, quatre GPU H100 pendant environ trois jours pour ARC-AGI. Le papier original ne donne aucun coût en dollars, seulement ces durées de calcul ; je ne les convertis pas moi-même en un montant, faute de connaître le tarif horaire exact retenu par l’autrice. Cet écart de matériel et de temps de calcul, plus que la performance brute prise isolément, est ce qui rend le TRM intéressant à suivre.

Ce que le TRM n’est pas

Ce que les données établissent. Le TRM n’est pas un concurrent généraliste des LLM. C’est un modèle supervisé, à réponse déterministe : il ne rédige pas de texte libre, il résout une tâche fermée à la fois : un Sudoku, un labyrinthe, une grille ARC-AGI. À ma connaissance, aucun produit commercial ne l’utilise à ce jour, et aucune source ne date un horizon de mise en production.

Ce que la méthode interprète. Le TRM ne remplace rien dans l’usage quotidien d’un LLM. Il illustre plutôt qu’une tâche étroite et bien définie peut se traiter avec une architecture spécialisée, minuscule et bon marché, plutôt qu’avec un modèle généraliste à cent milliards de paramètres. C’est un argument d’efficience ciblée sur un problème fermé, pas un argument de substitution. Cette approche suppose en outre que le modèle ait déjà vu, à l’entraînement, l’identifiant de la tâche à laquelle il est appliqué : sans cet identifiant, il ne sait pas quoi faire de l’entrée, une limite structurelle qui restreint son usage aux tâches déjà identifiées d’avance, pas seulement aux tâches fermées et déterministes en général. Pour un dirigeant qui évalue où mettre un budget IA : si un problème interne se laisse formuler comme une tâche fermée, déterministe, à réponse vérifiable et connue d’avance (un contrôle de cohérence, une validation de règles, un jeu de contraintes récurrent), c’est une catégorie à surveiller avant d’y allouer par défaut un LLM généraliste coûteux ; si le problème reste ouvert, ou porte sur des cas nouveaux non vus à l’entraînement, cette piste ne s’applique pas.

Un chiffre à corriger : le lien avec Samsung

Ce que je n’ai pas pu vérifier à la source. Une partie de la couverture médiatique a attribué au papier TRM une hausse de 10 % de la capitalisation boursière de Samsung, environ 60 milliards de dollars, au moment de sa publication. Je n’ai identifié aucune source financière primaire qui corrobore ce lien causal direct, ni même une source, primaire ou secondaire, qui atteste l’existence de cette couverture médiatique elle-même. L’explication la plus reprise pour cette période attribue plutôt la performance boursière de Samsung au supercycle des puces mémoire, porté par la demande d’infrastructure des LLM eux-mêmes, pas à un article de recherche sur un modèle de quelques millions de paramètres. Ni le lien causal d’origine, ni cette explication alternative, ne sont ici adossés à une source financière primaire précise : les deux se lisent comme les deux versions du récit qui circulent, pas comme un fait vérifié dans un sens ou dans l’autre.

Le TRM gagne sur des puzzles fermés, pour quelques dizaines d’heures de calcul sur un unique GPU. Ce qui reste flou, c’est pourquoi il gagne, pas s’il gagne.

Mes réserves

  • Le TRM repose sur un seul papier, non revu par les pairs à ce jour. Les deux analyses qui le nuancent sont elles-mêmes indépendantes mais récentes : le débat scientifique sur les mécanismes réels du modèle n’est pas clos.
  • L’association médiatique entre le papier TRM et la hausse boursière de Samsung a été largement reprise, sans qu’aucune source financière primaire ne la corrobore ni ne la démente (voir plus haut).
  • Le TRM traite uniquement des tâches fermées et déterministes, dont il a vu l’identifiant à l’entraînement. Rien dans les données actuelles ne permet d’anticiper si cette approche s’étendra à des problèmes plus ouverts ou à des cas nouveaux : ce serait une extrapolation, pas un fait établi.
  • Les quatre chiffres de l’étude d’ablation sur le HRM (19 %, 39 %, 35,7 %, 39,0 %) me viennent du compte-rendu qu’en fait le papier TRM, pas d’une lecture directe et confirmée dans le texte que l’ARC Prize Foundation a publié elle-même : je n’ai pas pu retrouver ces chiffres tels quels à leur source, même si la direction de l’effet qu’ils décrivent (la supervision profonde explique plus que la récursion hiérarchique) n’est pas contredite par ailleurs.
  • L’ARC Prize Foundation, dont l’analyse est citée à l’appui de ce texte, conçoit et exploite elle-même le banc ARC-AGI dont elle discute la pertinence pour un modèle concurrent (le HRM) : un intérêt institutionnel à documenter, même si son analyse va ici à l’encontre du récit qui aurait le plus servi la visibilité du HRM.
  • Ma citation de VentureBeat s’appuie sur une lecture indirecte : l’accès direct à l’article était bloqué par une vérification anti-robot au moment de la relecture, et le contenu que j’en rapporte n’est pas un verbatim confirmé caractère pour caractère.
  • Sur le banc ARC-AGI, dont je discute la progression du TRM par rapport au HRM, deux configurations Grok-4 (Grok-4-thinking et Bespoke Grok-4, citées dans le même tableau du papier original) obtiennent des scores nettement supérieurs à ceux du TRM sur ARC-AGI-1 et ARC-AGI-2. Ce texte ne compare le TRM aux LLM que sur Sudoku-Extreme, où le 0 % des LLM testés est exact ; je le précise ici pour qu’un lecteur qui ne retiendrait que le volet ARC-AGI ne conclue pas à tort à une supériorité générale du TRM sur les LLM de raisonnement les plus récents.

Le TRM mérite d’être suivi comme un vrai courant de recherche actif (Mixture-of-Recursions, un travail proche, a été accepté à NeurIPS 2025 ; d’autres travaux de suivi sur les architectures récursives de petite taille sont présentés à un atelier ICLR 2026 dédié à l’auto-amélioration récursive), mais pas budgété comme un produit, faute d’en exister un à ce jour.

Retour au dossier Comprendre les modèles post-LLM. Voir aussi Qu’est-ce que Mamba ? et Qu’est-ce que JEPA ?.

Voir l’analyse complète : après les LLM, ce que TRM, Mamba et JEPA prouvent vraiment

ISP-IA
31/100

L'Indice de solidité des preuves évalue la base empirique de cette analyse sur quatre critères pondérés : type de preuve (40 %), convergence (30 %), réplication (20 %), puissance (10 %). L'axe type de preuve est calibré par champ : 100 y désigne le meilleur dispositif que l'échelle ISP-IA sache produire, et non une preuve absolue.

Type de preuve · 40 %
Faisceau de sources primaires convergentes
Convergence · 30 %
Résultats mixtes

Le chiffre central de cette pièce (87,4 % sur Sudoku-Extreme) vient exclusivement du papier TRM, publié par l'autrice du modèle qu'il évalue : une source de tier P, ce qui plafonne cette pièce au barreau médian quel que soit le soin de sa démonstration, la règle que l'échelle ISP-IA désigne comme la plus structurante du domaine. La convergence est notée mixte plutôt que modérée : l'analyse d'ablation de l'ARC Prize Foundation, citée à l'appui de la thèse centrale (la récursion hiérarchique explique peu le gain, la supervision profonde explique beaucoup), pourrait aller dans un sens qualitativement proche, bien que les deux documents ne découpent pas la causalité de la même façon (architecture hiérarchique contre transformeur classique d'un côté, supervision profonde contre récursion de l'autre) ; les quatre chiffres précis que le papier TRM lui attribue (19 %, 39 %, 35,7 %, 39,0 %) ne se retrouvent pas, tels quels, dans le texte que l'ARC Prize Foundation a publié elle-même sur son propre site : la convergence porte sur la direction de l'effet, pas sur les chiffres qui le mesurent. Aucune réplication indépendante du chiffre central (87,4 % sur Sudoku-Extreme) n'a été trouvée à ce jour (papier non revu par les pairs) : une note technique indépendante (arXiv:2512.11847) a bien mesuré, par ablation, une configuration distincte du TRM sur un banc différent (ARC-AGI-1, profondeur de récursion 4), mais sans reproduire ni réconcilier son résultat avec celui du papier d'origine, donc sans valoir réplication du chiffre central. L'échantillon reste celui d'un seul papier, sans exécutions multiples ni intervalle rapportés pour le chiffre central.

Réplication · 20 %
Pas de réplication connue
Effectif observé · 10 %
Très petite (< 100)
Ce que le champ n'a pas produit
  • Le score de 87,4 % sur Sudoku-Extreme serait ré-exécuté de bout en bout à partir du code et des graines publiés, par une équipe sans lien avec l'autrice du modèle, avec plusieurs graines et un intervalle rapportés.Une équipe de réplication indépendante, du type ML Reproducibility Challenge · personne ne l’a produit
  • Une ablation indépendante isolerait, sur le banc qui porte le chiffre central et non sur un banc voisin, la part attribuable à la récursion et celle attribuable à la supervision profonde.Les auteurs de la note technique arXiv:2512.11847, ou toute équipe sans lien avec l'autrice · un dispositif approchant existe, sans remplir la condition
  • Les quatre valeurs d'ablation attribuées à l'ARC Prize Foundation, 19 %, 39 %, 35,7 % et 39,0 %, seraient publiées par la fondation elle-même sous une forme citable, plutôt que rapportées par le papier qui s'en prévaut.L'ARC Prize Foundation · un dispositif approchant existe, sans remplir la condition
  • Les scores des modèles de langage comparés au TRM seraient remesurés sous un régime d'entraînement comparable au sien, de sorte que la comparaison porte sur deux dispositifs de même nature et non sur une évaluation sans entraînement dédié à la tâche.Une équipe d'évaluation sans intérêt dans l'un ou l'autre des modèles comparés · personne ne l’a produit

Ce dispositif porterait l'indice à 39 sur 100, dans le palier « Preuves limitées ». Les trois autres axes restent à leur valeur actuelle : un dispositif ne fait monter ni la convergence d'une littérature ni sa réplication.

Score de 31/100 (31-55 %) établi le 4 septembre 2026.

SOURCE
SOURCE
VentureBeat (2025). Samsung AI researcher's new, open reasoning model TRM outperforms models 10,000X larger, on specific problems. Rapporte que l'autrice du TRM juge inutilement compliqué le cadre biologique et hiérarchique de son prédécesseur, le HRM.SAccès direct bloqué par une vérification anti-robot au moment de la relecture : cette citation s'appuie sur une lecture indirecte, pas sur un verbatim confirmé caractère pour caractère.

I source primaire indépendante · S secondaire spécialisée · P partie prenante ayant un intérêt commercial sur le sujet traité.

Lexique

LLM· Grand modèle de langage
Modèle d'intelligence artificielle entraîné sur de vastes corpus de texte pour prédire et générer du langage, capable de tâches d'analyse, de synthèse et de génération de texte en langage naturel sans avoir été explicitement programmé pour la tâche demandée.
Modification apportée · mis à jour le 4 septembre 2026

J'ai ajouté une liste « L'essentiel en 3 points » et un cadre qui m'est propre, le test du « résultat orphelin » : deux questions pour distinguer la robustesse d'un résultat de celle de son explication. J'ai corrigé une affirmation non sourcée sur la capitalisation boursière de Samsung, désormais signalée comme non vérifiable dans les deux sens, sourcé les travaux de suivi (Mixture-of-Recursions, NeurIPS 2025 ; atelier ICLR 2026) et ajouté une ligne de décision pour un dirigeant qui évalue un budget IA. J'ai repris ce texte une deuxième fois. J'ai retiré le chiffre de « moins de 500 dollars » d'entraînement, que je n'ai retrouvé dans aucune de mes sources : je ne garde que les heures de calcul, qui elles sont sourcées. J'ai précisé que le 87,4 % de Sudoku-Extreme est le score d'une variante spécialisée du TRM, qui échoue totalement sur les labyrinthes d'un banc voisin du même papier, et que les 0 % obtenus par les LLM testés viennent d'une évaluation sans entraînement dédié à la tâche, pas d'un régime comparable à celui du TRM. J'ai reformulé l'étude d'ablation sur le HRM : les quatre chiffres cités (19 %, 39 %, 35,7 %, 39,0 %) viennent du compte-rendu qu'en fait le papier TRM, et je ne les ai pas retrouvés tels quels dans le texte que l'ARC Prize Foundation a publié elle-même, ce que je dis maintenant explicitement. J'ai corrigé ma description de l'article VentureBeat, qui rapporte en réalité que l'autrice du TRM juge trop compliqué le cadre biologique de son prédécesseur, plutôt que de se contenter de relayer le chiffre sans le questionner. J'ai ajouté la condition que le modèle doit avoir vu l'identifiant d'une tâche à l'entraînement pour pouvoir la traiter, une limite que j'avais omise dans ma recommandation à un dirigeant. J'ai repris ce texte une troisième fois : je mélangeais deux bancs distincts dans mon sous-titre, mon résumé et mon interprétation. Le chiffre de 87,4 % est mesuré sur Sudoku-Extreme ; le doute sur l'explication hiérarchique, lui, vient de deux études d'ablation qui ne portent que sur ARC-AGI, et je le dis maintenant explicitement partout où les deux se côtoyaient. J'ai aussi retiré une précision non sourcée sur le protocole d'évaluation des LLM testés (je ne garde que le chiffre, pas la manière dont il a été obtenu), marqué ma citation de VentureBeat comme une lecture indirecte au point même où je la cite, et nuancé une phrase qui affirmait sans réserve qu'aucun produit commercial n'utilise le TRM. J'ai ajouté deux encadrés « En clair » : l'un sur le raffinement d'un brouillon par cycles successifs, l'autre sur ce que mesure une étude d'ablation.

Axel Morel
Axel Morel
Fondateur & analyste · Probans

Développe une méthode d'analyse destinée à distinguer ce que les preuves établissent, ce qu'elles suggèrent et ce qu'elles ne permettent pas de conclure, puis à traduire cette distinction en décisions professionnelles.

Choix du sujet, direction de la rédaction, validation ou modification des sources, validation et retravail du texte et des illustrations : Axel Morel. Rédaction, choix des sources initiales et plan de rédaction initial : assistance IA.

Responsabilité éditoriale : Axel Morel. Recherche et rédaction assistées par IA selon la méthodologie Probans, sources vérifiées avant publication. Charte éditoriale.

En savoir plus

Newsletter

Recevoir les prochaines analyses

Choisissez les catégories qui vous intéressent.

Catégories