Article courtMéthode de lecture · 11 juillet 2026 · mis à jour le 13 août 2026

Comment lire un préprint non revu par les pairs sans se faire avoir

Axel MorelAxel Morel · Fondateur & analyste, Probans
Je dispose de

L'essentiel

Un résultat spectaculaire publié sur arXiv n'a pas encore été vérifié par d'autres chercheurs du domaine. Trois réflexes de lecture et une mise en garde contre le biais de disponibilité, illustrés par le cas du TRM, permettent de juger ce type de papier sans attendre ni le rejeter par principe.

Selon un préprint publié sur arXiv (arXiv:2510.04871), non encore relu par les pairs, un modèle de 5 à 7 millions de paramètres obtiendrait de meilleurs scores que la plupart des LLM testés, dont Deepseek R1 (671 milliards de paramètres), sur des bancs d’essai de puzzles, pour un coût d’entraînement documenté en heures de calcul GPU (environ trois jours sur quatre GPU H100 pour ARC-AGI), pas en dollars : le TRM (Tiny Recursive Model), présenté sur ce site dans une fiche dédiée, a circulé sous une forme plus condensée et moins précise. Un an, cinq ans, un domaine différent : la grille de lecture qui suit reste la même. Elle s’applique moins au TRM lui-même qu’à n’importe quel préprint spectaculaire à venir.

Ce qu’est un préprint, et ce que ça ne veut pas dire

Ce que les données établissent. Un préprint est un article publié avant, ou sans jamais passer par, une relecture indépendante par d’autres chercheurs du domaine, la peer review. Sur arXiv, plateforme où le papier TRM est déposé, la mise en ligne ne suppose aucune validation externe de la méthode : l’auteur dépose son travail, il devient immédiatement lisible par tous, sans qu’un comité de pairs n’ait vérifié les calculs, les protocoles ou les comparaisons. Geste gratuit et vérifiable en un clic : regarder le numéro de version affiché sur la page (v1, v2…) et comparer les versions successives, puisqu’un préprint peut être corrigé ou nuancé sans jamais quitter la plateforme.

Ça ne veut pas dire que le résultat est faux. Beaucoup de préprints se confirment ensuite tels quels. Ça veut dire qu’au moment de la lecture, aucun tiers n’a encore vérifié la méthode avant publication : la vérification, si elle vient, viendra après coup, publiquement, et pas toujours dans le sens attendu par l’auteur.

Ce que la méta-science dit du risque réel

Ce que les données établissent. Ces trois réflexes ne sont pas une prudence arbitraire : la discipline qui étudie la fiabilité de la recherche elle-même, la méta-science, chiffre le risque qu’ils cherchent à couvrir. Deux résultats bornent le problème. D’un côté, la mécanique documentée par Ioannidis dès 2005 dans Why Most Published Research Findings Are False : dans un domaine où les échantillons sont petits, les effets mesurés faibles et les tests statistiques nombreux et flexibles, la probabilité qu’un résultat publié soit un faux positif augmente, indépendamment de toute mauvaise foi de l’auteur. Ses six facteurs de risque (petite taille d’échantillon, petite taille d’effet, grand nombre de relations testées, grande flexibilité analytique, intérêts en jeu, champ compétitif) portent sur les propriétés d’une étude, pas sur son statut de relecture par les pairs : sa démonstration porte d’ailleurs sur des résultats déjà relus par les pairs, et pourtant en bonne partie invalidés selon lui.

De l’autre côté, une mesure directe et récente sur des préprints, pas seulement des articles publiés : une étude parue dans Nature Human Behaviour fin 2024, menée par Alexandru Marcoci et plus de cinquante coauteurs sur la plateforme repliCATS, a fait rejouer 29 réplications à haute puissance statistique à partir de 100 affirmations extraites de préprints publiés pendant la pandémie de Covid-19, en sciences sociales et comportementales. Résultat, sur ce même échantillon de préprints Covid-19 en sciences sociales et comportementales : 65,4 % de ces affirmations se sont répliquées (19 sur 29), une affirmation sur trois environ qui ne survit pas à une réplication sérieuse dans ce corpus précis. Plus révélateur encore pour ce dossier : la même étude a demandé à des chercheurs expérimentés et à des débutants de prédire, avant réplication, quelles affirmations tiendraient. Sur ce petit échantillon, les débutants ont classé correctement 69 % des affirmations, contre 61 % pour les chercheurs expérimentés : sur cette mesure et dans ce même corpus, l’expertise du domaine ne prédit pas mieux la réplication, elle prédit moins bien que l’inexpérience, un écart que les auteurs ne présentent pas comme statistiquement tranché, mais qui va dans le sens opposé de l’intuition selon laquelle un chercheur aguerri jugerait mieux qu’un débutant.

Mon interprétation. Un préprint n’a par construction subi aucune des étapes de relecture externe qu’ajoute la publication en revue, mais Ioannidis ne dit pas qu’un préprint serait, de ce seul fait, plus exposé que ce qu’il décrit : ses six facteurs s’appliquent aussi bien à un article déjà publié, et sa démonstration retire même à la peer review le statut de filtre protecteur qu’on pourrait lui prêter. Le résultat de Marcoci et al. vient par ailleurs d’un domaine différent (préprints Covid-19 en sciences sociales et comportementales) et ne démontre donc rien, à lui seul, pour la lecture des préprints d’intelligence artificielle. Il nourrit tout de même l’intuition qui justifie une grille structurée plutôt qu’un simple “instinct de chercheur” : si, sur cet échantillon, les chercheurs expérimentés prédisent moins bien la réplication des affirmations testées que des débutants sans expertise du domaine, l’expertise seule n’est pas le filtre fiable qu’on lui prête spontanément, et un jugement fondé sur l’autorité perçue de qui l’énonce (“ça m’a l’air solide, je suis expert”) peut être trompeur. Les trois réflexes qui suivent ne prétendent pas battre ce résultat de façon démontrée ; ils déplacent le jugement du “ça m’a l’air solide” vers des questions vérifiables une par une (le chiffre brut est-il distinct de son explication, existe-t-il une réplication et par qui, qui a intérêt à la diffusion), le seul terrain sur lequel une grille de lecture peut espérer faire mieux qu’une intuition d’expert.

Premier réflexe : séparer le résultat brut de son explication

Ma règle de lecture. Un préprint spectaculaire mélange presque toujours deux choses de solidité très inégale : un résultat brut mesuré, et l’explication avancée pour ce résultat. Le résultat brut est souvent la partie la plus solide et la plus reproductible : il suffit de relancer le code sur les mêmes données. L’explication de pourquoi ce résultat survient est la partie la plus fragile, et c’est aussi la plus vendable médiatiquement, parce qu’elle raconte une histoire plutôt qu’un chiffre.

C’est exactement la distinction que je fais dans ma fiche sur le TRM : selon le préprint Jolicoeur-Martineau (2025, non encore relu par les pairs), le TRM atteint 87,4 % de précision sur Sudoku-Extreme, contre 55,0 % pour le HRM et 0 % pour les LLM testés, des chiffres dont la vérifiabilité indépendante reste à établir (voir la note de correction ci-dessous). Ce qui est en jeu, ce n’est pas ce chiffre brut, c’est l’explication d’un raisonnement inspiré du cerveau humain, avancée par une partie de la couverture médiatique. Face à un nouveau préprint, la première question à poser n’est donc pas “le chiffre est-il vrai”, mais “le chiffre et son explication sont-ils au même niveau de preuve” : ce sont rarement les deux qui tiennent avec la même rigueur.

Deuxième réflexe : chercher une réplication indépendante, et par qui

Ce que les données établissent. Un préprint isolé n’a, par construction, reçu aucune contre-vérification externe. Chercher s’il en existe une, et l’identité de celui qui l’a menée, change ce qu’on peut en dire. Sur le HRM, prédécesseur direct du TRM, l’ARC Prize Foundation a publié une réanalyse indépendante (des ablations menées sur le code et les poids publiés, pas une reproduction menée depuis zéro) : le gain de précision venait surtout du processus itératif de raffinement du modèle, pas du raisonnement hiérarchique mis en avant par le papier original (le détail, avec les chiffres, est dans la fiche dédiée au HRM).

Mon interprétation. Une réanalyse indépendante n’est jamais neutre pour autant : l’ARC Prize Foundation gère elle-même le banc d’essai ARC-AGI, et a donc un intérêt propre à la visibilité de ce benchmark. Ça ne rend pas son analyse moins valable. Ça veut dire qu’il faut nommer cet intérêt en lisant sa conclusion, exactement comme on nommerait celui de l’auteur du préprint d’origine. Chercher une réplication ne suffit pas : il faut aussi se demander qui l’a produite, et ce qu’elle y gagne.

Troisième réflexe : nommer l’intérêt institutionnel de l’auteur

Ce que les données établissent. L’autrice du TRM, Alexia Jolicoeur-Martineau, est affiliée à Samsung SAIL Montréal, le laboratoire d’IA de Samsung à Montréal, dont les travaux bénéficient des ressources de Mila. Un laboratoire de recherche d’un grand groupe a un intérêt réel à faire connaître un résultat qui valorise ses équipes et sa marque. Ce fait, à lui seul, ne dit rien sur la validité du résultat : un chercheur salarié par une entreprise peut publier un travail rigoureux, comme un chercheur académique indépendant peut publier un travail fragile.

Mon interprétation. Ce que ce réflexe change, ce n’est pas le verdict sur le papier, c’est la manière de le lire. Un intérêt institutionnel à la diffusion d’un résultat n’invalide jamais ce résultat par lui-même, mais il doit être nommé au même titre que la méthode ou les données, comme une variable de contexte à ne pas escamoter.

Le biais qui fait le reste : l’heuristique de disponibilité

Ce que les données établissent. Un dernier mécanisme s’ajoute aux trois réflexes précédents, et il ne dépend pas du préprint lui-même : l’heuristique de disponibilité, décrite par Tversky et Kahneman (1973). Elle désigne la tendance à juger la fréquence ou l’importance d’un phénomène selon la facilité avec laquelle des exemples viennent à l’esprit, plutôt que selon sa fréquence réelle.

Mon interprétation. Tversky et Kahneman mesurent ce biais sur des tâches individuelles de rappel et d’estimation en laboratoire, pas sur la circulation médiatique d’un résultat scientifique ; l’extension qui suit est une application du mécanisme, pas une donnée qu’ils auraient testée. Appliquée à un préprint viral, la répétition médiatique d’un même récit (“un petit modèle qui raisonne comme un cerveau”) peut donner l’impression fausse d’un niveau de preuve croissant, alors même que rien de nouveau n’a été démontré entre la première mention et la centième. Voir un titre repris dix fois n’est pas dix fois plus de preuve que de le voir une fois. C’est le mécanisme qui rend les trois réflexes précédents nécessaires : sans eux, le volume de couverture se substitue silencieusement à la vérification.

Un préprint qui circule beaucoup n’est pas un préprint mieux vérifié. Séparer le résultat de son explication, chercher qui a répliqué, nommer qui a intérêt à la diffusion : trois vérifications indépendantes du bruit médiatique autour du papier.

Grille de lecture d'un préprint en trois réflexes : séparer le résultat brut de son explication, chercher une réplication indépendante et son origine, nommer l'intérêt institutionnel de l'auteur, face au biais sous-jacent de l'heuristique de disponibilité.

Mes réserves

  • Cette grille ne permet pas de trancher si un résultat est vrai ou faux : elle organise la lecture en attendant la vérification, elle ne la remplace pas.
  • Un préprint qui échoue aux trois réflexes n’est pas nécessairement faux pour autant : beaucoup de résultats solides commencent sans réplication ni consensus, le temps que la communauté s’en saisisse.
  • Le cas TRM utilisé ici pour illustrer la méthode est lui-même une histoire encore ouverte : deux analyses l’ont déjà nuancé en quelques mois, une troisième pourrait déplacer le diagnostic à nouveau.
  • Test de transposition sur les chiffres de l’étude Marcoci et al. (65,4 % de réplication, 69 % contre 61 % de prédiction) : elle porte sur des préprints Covid-19 en sciences sociales et comportementales, pas sur des préprints de machine learning comme celui du TRM. Les deux domaines diffèrent sur la reproductibilité du code, la disponibilité des données et la nature statistique des résultats ; ces chiffres donnent un ordre de grandeur du risque de non-réplication et de la limite du jugement d’expert en général, pas une probabilité calculée pour ce papier précis.

Appliquée à tout nouveau préprint spectaculaire en intelligence artificielle, cette grille tient en cinq gestes : séparer le chiffre de son récit ; vérifier l’existence et l’origine d’une réplication (réanalyse indépendante ou reproduction menée depuis zéro, la distinction compte) ; vérifier l’absence de contamination entre données d’entraînement et banc d’essai, un biais spécifique et documenté en apprentissage automatique ; nommer l’intérêt institutionnel en jeu ; se méfier du volume de couverture comme d’un indicateur de preuve. Pour le deuxième geste, des ressources comme Retraction Watch, PubPeer ou le suivi des citations sur Semantic Scholar aident à vérifier qu’une réplication existe. C’est la partie la plus réutilisable de ce dossier, précisément parce qu’elle ne dépend d’aucun résultat en particulier.

Retour au dossier Comprendre les modèles post-LLM. Voir aussi Qu’est-ce que le TRM ? et Ce qui explique vraiment le HRM.

Modification apportée · mis à jour le 13 août 2026

Correction du sens de la comparaison experts/débutants de l'étude Marcoci et al. (2024) : les débutants y prédisent en réalité mieux la réplication (69 %) que les chercheurs expérimentés (61 %), l'inverse de ce qu'indiquait une version précédente du texte. Nouvelles corrections : la citation d'Ioannidis (2005) ne doit pas laisser croire que la peer review neutralise le risque qu'il décrit, sa démonstration portant sur des résultats déjà relus par les pairs ; les chiffres du TRM (87,4 % / 55,0 % / 0 %) sont désormais attribués explicitement au préprint Jolicoeur-Martineau (2025), dont la vérifiabilité indépendante reste à établir ; l'analyse de l'ARC Prize Foundation sur le HRM est requalifiée en réanalyse indépendante par ablations sur le code et les poids publiés, à distinguer d'une réplication menée depuis zéro ; les deux résultats de l'étude Marcoci et al. (65,4 % de réplication, 69 % contre 61 % de prédiction) sont désormais explicitement rattachés à leur échantillon d'origine (préprints Covid-19 en sciences sociales), non transposable tel quel aux préprints d'IA. L'affiliation de l'autrice du TRM est corrigée : Samsung SAIL Montréal (le laboratoire d'IA de Samsung à Montréal), pas « Samsung SAIT AI Lab », une entité distincte du même groupe. Le chiffrage introductif (« moins de 500 dollars », « cent milliards de paramètres ») ne figurait dans aucune des sources citées : il est remplacé par ce que le préprint établit réellement, un coût documenté en heures de calcul GPU et une comparaison à Deepseek R1 (671 milliards de paramètres), que le TRM dépasse sur les bancs d'essai cités ; une première correction avait pris Grok-4 (1,7 billion de paramètres) comme exemple, alors que les deux variantes de Grok-4 dépassent le TRM sur ARC-AGI selon la table de comparaison du préprint. Deux autres points resserrés : le lien entre l'absence de peer review d'un préprint et les facteurs de risque d'Ioannidis, que sa démonstration ne pose pas explicitement, est requalifié en interprétation plutôt qu'en fait établi ; et l'étude Marcoci et al. mesure la réplication d'affirmations extraites de préprints, pas de préprints eux-mêmes, distinction désormais tenue dans le texte. J'ai ajouté deux encadrés de vulgarisation, l'un sur ce qu'est une mise en ligne sans relecture par les pairs, l'autre sur la différence de solidité entre une mesure et le récit qui l'explique.

Axel Morel
Axel Morel
Fondateur & analyste · Probans

Développe une méthode d'analyse destinée à distinguer ce que les preuves établissent, ce qu'elles suggèrent et ce qu'elles ne permettent pas de conclure, puis à traduire cette distinction en décisions professionnelles.

Choix du sujet, direction de la rédaction, validation ou modification des sources, validation et retravail du texte et des illustrations : Axel Morel. Rédaction, choix des sources initiales et plan de rédaction initial : assistance IA.

Responsabilité éditoriale : Axel Morel. Recherche et rédaction assistées par IA selon la méthodologie Probans, sources vérifiées avant publication. Charte éditoriale.

En savoir plus

Newsletter

Recevoir les prochaines analyses

Choisissez les catégories qui vous intéressent.

Catégories