Décision possible
Décision concernée
Faut-il regarder TRM, Mamba ou JEPA comme la suite des LLM ?
Pas au même niveau de preuve, ni au même horizon. Mamba est déjà en production, le TRM reste un préprint fragilisé par la réplication, JEPA dispose d'une validation expérimentale documentée mais reste sans produit commercial validé à grande échelle à ce jour.
L'essentiel en 3 points
- Le même désassemblage se joue à deux échelles : à l'intérieur des modèles (Mamba pour le contexte long, mélange d'experts pour l'inférence économe, JEPA pour la perception du monde physique) et entre les entreprises qui les développent, sans qu'une stratégie unique se dégage des sept grands labs cartographiés dans ce dossier.
- Le niveau de preuve de chaque paradigme se vérifie, il ne se déclare pas : Mamba équipe déjà des modèles hybrides en production (Jamba, Falcon Mamba, Nemotron-H) mais garde une limite documentée de rappel précis sur les contextes longs ; le TRM reste un unique préprint, affaibli deux fois par réplication indépendante ; JEPA a levé plus d'un milliard de dollars sans produit commercial validé à grande échelle.
- Le coût, pas seulement la performance, distingue ces paradigmes de façon actionnable : un facteur d'environ 13 sépare déjà un LLM standard d'un LLM de raisonnement, et un facteur proche de 18 sépare le calcul mobilisé par une architecture à mélange d'experts de celui d'un modèle dense équivalent, deux ordres de grandeur que les pièces du dossier détaillent chacune à leur source.
Mes réserves
Comment lire ce dossier
- Les neuf pièces de ce dossier ne sont pas mises à jour au même rythme. Le chiffre de coût d'inférence le plus récent cité dans les fiches courtes vient d'une source primaire datée, la publication technique de DeepSeek du 27 février 2025 (DeepSeek-V3/R1 Inference System Overview, Open Source Week), qui mesure un coût d'infrastructure d'environ 0,30 dollar par million de tokens générés : je le revérifie au rythme de la fiche qui le cite, pas à celui du dossier entier.
- Ce dossier chapeaute une analyse de synthèse dédiée à TRM, Mamba et JEPA. Les réserves méthodologiques sur chacun de ces trois paradigmes (biais de financement, non-réplication par les pairs, majorants énergétiques) sont documentées dans cette analyse plutôt que répétées ici.
- Le classement implicite de ce dossier, production établie / recherche contestée / pari financé, est une lecture de la situation à la date de publication : l'un des trois paradigmes peut changer de catégorie plus vite que les huit autres pièces du dossier ne sont révisées.
L'Indice de solidité des preuves évalue la base empirique de cette analyse sur quatre critères pondérés : type de preuve (40 %), convergence (30 %), réplication (20 %), puissance (10 %). L'axe type de preuve est calibré par champ : 100 y désigne le meilleur dispositif que l'échelle ISP-IA sache produire, et non une preuve absolue.
Score de 47/100 (31-55 %) établi le 27 août 2026.