Dossier · Intelligence artificielle
Comprendre les modèles post-LLM
Mamba, TRM, JEPA : production établie, recherche contestée, pari financé.
Décision possible
La synthèse actionnable du dossier
Ce que les preuves permettent réellement de décider, sans le bruit commercial.
Lire la synthèse →Articles courts
21 articlesUn LLM de raisonnement consomme environ 13 fois plus par requête
Une sous-famille de LLM insère une longue étape de calcul intermédiaire avant de répondre ; selon l'estimation la plus récente disponible (Oviedo et al., Microsoft Research, 2026), la consommation énergétique médiane par requête est multipliée par environ 13 entre un régime de réponse courte et un régime de raisonnement étendu, sur un panel de trois grands modèles ; ce n'est pas le plafond que la même étude mesure.
16 juillet 2026Test-time compute : un calcul qui se paie à chaque réponse, pas une fois
Un calcul supplémentaire mobilisé au moment de répondre, pas pendant l'entraînement : Snell et al. (2024) montrent qu'à budget de calcul égal, cette dépense peut battre un modèle plus gros, un principe qui dépasse le nom du modèle en cours à la date de lecture.
16 juillet 2026xAI : les données de X, et 300 MW à Colossus 1 contre 9 GW chez OpenAI
Fondée par Elon Musk en 2023, propriétaire par ailleurs de X, xAI construit Grok sur deux paris stables : l'accès aux publications récentes de la plateforme plutôt qu'un modèle figé à une date de coupure, et un centre de calcul dédié, Colossus, taillé pour la taille plutôt que pour l'efficience. Un choix qui contraste avec celui de Mistral ou DeepSeek, sans qu'aucun des deux ne soit à ce stade démontré comme le bon.
16 juillet 2026JEPA prédit une représentation, et ne planifie que sur quelques pas
Une architecture pensée pour comprendre et anticiper le monde physique plutôt que générer du texte : avant d'y engager un cas d'usage, l'horizon de planification que le modèle tient sans réamorcer à chaque pas pèse au moins autant que le financement, un critère à lire comme une grille d'analyse plutôt qu'un standard établi par les auteurs de JEPA.
15 juillet 2026Le TRM atteint 87,4 % sur Sudoku-Extreme, et 0 % sur les labyrinthes
Sur un Sudoku difficile, un modèle de quelques millions de paramètres atteint 87,4 % là où les LLM testés obtiennent 0 %, pour quelques dizaines d'heures de calcul sur un unique GPU ; mais sur ARC-AGI, deux analyses indépendantes contestent le récit d'un raisonnement inspiré du cerveau.
15 juillet 2026Mamba : un état de taille fixe, un coût linéaire, et une taxe de compression
Une architecture à état sélectif, déjà en production, pensée pour réduire le coût du contexte long face aux Transformers.
15 juillet 2026Llama et Qwen : que vend vraiment l'éditeur qui donne ses poids
Meta et Alibaba misent sur la diffusion massive de leurs modèles plutôt que sur la vente d'accès. Une stratégie qui ne joue pas sur le même terrain que les labs à modèle propriétaire fermé.
14 juillet 2026OpenAI : trois axes tenus de ChatGPT à GPT-5, et ce que le raisonnement coûte
ChatGPT en 2022, un modèle qui raisonne en 2024, des agents qui agissent depuis 2025 : trois annonces que je relie, à titre d'interprétation, à la même charte (bâtir une IA générale et en distribuer largement les bénéfices), une lecture parmi d'autres possibles. Le numéro de version change ; cette lecture, non.
14 juillet 2026L'attention d'un Transformer : 42 Go de cache pour un contexte de 128 000 tokens
Le mécanisme qui a rendu les Transformers redoutables sur le texte a un coût qui grossit plus vite que le contexte lui-même : précisément le problème que Mamba a été conçu pour contourner.
14 juillet 2026Jamba alterne Mamba et attention : un débit x3 annoncé par AI21 Labs
Un modèle hybride n'élimine pas l'attention : il la combine avec des blocs Mamba, en alternance dans la plupart des cas recensés ici, parfois en parallèle dans une même couche (Hymba). AI21 Labs en a fait un choix d'ingénierie arbitré, pas une hypothèse de recherche.
13 juillet 2026Mistral AI : un portefeuille à deux étages, et un écart mesuré face à GPT-5
Depuis Mistral 7B en 2023, Mistral AI construit sa gamme autour de deux axes : l'ouverture des poids et l'efficience pour une partie de ses modèles, la capacité de pointe via API propriétaire pour d'autres (dont Mistral Large 3, son modèle phare actuel), et la souveraineté numérique européenne, un axe que le débat public associe à Mistral depuis sa création, sans que cette pièce établisse une déclaration chiffrée et datée de l'entreprise elle-même sur ce point.
13 juillet 2026DeepSeek R1 n'active que 37 de ses 671 milliards de paramètres
Une architecture à mélange d'experts ne met en jeu, pour chaque token, qu'une fraction de ses paramètres, sélectionnée par un mécanisme de routage. C'est ce qui sépare les 671 milliards de paramètres affichés par DeepSeek R1 des 37 milliards que sa fiche donne pour activés.
13 juillet 2026Coût énergétique d'une requête LLM : 0,31 Wh à 300 tokens, 3,91 Wh à 5 000
Oviedo et al. (Joule, 2026) estiment la médiane à 0,31 Wh par requête à 300 tokens de sortie médians, et une médiane de 3,91 Wh à 5 000 tokens de sortie médians, sur un panier de trois modèles ouverts retenus selon un seuil de 200 milliards de paramètres. Ce sont des sorties de simulation Monte-Carlo, pas des mesures physiques. Avant toute comparaison avec une autre technologie, la longueur de calcul que l'on déclenche est déjà, à elle seule, une décision énergétique.
12 juillet 2026DeepSeek : une bande passante NVLink bridée de 900 à 400 Go/s
DeepSeek écrit elle-même que la bande passante NVLink de ses cartes serait tombée de 900 à 400 Go/s pour conformité réglementaire, une cause qu'elle ne nomme pas plus précisément, et qu'elle aurait retenu ses stratégies de parallélisme pour s'y aligner. Deux revendeurs de ce matériel, Lenovo et Tencent Cloud, publient la même valeur de 400 Go/s, pour un autre format de carte ou sans préciser le format. Personne, en dehors d'elle, n'a vérifié ce qu'elle en a tiré.
12 juillet 2026Le TPU de Google a deux prix, pas un
La multimodalité native et la fusion Brain/DeepMind sont connues depuis 2023 et largement documentées ailleurs. Ce qui reste sous-exploré : ce qu'une seule analyse indépendante, non auditée par un tiers, estime pour l'avantage de coût du TPU de Google, et pourquoi une autre mesure indépendante trouve l'inverse sur ce point précis.
12 juillet 2026Lire un préprint non revu par les pairs : trois réflexes et un biais
Un résultat spectaculaire publié sur arXiv n'a pas encore été vérifié par d'autres chercheurs du domaine. Trois réflexes de lecture et une mise en garde contre le biais de disponibilité, illustrés par le cas du TRM, permettent de juger ce type de papier sans attendre ni le rejeter par principe.
11 juillet 2026Labs IA : le pivot de Meta, de Llama ouvert à Muse Spark fermé
Sept laboratoires, sept trajectoires. Ce qui prédit la position de chacun sur poids ouverts ou fermés n'est pas un choix technique, mais le mandat économique de son bailleur de capital : le pivot de Meta, de Llama ouvert à Muse Spark fermé, en fournit le test le plus net.
11 juillet 2026World models : 1,03 et 1,23 milliard levés, aucune preuve de traction
Yann LeCun, Fei-Fei Li et Google DeepMind portent chacun un pari sur les modèles du monde en quelques mois à peine. Le financement dépasse déjà le milliard de dollars pour deux d'entre eux ; la preuve commerciale, elle, reste à établir pour les trois.
11 juillet 2026Anthropic et Claude : quatre jalons datés de 2021 à 2025, classés par source
Fondée en janvier 2021 par sept anciens salariés d'OpenAI, dont la fratrie Amodei notamment partie sur des désaccords de direction, Anthropic aligne ses jalons publics, génération après génération, sur l'alignement traçable et l'autonomie d'action prolongée.
10 juillet 2026ARC-AGI, le banc d'essai où GPT-4o obtient environ 9 %
Des grilles de couleurs conçues à partir d'a priori proches des a priori humains innés, mais où les grands modèles de langage standards échouent le plus souvent : comprendre ce banc d'essai est la condition pour lire correctement les scores du TRM.
10 juillet 2026HRM sur ARC-AGI : 20 points pour la supervision profonde, 3,3 pour la récursion
Le préprint qui présente le TRM avance que retirer la supervision profonde fait perdre au HRM l'essentiel de sa précision sur ARC-AGI, alors que retirer la récursion hiérarchique n'en fait perdre qu'une petite part, et il crédite ces chiffres à l'ARC Prize Foundation, dont le billet porte un tout autre découpage. La méthode compte autant que le résultat.
10 juillet 2026Analyses liées
Sources (extrait)
- OpenAI (2024). Learning to Reason with LLMs. Annonce du modèle o1 : 74 % de réussite en un seul essai (pass@1) sur l'examen AIME 2024 pour "o1" (version finale), contre 12 % pour GPT-4o, chiffres du corps de texte. L'annexe A du même document donne, pour le même examen en pass@1, des valeurs différentes : GPT-4o 9,3 %, o1-preview (la version effectivement disponible au lancement) 44,6 %, o1 74,4 %. Les tarifs officiels lancés le même jour (o1-preview : 15 $/M tokens en entrée, 60 $/M en sortie ; GPT-4o : 2,50 $/M en entrée, 10 $/M en sortie) sont repris de la grille tarifaire publiée séparément par OpenAI le jour du lancement, non de cette page d'annonce elle-même, et ne concernent qu'o1-preview, pas "o1".
- DeepSeek-AI (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948.
- Oviedo, F. et al. (Microsoft Research, 2026). Energy Use of AI Inference, Efficiency Pathways, and Test-Time Scaling. Joule. arXiv:2509.20241.
- OpenRouter (juin 2026), agrégateur tarifaire reprenant la grille officielle OpenAI : API o3, 2 $/M tokens en entrée, 8 $/M en sortie.
Recevoir les prochaines analyses
Choix par catégorie · Sans spam · Désabonnement en 1 clic
Bibliographie et lexique
Bibliographie
- OpenAI (2024). Learning to Reason with LLMs. Annonce du modèle o1 : 74 % de réussite en un seul essai (pass@1) sur l'examen AIME 2024 pour "o1" (version finale), contre 12 % pour GPT-4o, chiffres du corps de texte. L'annexe A du même document donne, pour le même examen en pass@1, des valeurs différentes : GPT-4o 9,3 %, o1-preview (la version effectivement disponible au lancement) 44,6 %, o1 74,4 %. Les tarifs officiels lancés le même jour (o1-preview : 15 $/M tokens en entrée, 60 $/M en sortie ; GPT-4o : 2,50 $/M en entrée, 10 $/M en sortie) sont repris de la grille tarifaire publiée séparément par OpenAI le jour du lancement, non de cette page d'annonce elle-même, et ne concernent qu'o1-preview, pas "o1".POpenAI annonce et chiffre ici son propre modèle sur ses propres bancs ; les tarifs cités relèvent d'une page distincte, non capturée séparément dans ce dossier ; le document distingue o1 et o1-preview avec des scores différents que l'article ne doit pas confondre.
- DeepSeek-AI (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948.PPapier signé par DeepSeek sur son propre modèle.
- Oviedo, F. et al. (Microsoft Research, 2026). Energy Use of AI Inference, Efficiency Pathways, and Test-Time Scaling. Joule. arXiv:2509.20241.PLes auteurs sont salariés de Microsoft, acteur majeur de l'infrastructure d'inférence dont l'article évalue la consommation.
- OpenRouter (juin 2026), agrégateur tarifaire reprenant la grille officielle OpenAI : API o3, 2 $/M tokens en entrée, 8 $/M en sortie.S
- OpenAI. Reasoning models (documentation développeur). Les tokens de raisonnement, invisibles pour l'utilisateur, sont facturés comme tokens de sortie, sans qu'un multiplicateur chiffré soit publié (le facteur 3 à 10 cité dans cet article est une estimation, pas un chiffre officiel OpenAI).POpenAI documente ici sa propre API.
- Snell, C., Lee, J., Xu, K., & Kumar, A. (2024). Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters. arXiv:2408.03314.PTrois des quatre auteurs signent pour Google DeepMind, où le travail a été mené, et qui commercialise les modèles à raisonnement étendu que cette thèse justifie.
- Note technique (2026). Tiny Recursive Models on ARC-AGI-1: Inductive Biases, Identity Conditioning, and Test-Time Compute. arXiv:2512.11847.I
- CNBC (28 mars 2025). Elon Musk says xAI has acquired X in deal that values social media site at $33 billion.S
- Data Center Dynamics (2024-2025). xAI targets one million GPUs for Colossus supercomputer in Memphis : lancement en septembre 2024 avec 100 000 GPU Nvidia H100, construit en 122 jours sur le site d'une ancienne usine Electrolux.S
- SemiAnalysis (2025). xAI's Colossus 2 : First Gigawatt Datacenter In The World, Unique RL Methodology, Capital Raise. Colossus 1 porté à environ 200 000 GPU H100/H200 plus 30 000 GB200 NVL72 (~300 MW) ; Colossus 2 vise 1,1 GW d'ici le deuxième trimestre 2027.S
- Epoch AI (2026). OpenAI Stargate : plus de 9 GW de capacité de calcul planifiée aux États-Unis sur sept sites, dont environ 250 000 GPU (en puissance de calcul équivalente H100) déjà en service sur le site d'Abilene (Texas), pour une cible de 1,2 GW et environ 1 million de GPU équivalents sur ce site d'ici le quatrième trimestre 2026.S
- AWS / Anthropic (2026). Project Rainier : plus d'un million de puces Trainium2 en service pour Anthropic ; extension annoncée jusqu'à 5 GW de capacité supplémentaire avec Amazon.PAnnonce conjointe d'Amazon et d'Anthropic sur leur propre infrastructure de calcul.
- Anthropic (23 octobre 2025). Expanding our use of Google Cloud TPUs and services : jusqu'à un million de TPU Google, plus d'un gigawatt de capacité supplémentaire en 2026.PCommuniqué d'Anthropic sur ses propres engagements de calcul.
- Assran, M. et al. (2023). I-JEPA: Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture. Meta AI.PPapier signé par l'équipe Meta qui a conçu l'architecture commentée.
- Assran, M. et al. (2025). V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning. Meta AI / AMI Labs. arXiv:2506.09985.PPapier signé par les équipes Meta et AMI Labs qui ont conçu le modèle commenté.
- Recherche de suivi sur la limite de planification à long horizon des world models à embedding : FF-JEPA, Long-Horizon Planning in World Models with Latent Planners. arXiv:2606.09311.I
- TechCrunch (2026). Yann LeCun's AMI Labs raises $1.03B to build world models. Couvre aussi le tour de table et le partenariat Nabla.S
- Sifted (2026). Yann LeCun's AMI Labs raises $1bn in Europe's biggest seed round.S
- Jolicoeur-Martineau, A. (2025). Less is More: Recursive Reasoning with Tiny Networks. arXiv:2510.04871.PL'autrice a conçu le TRM dont cet article discute le résultat.
- ARC Prize Foundation (2025). The Hidden Drivers of HRM's Performance on ARC-AGI. Les chiffres de l'étude d'ablation (19 % à 39 % ; 35,7 % à 39,0 %) sont rapportés par Jolicoeur-Martineau (2025), citée ci-dessus, qui attribue cette analyse à l'ARC Prize Foundation.S
- Bae, S. et al. (2025). Mixture-of-Recursions: Learning Dynamic Recursive Depths for Adaptive Token-Level Computation. Accepté à NeurIPS 2025. arXiv:2507.10524.PLes auteurs présentent leur propre architecture récursive, citée ici comme travail voisin.
- ICLR 2026 Workshop on AI with Recursive Self-Improvement (RSI 2026), Rio de Janeiro, 23-27 avril 2026 : plusieurs travaux de suivi sur les modèles récursifs de petite taille y sont présentés (ex. « Tiny Autoregressive Recursive Models », « Generative Recursive Reasoning Models »).I
- VentureBeat (2025). Samsung AI researcher's new, open reasoning model TRM outperforms models 10,000X larger, on specific problems. Rapporte que l'autrice du TRM juge inutilement compliqué le cadre biologique et hiérarchique de son prédécesseur, le HRM.SAccès direct bloqué par une vérification anti-robot au moment de la relecture : cette citation s'appuie sur une lecture indirecte, pas sur un verbatim confirmé caractère pour caractère.
- Gu, A. & Dao, T. (2023). Mamba: Linear-Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.PLes deux auteurs ont conçu Mamba, l'architecture décrite ici.
- Dao, T. & Gu, A. (2024). Transformers are SSMs. arXiv:2405.21060 (Mamba-2).PMêmes auteurs, publiant sur la suite de leur propre architecture.
- Lieber et al. (2024). Jamba: A Hybrid Transformer-Mamba Language Model (AI21 Labs).PAI21 Labs publie sur son propre modèle hybride.
- AI21 Labs (2024). Introducing Jamba : 3x throughput on long contexts compared to Mixtral 8x7B.PAI21 Labs publie sur son propre modèle et sur son propre benchmark de débit.
- Étude de reclassement de documents comparant Mamba et Transformers. arXiv:2412.14354.I
- NVIDIA (2025). Nemotron-H: A Family of Accurate and Efficient Hybrid Mamba-Transformer Models (8B, 47B, 56B), jusqu'à trois fois plus rapide à l'inférence selon NVIDIA. arXiv:2504.03624.PNVIDIA publie sur sa propre famille de modèles, et vend le matériel sur lequel ils tournent.
- Technology Innovation Institute (2024). Falcon Mamba 7B, modèle Mamba pur (sans couche d'attention) entraîné sur 5,8 billions de tokens.PLe Technology Innovation Institute publie sur son propre modèle.
- Arora, S. et al. Zoology / synthèse sur le déficit de rappel associatif (associative recall) des modèles à espace d'état à taille de mémoire fixe, par rapport aux Transformers. arXiv:2312.04927.I
- Chen, S. et al. (2024). Stuffed Mamba: Oversized States Lead to the Inability to Forget. arXiv:2410.07145.I
- Mistral AI (2024). Codestral Mamba, retiré du catalogue le 6 juin 2025 selon la documentation Mistral, qui recommande Codestral pour les nouvelles intégrations.PMistral publie sur son propre modèle et sur son propre retrait du catalogue.
- IBM (2025). Granite 4.0 : hyper-efficient, high performance hybrid models for enterprise.PIBM publie sur sa propre famille de modèles.
- Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971.PPapier signé par l'équipe Meta qui a construit le modèle commenté.
- Zuckerberg, M. (2024). « Open Source AI Is the Path Forward ».PPrise de position du dirigeant de Meta sur la stratégie open source de Meta elle-même.
- Bai, J. et al. (2023). Qwen Technical Report. arXiv:2309.16609.PRapport technique signé par l'équipe Alibaba qui a construit le modèle commenté.
- Fortune (2026). « Alibaba AI models hit 3 billion downloads, passing Meta, Google », 15 août 2026, citant le rapport Hugging Face sur l'état des modèles ouverts du 14 août 2026.SLe total Qwen (plus de 3 Md) est une annonce d'Alibaba reprise par Fortune ; les chiffres de comparaison pour Google (418 M) et Meta (227 M), au niveau entreprise, viennent du rapport Hugging Face, une mesure indépendante.
- Spolsky, J. (2002). Strategy Letter V.S
- Peterson, D. (2024). « Commoditize your complement: Meta AI edition ».S
- Meta (2024). Llama 3.1 Community License Agreement, section 2.PDocument contractuel publié par Meta elle-même sur sa propre licence.
- OpenAI (2018, révisé depuis). OpenAI Charter.POpenAI expose sa propre charte de mission, qui fait le sujet de cet article.
- OpenAI (2022). Introducing ChatGPT, 30 novembre 2022.POpenAI annonce son propre produit.
- OpenAI (2024). Introducing OpenAI o1-preview, 12 septembre 2024.POpenAI annonce son propre modèle.
- OpenAI (2024). Video generation models as world simulators (Sora), 15 février 2024.POpenAI présente son propre modèle.
- OpenAI (2025). Introducing Operator, 23 janvier 2025.POpenAI annonce son propre produit.
- OpenAI (2025). Introducing ChatGPT agent, 17 juillet 2025.POpenAI annonce son propre produit.
- OpenAI (2025). Introducing GPT-5, 7 août 2025.POpenAI annonce son propre modèle.
- CNBC (2023). Anthropic, an OpenAI rival, opens Claude 2 AI chatbot to the public, 11 juillet 2023.ISource de presse indépendante, datée, pour situer l'ouverture de l'accès public de Claude par rapport à celle de ChatGPT.
- CNBC (2025). OpenAI says nonprofit will retain control of company, bowing to outside pressure, 5 mai 2025.ISource de presse indépendante pour l'évolution de la gouvernance d'OpenAI depuis la rédaction de la charte.
- CNBC (2024). OpenAI dissolves Superalignment AI safety team, 17 mai 2024.ISource de presse indépendante pour les départs de l'équipe sécurité interne d'OpenAI.
- Vaswani, A. et al. (2017). Attention Is All You Need. arXiv:1706.03762.PLes auteurs, chez Google, ont conçu l'architecture Transformer dont cet article discute le coût.
- Grattafiori, A. et al. / Meta (2024). The Llama 3 Herd of Models. arXiv:2407.21783, Table 3 (80 couches, dimension 8192, 64 têtes d'attention, 8 têtes clé-valeur) et section 3.4.2 (fenêtre de contexte étendue à 128 000 tokens).PRapport technique signé par Meta sur son propre modèle. La source ne désagrège pas l'extension de contexte par taille de modèle (8B/70B/405B) : l'attribution au 70B est une lecture par défaut, la série entière étant couverte par la même section.
- AI21 Labs. Announcing Jamba: AI21's Groundbreaking SSM-Transformer Model (débit x3 sur contextes longs face à Mixtral 8x7B).PCommuniqué de l'éditeur sur son propre modèle, dont il annonce lui-même le gain de débit.
- Artificial Analysis. Jamba 1.5 Mini, débit de sortie sur contextes de 10 000 tokens (mesure indépendante, cabinet de benchmarking tiers sans lien avec AI21 ; la page compare les fournisseurs qui hébergent Jamba entre eux, pas un classement de Jamba face à d'autres modèles).I
- IBM Research. Meet Bamba, IBM's new attention-state space model, développé avec Princeton, Carnegie Mellon et l'université de l'Illinois à Urbana-Champaign, précurseur direct d'IBM Granite 4.0.PBillet de blog d'IBM sur son propre modèle hybride, pas le papier académique Bamba.
- IBM. Fiche modèle Granite 4.0 H-Small (architecture hybride Mamba2/Transformer, 4 couches d'attention pour 36 couches Mamba2).PFiche produit d'IBM sur son propre modèle.
- Glorioso et al. (2024). Zamba: A Compact 7B SSM Hybrid Model (Zyphra). arXiv:2405.16712.PZyphra publie les mesures de son propre modèle.
- Dong et al. (2024). Hymba: A Hybrid-head Architecture for Small Language Models (NVIDIA). arXiv:2411.13676.PNVIDIA publie les mesures de son propre modèle.
- Waleffe et al. (2024). An Empirical Study of Mamba-based Language Models (NVIDIA), mesure de MFU comparée Mamba-2-Hybrid vs Transformer. arXiv:2406.07887.PÉtude signée NVIDIA sur ses propres modèles hybrides et sur l'efficacité du matériel qu'elle vend.
- Jiang et al. (2024). Mixtral of Experts (Mistral AI). arXiv:2401.04088.PMistral AI décrit ici son propre modèle Mixtral 8x7B, le comparateur nommé par AI21 pour son x3.
- Jiang, A. Q. et al. (2023). Mistral 7B. arXiv:2310.06825.PPapier signé par l'équipe de Mistral AI sur son propre modèle.
- Mistral AI (2024). « Au Large », annonce de Mistral Large, 26 février 2024.PAnnonce publiée par Mistral AI sur son propre modèle.
- Artificial Analysis. Mistral Large 3 vs GPT-5 (high) : comparatif indépendant d'intelligence, de prix et de vitesse.S
- Mistral AI. « About Mistral AI ».PPage institutionnelle publiée par Mistral AI sur elle-même.
- Wikipedia (édition anglaise). « Mistral AI ».S
- Mistral AI (2023). « Announcing Mistral 7B », 27 septembre 2023.PAnnonce publiée par Mistral AI sur son propre modèle.
- Mistral AI (2023). « Mixtral of experts », 11 décembre 2023.PAnnonce publiée par Mistral AI sur son propre modèle.
- DeepSeek-AI (2024). DeepSeek-V3 Technical Report, l'architecture à mélange d'experts sous-jacente à DeepSeek-R1 (671 milliards de paramètres au total, 37 milliards activés par token). arXiv:2412.19437.PRapport technique signé par DeepSeek sur sa propre architecture.
- DeepSeek-AI. DeepSeek-R1, fiche de modèle : « Total Parameters: 671B », « Activated Parameters: 37B », et « DeepSeek-R1-Zero and DeepSeek-R1 are trained based on DeepSeek-V3-Base ». Seule source du dossier qui porte ces deux décomptes pour R1 lui-même, et non pour V3.PFiche publiée par DeepSeek sur le dépôt de son propre modèle.
- Meta. Llama-3.1-70B, fiche de modèle : donne les 70 milliards de paramètres du repère de comparaison employé ici, et décrit « an auto-regressive language model that uses an optimized transformer architecture ».PFiche publiée par Meta sur son propre modèle.
- DeepSeek-AI (février 2025). Day 6, One More Thing: DeepSeek-V3/R1 Inference System Overview (Open Source Week). Fenêtre de mesure du 27 février 12h00 au 28 février 12h00 (UTC+8). Tarif de location posé en hypothèse par DeepSeek (« Assuming the leasing cost of one H800 GPU is $2 per hour »), 226,75 nœuds de 8 GPU en moyenne, débit moyen par nœud de 73 700 tokens/s en entrée « including cache hits » et 14 800 tokens/s en décodage, 342 des 608 milliards de tokens d'entrée (56,3 %) servis par le cache sur disque.PChiffres de coût et de débit publiés par DeepSeek sur son propre système d'inférence.
- de Vries, A. (2023). The growing energy footprint of artificial intelligence. Joule, 7(10), 2191-2194. Source du chiffre de 2,9 Wh pour une « requête ChatGPT moyenne », l'une des quatre valeurs qu'Oviedo et al. rangent parmi les estimations surestimées d'un facteur 4 à 20.SCommentaire revu par les pairs, que ma source principale qualifie d'estimation dépassée, obtenue hors conditions de production. Je cite les deux et je le dis.
- AI Energy Score (2025), Hugging Face et Salesforce. Mesure de 1,01 Wh par requête pour Llama 3.1 70B après ajustement de quantification, deuxième des quatre valeurs qu'Oviedo et al. jugent surestimées.IProtocole de mesure ouvert, sans lien commercial avec les modèles évalués. Oviedo et al. lui reprochent des conditions hors production, sans batching ni moteur de service.
- Agence internationale de l'énergie (2025). Energy and AI, Paris. Estimations de 1,25 Wh par requête pour Mixtral 8x22B et 2,25 Wh pour DeepSeek-R1 ; Oviedo et al. rangent la première parmi les valeurs surestimées, la seconde est écartée de ce classement dans cette pièce (voir Mes réserves).IOrganisation intergouvernementale sans intérêt commercial sur les modèles évalués. Même reproche des auteurs : conditions hors production.
- Google (2025). Measuring the environmental impact of delivering AI at Google Scale. arXiv:2508.15734. Mesure interne portant sur la requête texte médiane de Gemini Apps.PGoogle mesure et publie la consommation de son propre produit.
- Patterson, D. et al. (2021). Carbon Emissions and Large Neural Network Training. arXiv:2104.10350.PTravail co-signé par des auteurs de Google sur l'empreinte de modèles que l'entreprise entraîne et opère.
- DeepSeek-AI (2025). Insights into DeepSeek-V3: Scaling Challenges and Reflections on Hardware for AI Architectures. arXiv:2505.09343, version définitive dans l'Industry Track des actes de l'ISCA '25 : document que l'entreprise publie sur son propre système. Il donne le format de carte du parc d'entraînement, la bande passante NVLink avant et après bridage, la cause qu'elle lui assigne, le nombre d'unités de calcul détournées vers la communication et la raison qu'elle donne à la taille du parc. Aucune de ces valeurs n'est mesurée par un tiers.PDeepSeek documente son propre matériel et ses propres choix.
- Nvidia (2023). NVIDIA H100 Tensor Core GPU Datasheet, lue sur une copie hébergée par Megware : la ligne Interconnect donne le H100 à 900 Go/s de NVLink au format SXM et à 600 Go/s au format PCIe. Fiche du constructeur, valeurs nominales annoncées, mesurées par personne d'autre. Aucune mention du H800.PNvidia documente les performances de la carte qu'il vend.
- Lenovo Press (2023). ThinkSystem NVIDIA H800 PCIe Gen5 GPUs Product Guide, mis à jour le 31 octobre 2023, produit depuis retiré : fiche d'un revendeur qui commercialise cette machine et a donc un intérêt propre à en publier les caractéristiques. Elle donne la bande passante NVLink de 400 Go/s du H800 au format PCIe et nomme l'écart au H100 sans jamais le chiffrer. Elle paraît avant le rapport technique de DeepSeek-V3, ce qui montre que la spécification circulait déjà hors de l'entreprise.PLenovo documente une machine qu'il commercialise lui-même.
- Tencent Cloud (2026). Instance Specifications (instances GPU H800 HCCPNV5) : documentation produit d'un opérateur cloud qui loue ces instances H800 et vend donc l'objet qu'il décrit. Elle donne la même spécification de 400 Go/s, sans constituer une vérification tierce.PTencent Cloud documente les instances H800 qu'il commercialise.
- CNBC (2025). Nvidia sheds almost $600 billion in market cap, biggest one-day loss in U.S. history, 27 janvier 2025 : donne le recul de 17 % et la clôture à 118,58 dollars, la comparaison historique, la description de V3 comme « a free, open-source large language model » et le montant de moins de 6 millions de dollars tel que DeepSeek l'annonce.S
- CNBC (2025). China's DeepSeek has some big AI claims, not all experts are convinced, 30 janvier 2025 : porte la mise en cause du montant par des experts cités, et la réserve de CNBC en propre sur le coût d'exploitation.S
- CNBC (2023). U.S. curbs export of more AI chips, including Nvidia H800, to China, 17 octobre 2023 : annonce d'une intention d'étendre les restrictions, et description de la vitesse d'interconnexion ralentie par Nvidia.S
- Benzinga (2025). Dan Ives Says Chinese Startup DeepSeek's $6 Million AI Development Assertion Is 'Likely A Fictional Story', 29 janvier 2025 : attribution nommée de l'analyste Dan Ives (Wedbush).S
- Investing.com, diffusé par Yahoo Finance (2025). NVIDIA stock bounces back after 'deep' sell-off, 28 janvier 2025 : donne la clôture en hausse de 8,8 % du lendemain de la chute. Ne chiffre pas la capitalisation regagnée et ne dit rien de la suite du mouvement.S
- Yicai Global (2023). Nvidia A800, H800 Exports to China Will Be Affected by New Regulations, Domestic Manufacturers Say They Have Stocked up Goods in Advance, 17 octobre 2023 : rapporte le délai de trente jours de consultation publique sans citer le texte réglementaire, et des constitutions de stock de sources anonymes.S
- Prickett Morgan, T. (2025). How Did DeepSeek Train Its AI Model On A Lot Less – And Crippled – Hardware? The Next Platform, 27 janvier 2025 : presse technique spécialisée, énonce l'absence de parallélisme tensoriel dans V3 et cite la taille du cluster en l'attribuant à DeepSeek. Lit le rapport technique et l'explique, sans mesure ni recoupement propre.S
- Lyons, A. (2025). Dispelling DeepSeek Myths, Studying V3. Chipstrat, 11 mars 2025 : traite le format FP8, la quantification et la topologie NVLink/InfiniBand, et cite la taille du cluster V3. Sur la bande passante, il pose son incertitude au lieu de la lever : le rapport de DeepSeek mentionne 160 Go/s là où le H800 est donné à 400 Go/s, et il écrit ne pas savoir réconcilier les deux. La seconde moitié de son texte, annoncée comme six enseignements tirés de l'étude du rapport, reste réservée aux abonnés payants.S
- Lambert, N. (2025). DeepSeek V3 and the actual cost of frontier AI models. Interconnects.ai, 9 janvier 2025 : commente le rapport technique de DeepSeek sans recouper ses chiffres, et reprend SemiAnalysis pour l'explication du bridage du H800. Ce n'est donc pas une confirmation autonome, et cette entrée n'est pas indépendante de l'entrée SemiAnalysis sur ce point.S
- SemiAnalysis (2025). DeepSeek Debates: Chinese Leadership On Cost, True Training Cost, Closed Model Margin Impacts : couverture spécialisée sur l'infrastructure GPU et les coûts de High-Flyer/DeepSeek, dont l'essaimage de DeepSeek en mai 2023 et son financement sur les fonds propres du fonds. Présente ses valeurs comme les siennes, sans les sourcer.S
- Ottinger, L., trad. Wang, Z. (2024). Deepseek: From Hedge Fund to Frontier Model Maker. ChinaTalk, 9 décembre 2024 : traduction d'un entretien de mai 2023, qui établit que Liang Wenfeng est le fondateur de High-Flyer avant d'être le dirigeant de DeepSeek. Tout ce qu'il y déclare de sa propre entreprise reste une déclaration de dirigeant.S
- Google DeepMind (2023). Announcing Google DeepMind.PGoogle annonce ici sa propre réorganisation, qui fait le sujet de cet article.
- CNBC (2023, 20 avril). Read the internal memo Alphabet sent in merging A.I.-focused groups DeepMind and Google Brain.S
- Gemini Team, Google (2023). Gemini: A Family of Highly Capable Multimodal Models. arXiv:2312.11805.PRapport technique signé par l'équipe Google qui a construit le modèle décrit.
- Gemini Team, Google (2024). Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context. arXiv:2403.05530.PRapport technique signé par l'équipe Google qui a construit le modèle décrit.
- SemiAnalysis (28 novembre 2025). Google TPUv7: The 900lb Gorilla In the Room. Analyse indépendante de coût total de possession : le TCO interne par puce Ironwood (v7), pour la configuration complète en tore 3D, ressort environ 44 % plus bas que celui d'un serveur GB200 côté Google. Pour un client externe payant la marge de location de Google Cloud, l'avantage se réduit à environ 30 % moins cher qu'un GB200 comparable et environ 41 % moins cher qu'un GB300.S
- Artificial Analysis (28 novembre 2025). Hardware Benchmarking : sur son indicateur de coût d'inférence en tokens par dollar (service interactif, 30 tokens/s par requête), Nvidia conserve un avantage d'environ 5x sur le TPU v6e (Trillium) et d'environ 2x sur AMD MI300X, une mesure orientée débit réel en usage interactif qui contredit partiellement l'avantage de coût total de possession (TCO) relevé par SemiAnalysis.S
- Epoch AI (dernière mise à jour le 11 août 2026). AI Chip Sales. Confirme indépendamment le mécanisme de coût décrit par SemiAnalysis : pour une puce personnalisée comme le TPU, le prix retenu est celui payé au fournisseur tiers (Broadcom), pas un prix de vente grand public à marge comme pour les GPU Nvidia vendus directement.I
- Tversky, A., & Kahneman, D. (1973). Availability: A heuristic for judging frequency and probability. Cognitive Psychology, 5(2), 207-232.I
- Marcoci, A. et al. (2024). Predicting the replicability of social and behavioural science claims in COVID-19 preprints. Nature Human Behaviour.I
- Ioannidis, J.P.A. (2005). Why Most Published Research Findings Are False. PLoS Medicine, 2(8), e124.I
- TechCrunch (2026, 27 février). ChatGPT Reaches 900M Weekly Active Users. Chiffre officiel annoncé par OpenAI le même jour, repris ici via la couverture de presse spécialisée (source primaire OpenAI non retrouvée sous forme d'URL stable au moment de la rédaction).S
- Anthropic (2026, 28 mai). Anthropic raises $65B in Series H funding at $965B post-money valuation (communiqué officiel, source primaire ; chiffre d'affaires annualisé de 47 milliards de dollars franchi en mai 2026).PAnthropic annonce sa propre levée de fonds et sa propre valorisation.
- Mistral AI (2025, 9 septembre). Mistral AI raises 1.7B€ to accelerate technological progress with AI (communiqué officiel, source primaire, Série C menée par ASML, valorisation post-money 11,7 Md€).PMistral AI annonce sa propre levée de fonds.
- Ministère de l'Économie, France (18 novembre 2025). Communiqué officiel : partenariat franco-allemand avec Mistral AI et SAP SE pour une IA souveraine destinée à l'administration publique (accord-cadre attendu mi-2026, déploiement 2026-2030).PLe ministère annonce un partenariat auquel l'État français est lui-même partie.
- South China Morning Post (2026). Alibaba's Qwen family hits 700 million downloads to lead global open-source AI adoption, dépassant Llama (Meta) en téléchargements cumulés sur Hugging Face. Le journal appartient à Alibaba et relaie ici un chiffre publié par Alibaba sur son propre modèle : c'est le seul chiffre de téléchargements daté dont je dispose, ce n'est pas une mesure tierce.PLe South China Morning Post appartient à Alibaba, dont il rapporte ici le succès du modèle Qwen.
- CNBC (12 juin 2025). Scale AI's Alexandr Wang confirms departure for Meta as part of $14.3 billion deal (source primaire du montant et de la structure de la prise de participation de Meta dans Scale AI, 49 % du capital, sans droit de vote).S
- TechCrunch (2025). Meta admits it optimized its submitted Llama 4 Maverick model for human preference, not the model it shipped publicly (controverse de benchmark distincte, sur le modèle Maverick de la même famille Llama 4, entamant la crédibilité du lancement dans son ensemble).S
- Computerworld (2025, 15 mai). Meta hits pause on 'Llama 4 Behemoth' AI model amid capability concerns (source de la mise en pause de Behemoth elle-même, pour des raisons de performance technique, distincte de la controverse de benchmark sur Maverick).S
- VentureBeat (8 avril 2026). Goodbye, Llama? Meta launches new proprietary AI model Muse Spark, first since Superintelligence Labs' formation (premier modèle fermé de Meta Superintelligence Labs, rupture avec la politique de poids ouverts tenue depuis 2023).S
- UPI (10 août 2026). Meta makes Muse Spark 1.2 AI model open source (nuance récente et datée : une version ultérieure de Muse Spark redevient partiellement ouverte, signe que la position de Meta reste mouvante plutôt que stabilisée, à cinq jours de la publication de cet article).S
- RAND Corporation (5 février 2025). DeepSeek's Lesson: America Needs Smarter Export Controls. Centre d'analyse qui défend ici une position de politique publique assumée, jusque dans son titre : ce n'est pas un constat neutre sur l'embargo, c'est un plaidoyer pour le durcir. Cité pour la contrainte matérielle sur l'accès aux puces avancées qui pèse sur DeepSeek, un facteur causal distinct de la structure de son capital.SNote de plaidoyer, pas de recherche neutre : le RAND y prend parti sur le régime de contrôle des exportations qu'il décrit.
- AMI Labs (2026, 10 mars). Official launch (communiqué officiel, source primaire confirmant le tour de 1,03 milliard de dollars et la liste des investisseurs, au même niveau de preuve que le communiqué de World Labs cité plus bas).PAMI Labs annonce sa propre levée de fonds.
- TechCrunch (2024, 13 septembre). Fei-Fei Li's World Labs comes out of stealth with $230M in funding (source du premier tour, distinct de celui de février 2026 ci-dessous).S
- TechCrunch (2026, 18 février). World Labs lands $1B, with $200M from Autodesk, to bring world models into 3D workflows.S
- World Labs (2026, 18 février). World Labs Announces New Funding (communiqué officiel, source primaire du tour d'un milliard de dollars, citant Nvidia, AMD, Autodesk, Fidelity, Emerson Collective et Sea parmi les investisseurs ; distinct de l'annonce produit ci-dessous).PWorld Labs annonce sa propre levée de fonds.
- World Labs (2025, 12 novembre). Marble: A Multimodal World Model (communiqué officiel, source primaire de la mise en accès général du produit).PWorld Labs annonce son propre produit.
- Google DeepMind (2025, 5 août). Genie 3: A new frontier for world models.PGoogle DeepMind présente son propre modèle.
- Google (2026, 29 janvier). Project Genie: Experimenting with infinite, interactive worlds (communiqué officiel, source primaire de l'ouverture aux abonnés Google AI Ultra).PGoogle annonce l'ouverture de son propre produit.
- Forbes (2026, 30 juin). VCs Pour $3 Billion Into AI's Next Big Bet: World Models (les tours nommément cités par l'article pour Decart, Odyssey et General Intuition, hors AMI Labs et World Labs, totalisent environ 744 millions de dollars effectivement levés, plus un tour de 300 millions en discussion pour General Intuition au moment de l'article ; l'article qualifie aussi indépendamment le tour d'AMI Labs de plus grosse levée d'amorçage de l'histoire européenne).S
- International Federation of Robotics (IFR). World Robotics report (publication annuelle ; prochaine édition annoncée pour le 24 septembre 2026), fédération professionnelle des fabricants de robots, qui recense les installations réalisées par ses propres adhérents et commercialise ce rapport. C'est la série de déploiement la plus complète dont je dispose sur le volet robotique, ce n'est pas une mesure tierce.PL'IFR représente les fabricants dont elle compte les installations, et vend le rapport d'où je tire ce chiffre.
- Nvidia. Cosmos, plateforme de « world foundation models » pour la robotique et les véhicules autonomes (page produit officielle, cité pour signaler que Nvidia finance deux des trois acteurs profilés tout en développant sa propre offre concurrente).PNvidia finance deux des acteurs profilés et développe en parallèle sa propre offre concurrente sur le même marché.
- Waymo (2020, 8 octobre). Waymo is opening its fully driverless service to the general public in Phoenix (communiqué officiel, source primaire ; repère historique cité pour situer le délai typique entre financement massif d'un pari sur la prédiction du monde physique et première preuve de traction publique).PWaymo annonce l'ouverture de son propre service.
- STAT News (2026, 10 mars). As Yann LeCun's AMI raises $1 billion, health AI startup Nabla benefits (source du partenariat AMI Labs/Nabla annoncé en marge du tour de financement).S
- Anthropic (2023). Core Views on AI Safety: When, Why, What, and How.PAnthropic expose sa propre doctrine, qui fait le sujet de cet article. Ce texte ne mentionne ni la date de fondation, ni le passage par OpenAI, ni les noms des fondateurs : ces trois points s'appuient sur la source suivante, pas sur celle-ci.
- Wikipédia (consulté le 3 septembre 2026). Article "Anthropic", section fondation, d'après les sources secondaires qu'il compile.SSource de la date de fondation (janvier 2021), du nombre de fondateurs (sept anciens salariés d'OpenAI) et des noms de Daniela et Dario Amodei. Compilation encyclopédique, pas une source primaire : les faits qu'elle rapporte restent traçables à ses propres notes de bas de page.
- Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.PPapier signé par l'équipe Anthropic sur sa propre méthode d'alignement.
- Anthropic (2024). Introducing computer use, a new Claude 3.5 Sonnet, and Claude 3.5 Haiku (annonce du 22 octobre 2024).PAnthropic annonce ses propres modèles.
- Anthropic (2025). Claude 3.7 Sonnet and Claude Code (annonce du lancement de Claude Code en recherche préliminaire, 24 février 2025).PAnthropic annonce son propre produit.
- Anthropic (2023). Anthropic's Responsible Scaling Policy (publiée le 19 septembre 2023).PAnthropic publie et fait approuver par son conseil d'administration ce cadre à seuils ASL. Aucune évaluation indépendante de sa mise en œuvre n'est jointe ici ; le document remercie ARC Evals pour son appui à l'élaboration des seuils, ce qui n'équivaut pas à une évaluation tierce du respect de la politique.
- Menlo Ventures (2025). 2025: The State of Generative AI in the Enterprise (enquête auprès de 495 décideurs IA d'entreprise américains, publiée le 9 décembre 2025).PMenlo Ventures est investisseur d'Anthropic et publie l'enquête d'usage en entreprise dont je me sers.
- Thompson, B. (2026). Anthropic's Safety Superpower. Stratechery (15 juin 2026).S
- AI Now Institute / The Observer (2026). 'Safety first' puts Anthropic ahead in game of AI spin (12 avril 2026, citant Dr Heidy Khlaaf).S
- Chollet, F. (2019). On the Measure of Intelligence. arXiv:1911.01547.PFrançois Chollet a conçu ARC-AGI, le banc d'essai dont cet article examine la portée.
- ARC Prize Foundation. ARC-AGI-1 (banc d'essai officiel et historique des scores).PL'ARC Prize Foundation opère le banc d'essai qui fait le sujet de cet article et publie elle-même l'historique des scores.
- ARC Prize Foundation (2024). Introducing the ARC-AGI Public Leaderboard. Scores de référence GPT-4o et Gemini 1.5.PLa fondation publie le classement qui sert ici à établir l'échec des LLM sur son propre banc d'essai.
- ARC Prize Foundation. ARC Prize Verified Testing Policy (principe de conception du jeu de test privé/semi-privé).PDocument de politique de la fondation sur la conception de son propre jeu de test.
- ARC Prize Foundation (2024). OpenAI o3 Breakthrough High Score on ARC-AGI-Pub. Coûts de calcul par tâche calculés par la fondation à partir des volumes de tokens communiqués par OpenAI et de la tarification publique ; scores d'o3 sur ARC-AGI-1 (jeu semi-privé) : 75,7 % en configuration économe, 87,5 % en configuration maximale.PLa fondation évalue les modèles sur son propre banc d'essai et calcule elle-même les coûts qu'elle publie.
- TechCrunch (2025, 15 janvier). AI researcher François Chollet founds a new AI lab focused on AGI (départ de Google en novembre 2024, cofondation de Ndea avec Mike Knoop).S
- When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation. arXiv:2602.16763 (près de la moitié de 60 benchmarks de langage étudiés montrent des signes de saturation).I
- ARC Prize Foundation (2025, 5 décembre). ARC Prize 2025 Results and Analysis (ARC-AGI reporté sur les fiches modèle des quatre grands laboratoires, OpenAI, xAI, Anthropic, Google DeepMind, au cours de l'année écoulée ; score du Tiny Recursive Model, 45 % sur ARC-AGI-1 et 8 % sur ARC-AGI-2, avec un réseau de 7 millions de paramètres).PBilan annuel publié par la fondation sur l'adoption de son propre banc d'essai.
- ARC Prize Foundation (2025, 24 mars). Announcing ARC-AGI-2 and ARC Prize 2025 (annonce d'un second banc d'essai plus difficile, qui remplace ARC-AGI-1 dans le cadre de la compétition ARC Prize).PLa fondation annonce et motive elle-même le banc d'essai qui succède, dans sa compétition, à celui que cet article documente.
- ARC Prize Foundation. ARC-AGI-2 (page de présentation du second banc d'essai).PPage vivante de la fondation, non horodatée, décrivant le banc d'essai qui a remplacé ARC-AGI-1 dans le cadre de sa compétition.
- Wang, G., Li, J., Sun, Y., Chen, X., Liu, C., Wu, Y., Lu, M., Song, S. & Abbasi Yadkori, Y. (2025). Hierarchical Reasoning Model. Sapient Intelligence / Tsinghua University, arXiv:2506.21734. Papier original du HRM, publié par l'entreprise qui l'a conçu : source des chiffres cités en ouverture (Figure 1 : 55,0 % de précision pour le HRM contre 0,0 % pour les quatre modèles de référence testés, dont trois LLM, sur Sudoku-Extreme, 1000 exemples d'entraînement) et du cadrage d'origine inspiré du fonctionnement du cerveau.P
- TechTalks (4 août 2025). New brain-inspired AI model shows a more efficient path to reasoning. Exemple daté de la couverture presse spécialisée reprenant le récit d'origine du HRM sans mentionner la supervision profonde comme explication alternative.S
- Michel, P., Levy, O. & Neubig, G. (2019). Are Sixteen Heads Really Better than One? NeurIPS 2019, arXiv:1905.10650. Étude d'ablation antérieure et indépendante du HRM, sur l'attention multi-têtes des Transformers, citée ici comme second cas d'application du test moteur/décor.I
- Sur la capitalisation de Samsung Electronics, 2025-2026. Revue de presse financière convergente sur l'attribution au supercycle mémoire ; faisceau plutôt que source isolée.
- Le Grand Continent (2025). Entretien avec Alexia Jolicoeur-Martineau, Que sont les « TRM » ? Après les LLM, comprendre la future révolution de l'IA.
- Bloomberg (2026). AI Pioneer Fei-Fei Li's Startup World Labs Raises $1 Billion, 18 février 2026 : 1,23 milliard de dollars levés au total (230 millions en Series A, septembre 2024, et 1 milliard en Series B, février 2026).
I source primaire indépendante · S secondaire spécialisée · P partie prenante ayant un intérêt commercial sur le sujet traité.
Lexique
- LLM· Grand modèle de langage↗
- Modèle d'intelligence artificielle entraîné sur de vastes corpus de texte pour prédire et générer du langage, capable de tâches d'analyse, de synthèse et de génération de texte en langage naturel sans avoir été explicitement programmé pour la tâche demandée.
- Date de coupure· knowledge cutoff↗
- Date au-delà de laquelle les données d'entraînement d'un modèle ne contiennent plus d'information. Tout ce qui s'est produit après cette date est, en principe, inconnu du modèle sous sa forme figée : sauf à avoir été introduit via le contexte du prompt.
- Transformer↗
- Architecture de réseau de neurones fondée sur le mécanisme d'attention, à la base des grands modèles de langage actuels.
- Mécanisme d'attention↗
- Composant permettant à un modèle de pondérer l'importance relative des différentes parties d'une séquence d'entrée.
- Fenêtre de contexte· Context window↗
- Quantité maximale de texte qu'un modèle peut prendre en compte simultanément pour produire une réponse.
- Coût d'inférence↗
- Coût de calcul associé à l'utilisation d'un modèle déjà entraîné pour produire une réponse.
Modification apportée · mis à jour le 13 août 2026
Ajout d'un encadré précisant le niveau de preuve propre à chaque paradigme (production, préprint non répliqué, pari financé) et la source datée du chiffre de coût d'inférence cité.