LLM· Grand modèle de langage
Modèle d'intelligence artificielle entraîné sur de vastes corpus de texte pour prédire et générer du langage, capable de tâches d'analyse, de synthèse et de génération de texte en langage naturel sans avoir été explicitement programmé pour la tâche demandée.
ExempleGPT-4, Claude, Llama 3 sont des LLM : entraînés sur des milliards de mots, ils génèrent des réponses contextuellement cohérentes sans jamais 'comprendre' au sens propre ; mais en modélisant les probabilités du langage.
12 articles utilisant ce terme
Que coûte un LLM de raisonnement par requête ?
Environ treize fois plus d'énergie par requête : 0,31 Wh en médiane en régime de réponse courte contre 3,91 Wh en régime de raisonnement étendu, selon l'estimation la plus récente disponible (Oviedo et al., Microsoft Research, 2026), pour des modèles de frontière de plus de 200 milliards de paramètres. Cette sous-famille de LLM insère une longue étape de calcul intermédiaire avant de répondre ; le facteur est une estimation ascendante construite sur des hypothèses de matériel et de charge, pas une mesure au compteur.
Test-time compute : un calcul qui se paie à chaque réponse, pas une fois
Un calcul supplémentaire mobilisé au moment de répondre, pas pendant l'entraînement : Snell et al. (2024) montrent qu'à budget de calcul égal, cette dépense peut battre un modèle plus gros, un principe qui dépasse le nom du modèle en cours à la date de lecture.
JEPA prédit une représentation, et ne planifie que sur quelques pas
Une architecture pensée pour comprendre et anticiper le monde physique plutôt que générer du texte : avant d'y engager un cas d'usage, l'horizon de planification que le modèle tient sans réamorcer à chaque pas pèse au moins autant que le financement, un critère à lire comme une grille d'analyse plutôt qu'un standard établi par les auteurs de JEPA.
Le TRM atteint 87,4 % sur Sudoku-Extreme, et 0 % sur les labyrinthes
Sur un Sudoku difficile, un modèle de quelques millions de paramètres atteint 87,4 % là où les LLM testés obtiennent 0 %, pour quelques dizaines d'heures de calcul sur un unique GPU ; mais sur ARC-AGI, deux analyses indépendantes contestent le récit d'un raisonnement inspiré du cerveau.
Que coûte à Mamba son état de taille fixe ?
Ce que j'appelle une taxe de compression : l'état de taille fixe qui rend le contexte long moins cher est lié à une capacité limitée à retrouver une information mentionnée une seule fois. Une architecture à état sélectif, déjà en production, pensée pour réduire le coût du contexte long face aux Transformers.
OpenAI : trois axes tenus de ChatGPT à GPT-5, et ce que le raisonnement coûte
ChatGPT en 2022, un modèle qui raisonne en 2024, des agents qui agissent depuis 2025 : trois annonces que je relie, à titre d'interprétation, à la même charte (bâtir une IA générale et en distribuer largement les bénéfices), une lecture parmi d'autres possibles. Le numéro de version change ; cette lecture, non.
DeepSeek R1 n'active que 37 de ses 671 milliards de paramètres
Une architecture à mélange d'experts ne met en jeu, pour chaque token, qu'une fraction de ses paramètres, sélectionnée par un mécanisme de routage. C'est ce qui sépare les 671 milliards de paramètres affichés par DeepSeek R1 des 37 milliards que sa fiche donne pour activés.
Coût énergétique d'une requête LLM : 0,31 Wh à 300 tokens, 3,91 Wh à 5 000
Oviedo et al. (Joule, 2026) estiment la médiane à 0,31 Wh par requête à 300 tokens de sortie médians, et une médiane de 3,91 Wh à 5 000 tokens de sortie médians, sur un panier de trois modèles ouverts retenus selon un seuil de 200 milliards de paramètres. Ce sont des sorties de simulation Monte-Carlo, pas des mesures physiques. Avant toute comparaison avec une autre technologie, la longueur de calcul que l'on déclenche est déjà, à elle seule, une décision énergétique.
Labs IA : le pivot de Meta, de Llama ouvert à Muse Spark fermé
Sept laboratoires, sept trajectoires. Ce qui prédit la position de chacun sur poids ouverts ou fermés n'est pas un choix technique, mais le mandat économique de son bailleur de capital : le pivot de Meta, de Llama ouvert à Muse Spark fermé, en fournit le test le plus net.
Anthropic et Claude : quatre jalons datés de 2021 à 2025, classés par source
Fondée en janvier 2021 par sept anciens salariés d'OpenAI, dont la fratrie Amodei notamment partie sur des désaccords de direction, Anthropic aligne ses jalons publics, génération après génération, sur l'alignement traçable et l'autonomie d'action prolongée.
ARC-AGI, le banc d'essai où GPT-4o obtenait environ 9 % en 2024
Des grilles de couleurs conçues à partir d'a priori proches des a priori humains innés, mais où GPT-4o, Gemini 1.5 et Claude 3.5 Sonnet échouent le plus souvent : comprendre ce banc d'essai est la condition pour lire correctement les scores du TRM.
LLM en finance : près de 90 % sur la réaction, 58 % sur la dérive
Sur des données postérieures à sa date de coupure, GPT-4 oriente correctement un portefeuille quotidien près de 90 % du temps, mais sur une réaction de marché qui n'est pas directement exploitable. Avant cette date, impossible de distinguer un vrai signal d'un simple effet de mémoire.