LLM· Grand modèle de langage
Modèle d'intelligence artificielle entraîné sur de vastes corpus de texte pour prédire et générer du langage, capable de tâches d'analyse, de synthèse et de raisonnement en langage naturel sans avoir été explicitement programmé pour la tâche demandée.
ExempleGPT-4, Claude, Llama 3 sont des LLM : entraînés sur des milliards de mots, ils génèrent des réponses contextuellement cohérentes sans jamais 'comprendre' au sens propre ; mais en modélisant les probabilités du langage.
12 articles utilisant ce terme
Anthropic et Claude : pourquoi la fiabilité vérifiable est le pari, pas l'argument marketing
Fondée en 2021 par des chercheurs partis d'OpenAI sur des désaccords de sécurité, Anthropic pousse la même direction à chaque génération de Claude : rendre l'alignement traçable et donner au modèle une autonomie d'action prolongée, plutôt que viser le modèle le moins cher ou le plus grand public.
ARC-AGI, le banc d'essai que les LLM ratent
Des grilles de couleurs qu'un humain résout en quelques essais, mais où les grands modèles de langage s'effondrent : comprendre ce banc d'essai est la condition pour lire correctement les scores du TRM.
Convergence ou divergence : les grands labs IA visent-ils tous la même chose ?
Sept laboratoires, sept trajectoires : produit grand public, souveraineté, échelle de calcul brute, efficience architecturale. Aucun ne vise le même point d'arrivée — et c'est le même désassemblage que celui déjà observé au niveau des modèles eux-mêmes.
Le vrai coût énergétique d'une requête LLM : un facteur d'environ 13 sépare un LLM standard d'un LLM de raisonnement
Une requête coûte 0,31 Wh en médiane sur un LLM standard, contre 3,91 Wh sur un LLM de raisonnement, d'après la mesure la plus récente et la mieux revue par les pairs : l'écart le plus significatif ne sépare pas l'IA du reste, il sépare deux façons d'utiliser l'IA.
Mixture of experts : pourquoi DeepSeek R1 n'active que 37 des 671 milliards de paramètres
Un LLM dense calcule avec la totalité de ses paramètres à chaque token. Une architecture à mélange d'experts n'en active qu'une fraction, sélectionnée par un mécanisme de routage — ce qui explique l'écart entre les 671 milliards affichés par DeepSeek R1 et les 37 milliards réellement mobilisés par requête.
OpenAI : une charte, un même triptyque stratégique répété à chaque génération de modèle
ChatGPT en 2022, un modèle qui raisonne en 2024, des agents qui agissent depuis 2025 : trois annonces d'apparence différente qui poussent la même charte — bâtir une IA générale et en distribuer largement les bénéfices — un cran plus loin à chaque fois. Le numéro de version change ; la direction, non.
Qu'est-ce que le TRM (Tiny Recursive Model) ?
Un modèle de quelques millions de paramètres bat les LLM sur des puzzles fermés pour moins de 500 dollars d'entraînement — mais pourquoi ça marche ne fait plus consensus.
Qu'est-ce qu'un LLM "de raisonnement" ?
Une sous-famille de LLM insère une longue étape de calcul intermédiaire avant de répondre, au prix d'une consommation énergétique par requête supérieure d'un facteur d'environ 13 à celle d'un LLM standard.
Test-time compute : pourquoi certains modèles réfléchissent avant de répondre
Un calcul supplémentaire mobilisé au moment de répondre, pas pendant l'entraînement : Snell et al. (2024) montrent qu'à budget de calcul égal, cette dépense peut battre un modèle plus gros — un principe qui dépasse le nom du modèle en cours à la date de lecture.
Qu'est-ce que JEPA ?
Une architecture pensée pour comprendre et anticiper le monde physique plutôt que générer du texte — un pari financé à plus d'un milliard de dollars, sans produit commercial démontré à ce jour.
Qu'est-ce que Mamba ?
Une architecture à état sélectif, déjà en production, pensée pour réduire le coût du contexte long face aux Transformers.
LLM en finance : entre signal réel et effet de mémoire
GPT-4 anticipe la réaction du marché avec un taux de succès proche de 90 %, mais seulement hors des données antérieures à sa date de coupure : sinon, c'est de la mémorisation, pas un signal.