← Lexique
ia

LLM· Grand modèle de langage

Modèle d'intelligence artificielle entraîné sur de vastes corpus de texte pour prédire et générer du langage, capable de tâches d'analyse, de synthèse et de génération de texte en langage naturel sans avoir été explicitement programmé pour la tâche demandée.

ExempleGPT-4, Claude, Llama 3 sont des LLM : entraînés sur des milliards de mots, ils génèrent des réponses contextuellement cohérentes sans jamais 'comprendre' au sens propre ; mais en modélisant les probabilités du langage.

12 articles utilisant ce terme

16 juillet 2026

Que coûte un LLM de raisonnement par requête ?

Environ treize fois plus d'énergie par requête : 0,31 Wh en médiane en régime de réponse courte contre 3,91 Wh en régime de raisonnement étendu, selon l'estimation la plus récente disponible (Oviedo et al., Microsoft Research, 2026), pour des modèles de frontière de plus de 200 milliards de paramètres. Cette sous-famille de LLM insère une longue étape de calcul intermédiaire avant de répondre ; le facteur est une estimation ascendante construite sur des hypothèses de matériel et de charge, pas une mesure au compteur.

16 juillet 2026

Test-time compute : un calcul qui se paie à chaque réponse, pas une fois

Un calcul supplémentaire mobilisé au moment de répondre, pas pendant l'entraînement : Snell et al. (2024) montrent qu'à budget de calcul égal, cette dépense peut battre un modèle plus gros, un principe qui dépasse le nom du modèle en cours à la date de lecture.

15 juillet 2026

JEPA prédit une représentation, et ne planifie que sur quelques pas

Une architecture pensée pour comprendre et anticiper le monde physique plutôt que générer du texte : avant d'y engager un cas d'usage, l'horizon de planification que le modèle tient sans réamorcer à chaque pas pèse au moins autant que le financement, un critère à lire comme une grille d'analyse plutôt qu'un standard établi par les auteurs de JEPA.

15 juillet 2026

Le TRM atteint 87,4 % sur Sudoku-Extreme, et 0 % sur les labyrinthes

Sur un Sudoku difficile, un modèle de quelques millions de paramètres atteint 87,4 % là où les LLM testés obtiennent 0 %, pour quelques dizaines d'heures de calcul sur un unique GPU ; mais sur ARC-AGI, deux analyses indépendantes contestent le récit d'un raisonnement inspiré du cerveau.

15 juillet 2026

Que coûte à Mamba son état de taille fixe ?

Ce que j'appelle une taxe de compression : l'état de taille fixe qui rend le contexte long moins cher est lié à une capacité limitée à retrouver une information mentionnée une seule fois. Une architecture à état sélectif, déjà en production, pensée pour réduire le coût du contexte long face aux Transformers.

14 juillet 2026

OpenAI : trois axes tenus de ChatGPT à GPT-5, et ce que le raisonnement coûte

ChatGPT en 2022, un modèle qui raisonne en 2024, des agents qui agissent depuis 2025 : trois annonces que je relie, à titre d'interprétation, à la même charte (bâtir une IA générale et en distribuer largement les bénéfices), une lecture parmi d'autres possibles. Le numéro de version change ; cette lecture, non.

13 juillet 2026

DeepSeek R1 n'active que 37 de ses 671 milliards de paramètres

Une architecture à mélange d'experts ne met en jeu, pour chaque token, qu'une fraction de ses paramètres, sélectionnée par un mécanisme de routage. C'est ce qui sépare les 671 milliards de paramètres affichés par DeepSeek R1 des 37 milliards que sa fiche donne pour activés.

12 juillet 2026

Coût énergétique d'une requête LLM : 0,31 Wh à 300 tokens, 3,91 Wh à 5 000

Oviedo et al. (Joule, 2026) estiment la médiane à 0,31 Wh par requête à 300 tokens de sortie médians, et une médiane de 3,91 Wh à 5 000 tokens de sortie médians, sur un panier de trois modèles ouverts retenus selon un seuil de 200 milliards de paramètres. Ce sont des sorties de simulation Monte-Carlo, pas des mesures physiques. Avant toute comparaison avec une autre technologie, la longueur de calcul que l'on déclenche est déjà, à elle seule, une décision énergétique.

11 juillet 2026

Labs IA : le pivot de Meta, de Llama ouvert à Muse Spark fermé

Sept laboratoires, sept trajectoires. Ce qui prédit la position de chacun sur poids ouverts ou fermés n'est pas un choix technique, mais le mandat économique de son bailleur de capital : le pivot de Meta, de Llama ouvert à Muse Spark fermé, en fournit le test le plus net.

10 juillet 2026

Anthropic et Claude : quatre jalons datés de 2021 à 2025, classés par source

Fondée en janvier 2021 par sept anciens salariés d'OpenAI, dont la fratrie Amodei notamment partie sur des désaccords de direction, Anthropic aligne ses jalons publics, génération après génération, sur l'alignement traçable et l'autonomie d'action prolongée.

10 juillet 2026

ARC-AGI, le banc d'essai où GPT-4o obtenait environ 9 % en 2024

Des grilles de couleurs conçues à partir d'a priori proches des a priori humains innés, mais où GPT-4o, Gemini 1.5 et Claude 3.5 Sonnet échouent le plus souvent : comprendre ce banc d'essai est la condition pour lire correctement les scores du TRM.

11 juin 2026

LLM en finance : près de 90 % sur la réaction, 58 % sur la dérive

Sur des données postérieures à sa date de coupure, GPT-4 oriente correctement un portefeuille quotidien près de 90 % du temps, mais sur une réaction de marché qui n'est pas directement exploitable. Avant cette date, impossible de distinguer un vrai signal d'un simple effet de mémoire.

Newsletter

Recevoir les prochaines analyses

Choisissez les catégories qui vous intéressent.

Catégories