# Qu'est-ce que Mamba ?

> Une architecture à état sélectif, déjà en production, pensée pour réduire le coût du contexte long face aux Transformers.

- Source : https://probans.org/ia/comprendre-modeles-post-llm/quest-ce-que-mamba
- Catégorie : Intelligence artificielle
- Auteur : Axel Morel
- Publié le : 2026-07-18
- Mis à jour le : 2026-07-27

Mamba n'est pas un chatbot, pas un modèle qu'on peut interroger directement, et son nom n'apparaît sur aucune interface grand public. C'est une architecture : une façon différente de faire circuler l'information à l'intérieur d'un modèle d'intelligence artificielle. Proposée en décembre 2023 par Albert Gu et Tri Dao, puis prolongée par leur extension Mamba-2 en 2024, elle répond à un problème très concret des grands modèles de langage (**LLM**) : plus le texte à traiter est long, plus ça coûte cher à calculer et à faire tourner.

## Le problème que Mamba cherche à résoudre

*Ce que les données établissent.* Un LLM classique repose sur une architecture appelée **Transformer**. Son mécanisme central, l'attention, permet à chaque mot du texte de "regarder" tous les autres mots déjà traités pour décider de la suite. C'est ce qui rend ces modèles si bons pour capter des liens distants dans un texte. Mais ce mécanisme a un coût qui grandit vite : si on double la longueur du texte fourni en entrée, le calcul nécessaire pour l'attention ne double pas, il quadruple. Ce coût de calcul croît de façon quadratique avec la longueur du contexte. En pratique, cela veut dire que résumer un document de 5 pages coûte relativement peu, mais qu'analyser un rapport de 500 pages en une seule fois peut devenir très lourd, ou tout simplement impossible à faire tenir en mémoire.

*Mon interprétation.* Ce problème n'a rien d'anecdotique pour qui utilise l'IA sur des tâches réelles : contrats longs, bases de code entières, historiques de conversation étendus. Plus le contexte s'allonge, plus la facture de calcul grimpe, et plus la mémoire nécessaire pendant que le modèle répond (l'inférence) augmente elle aussi avec la taille du contexte. C'est précisément ce goulot d'étranglement que Mamba a été conçu pour desserrer.

## Ce que Mamba change concrètement

*Ce que les données établissent.* Mamba remplace le mécanisme d'attention par un principe différent : un balayage séquentiel du texte à travers un état interne de taille fixe, qu'on appelle un espace d'état sélectif. Au lieu de comparer chaque mot à tous les mots précédents, le modèle met à jour en continu un résumé compact de ce qu'il a lu, et décide, de façon sélective, quelles informations garder dans ce résumé et lesquelles oublier. Concrètement, cela veut dire deux choses : le coût de calcul reste linéaire quand le contexte s'allonge (au lieu de quadratique), et la mémoire nécessaire pendant l'inférence reste constante, plutôt que de croître avec la longueur du texte traité.

Il faut être précis sur ce que « Mamba » désigne : ce n'est ni un modèle qu'on télécharge et qu'on interroge tel quel, ni un produit fini. C'est un composant d'architecture, une brique qu'un laboratoire peut choisir d'insérer à l'intérieur d'un modèle plus large, souvent combinée avec des couches d'attention classiques dans ce qu'on appelle une architecture hybride.

![Courbe du coût de calcul selon la longueur du contexte : quadratique pour un Transformer classique (doubler la longueur quadruple le calcul), linéaire pour Mamba, avec une mémoire d'inférence constante.](/images/articles-courts/schema1-quest-ce-que-mamba.svg)

## Où c'est déjà déployé

*Ce que les données établissent.* Ce n'est pas resté un exercice de laboratoire. Plusieurs modèles utilisent aujourd'hui Mamba ou une variante hybride Mamba-Transformer, en production :

- **Jamba** (AI21 Labs), premier modèle hybride Mamba-Transformer présenté comme de qualité production.
- **Codestral Mamba** (Mistral), une variante dédiée à la génération de code.
- **IBM Granite 4.0**, qui intègre également une architecture hybride de ce type.

Sur le gain concret, Jamba affiche un débit environ trois fois supérieur sur les contextes longs, comparé à un Transformer de taille comparable. Le papier fondateur de Mamba, lui, annonçait un gain de débit à l'inférence de l'ordre de cinq fois. Ce sont deux chiffres différents, mesurés dans des conditions différentes : le premier vient d'un modèle réellement déployé, le second du papier de recherche original.

## Une brique invisible, pas un produit

*Mon interprétation.* Le point le plus important à retenir, et le plus contre-intuitif, c'est que Mamba n'est visible nulle part pour qui utilise un modèle d'IA au quotidien. Si votre fournisseur de LLM utilise une architecture hybride intégrant Mamba, vous n'en verrez jamais la trace dans l'interface : pas de mention, pas de bouton, pas de case à cocher. Ce qui change, c'est le coût que ça fait tourner en coulisses, et éventuellement la vitesse de réponse sur un contexte long. C'est un composant d'infrastructure qui rend un produit existant moins coûteux à faire fonctionner, sans que l'utilisateur final le sache ni n'ait besoin de le savoir. À la différence d'un modèle de raisonnement affiché comme tel, ou d'une fonctionnalité "contexte long" mise en avant commercialement, Mamba reste, pour l'instant, un choix d'ingénierie qui se prend en coulisses.

## Mes réserves

- Le gain de débit annoncé n'est pas universel. Plusieurs études indépendantes mesurent une utilisation du GPU (MFU, le taux d'usage réel de la puissance de calcul théorique) inférieure à celle obtenue avec des Transformers optimisés.
- Une étude portant spécifiquement sur une tâche de reclassement de documents trouve même un débit d'entraînement inférieur pour Mamba par rapport à un Transformer sur cette tâche précise : le gain dépend donc du type de tâche et de la longueur du contexte réellement traité, pas d'une supériorité générale de l'architecture.
- Les chiffres de gain de débit cités ici (x3 pour Jamba, x5 pour le papier fondateur) proviennent de deux sources et de deux protocoles de mesure distincts ; je ne les ai pas recoupés avec un benchmark indépendant tiers avant publication.

Retour au [dossier « Comprendre les modèles post-LLM »](/ia/comprendre-modeles-post-llm). Voir aussi les fiches sœurs : [Qu'est-ce que le TRM ?](/ia/comprendre-modeles-post-llm/quest-ce-que-le-trm) et [Qu'est-ce que JEPA ?](/ia/comprendre-modeles-post-llm/quest-ce-que-jepa).

→ **[Voir l'analyse complète : après les LLM, ce que TRM, Mamba et JEPA prouvent vraiment](/analyses/apres-les-llm-trm-mamba-jepa)**

## Sources

- [Gu, A. & Dao, T. (2023). Mamba: Linear-Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.](https://arxiv.org/abs/2312.00752)
- [Dao, T. & Gu, A. (2024). Transformers are SSMs. arXiv:2405.21060 (Mamba-2).](https://arxiv.org/abs/2405.21060)
- Lieber et al. (2024). Jamba: A Hybrid Transformer-Mamba Language Model (AI21 Labs).
- [Étude de reclassement de documents comparant Mamba et Transformers. arXiv:2412.14354.](https://arxiv.org/abs/2412.14354)

---

Publié sur Probans — https://probans.org/ia/comprendre-modeles-post-llm/quest-ce-que-mamba