Jamba : la première architecture hybride Mamba-Transformer de qualité production
L'essentiel
Un modèle hybride n'élimine pas l'attention, il l'alterne avec des blocs Mamba. AI21 Labs a été le premier à en faire un choix d'ingénierie arbitré, pas une hypothèse de recherche.
Un article précédent de ce dossier explique ce qu’est Mamba : une architecture qui remplace le mécanisme d’attention par un état interne de taille fixe, pour garder un coût de calcul linéaire plutôt que quadratique sur les contextes longs. Cette fiche ne reprend pas cette explication. Elle répond à une autre question, plus concrète : à quoi ressemble un modèle qui utilise réellement Mamba en production, et qu’est-ce que ça change par rapport à un remplacement pur et simple du Transformer ?
Hybride ne veut pas dire “à la place de”
Ce que les données établissent. Jamba, présenté par AI21 Labs en 2024, est le premier modèle hybride Mamba-Transformer de qualité production. Le point à ne pas manquer : une architecture hybride ne remplace pas entièrement l’attention par Mamba. Elle alterne, dans le même réseau, des blocs Mamba et des blocs d’attention classique. Certaines couches du modèle traitent le texte avec le balayage séquentiel de Mamba, d’autres continuent d’utiliser l’attention traditionnelle.
Mon interprétation. Ce choix a une logique simple une fois qu’on la regarde en face : les deux mécanismes n’ont pas les mêmes forces. Mamba est efficient sur le contexte long, avec un coût de calcul qui reste linéaire quand le texte s’allonge. L’attention, elle, reste meilleure sur certaines tâches précises, notamment celles qui demandent de retrouver une information exacte plus tôt dans un texte long. Un modèle purement Mamba sacrifierait cette qualité-là. Un modèle purement Transformer resterait coûteux sur le contexte long. L’architecture hybride est un compromis d’ingénierie assumé, pas une demi-mesure : elle vise à cumuler les deux avantages plutôt qu’à trancher entre eux.
Le chiffre qui rend ce compromis concret
Ce que les données établissent. Jamba affiche un débit environ trois fois supérieur sur les contextes longs, comparé à un modèle Transformer de taille comparable. C’est un gain mesuré sur un modèle réellement déployé, pas sur un prototype de laboratoire isolé de toute contrainte de production.
Mon interprétation. Ce x3 mérite d’être resitué : ce n’est pas le gain maximal qu’on peut associer à Mamba dans l’absolu (l’article sur Mamba lui-même rapporte un chiffre plus élevé annoncé par le papier fondateur, dans des conditions de mesure différentes), c’est le gain obtenu une fois que l’architecture a fait des compromis pour rester hybride. Un x3 obtenu par un modèle qui alterne les deux mécanismes est, à ce titre, un signal plus directement transposable à un usage réel qu’un chiffre issu d’une architecture Mamba pure testée en conditions de laboratoire.
Jamba n’est pas un cas isolé
Ce que les données établissent. D’autres laboratoires ont fait le même arbitrage depuis. Codestral Mamba (Mistral, 2024) est un modèle hybride spécialisé dans la génération de code. IBM Granite 4.0 (2024) intègre également une architecture hybride de ce type.
Mon interprétation. C’est ce faisceau de décisions convergentes, prises par des laboratoires différents avec des contraintes commerciales différentes, qui change la nature de l’affirmation “Mamba est déjà déployé”. Un seul modèle hybride pourrait être un pari isolé d’un laboratoire en particulier. Trois laboratoires distincts qui arrivent au même compromis d’architecture, à des dates rapprochées, ressemble davantage à un choix d’ingénierie qui s’impose face à un problème commun : le coût du contexte long sur les Transformers classiques.
Ce que l’utilisateur final ne voit jamais
Mon interprétation. Le point le plus contre-intuitif de ce dossier reste celui-ci : rien de tout cela n’est visible depuis l’interface d’un produit. Personne n’utilise “Jamba” en tapant son nom dans une barre d’adresse, comme on utiliserait ChatGPT ou Claude. Si un fournisseur de LLM choisit une architecture hybride Mamba-Transformer pour son modèle, l’utilisateur ne verra ni mention, ni case à cocher, ni changement visible dans l’interface. Ce qui change, c’est ce qui se passe en coulisses : le coût de calcul pour faire tourner le modèle sur un contexte long, et éventuellement la vitesse de réponse. L’arbitrage architectural est déjà tranché ; il reste simplement invisible dans le produit fini, comme un choix de fondations qu’on ne voit jamais une fois l’immeuble construit.
Une architecture hybride n’est pas un compromis bancal entre deux logiques : c’est un choix d’ingénierie déjà arbitré par plusieurs laboratoires, invisible dans le produit, mais mesurable dans son coût de calcul.
Mes réserves
- Le gain de débit n’est pas universel. Une étude de reclassement de documents (arXiv:2412.14354) trouve un débit d’entraînement inférieur pour Mamba par rapport à un Transformer sur cette tâche précise. L’architecture hybride ne garantit donc pas un gain de débit dans toutes les configurations, seulement sur les tâches et longueurs de contexte où le mécanisme joue en sa faveur.
- Plusieurs études indépendantes mesurent, sur des architectures de ce type, une utilisation du GPU (MFU) inférieure à celle obtenue avec des Transformers optimisés — un coût d’efficience matérielle qui ne se lit pas directement dans le chiffre de débit mis en avant.
- Le chiffre de débit x3 de Jamba provient de la publication d’AI21 Labs elle-même, tout comme les architectures de Codestral Mamba et Granite 4.0 sont documentées par leurs éditeurs respectifs (Mistral, IBM). Ce sont des sources primaires issues des laboratoires qui ont un intérêt commercial à ce résultat ; je ne les ai pas recoupées avec un benchmark indépendant tiers avant publication.
Concrètement, la question à poser à un fournisseur de LLM n’est plus “utilisez-vous Mamba” mais “sur quelles couches, pour quelle tâche” — une architecture hybride se juge par tâche et par longueur de contexte, pas comme une supériorité générale et uniforme sur toute la ligne.
Retour au dossier « Comprendre les modèles post-LLM ». Voir aussi Qu’est-ce que Mamba ?.
Lexique
- Transformer↗
- Architecture de réseau de neurones fondée sur le mécanisme d'attention, à la base des grands modèles de langage actuels.

Analyse les sujets qui l'intéressent et publie ce qu'il en tire, avec méthodologie, sans jargon inutile. Choix du sujet, validation finale du plan, direction de la rédaction, validation ou modification des sources, validation et retravail du texte et des éléments d'illustration par l'auteur Axel Morel. Rédaction, choix des sources initiales, création du plan de rédaction initial par l'IA.
En savoir plus