Jamba alterne Mamba et attention : un débit x3 annoncé par AI21 Labs
Axel Morel · Fondateur & analyste, ProbansL'essentiel
Un modèle hybride n'élimine pas l'attention : il la combine avec des blocs Mamba, en alternance dans la plupart des cas recensés ici, parfois en parallèle dans une même couche (Hymba). AI21 Labs en a fait un choix d'ingénierie arbitré, pas une hypothèse de recherche.
- Un hybride n'élimine pas l'attention, il l'alterne avec Mamba. Jamba, présenté par AI21 Labs en mars 2024, alterne dans le même réseau des blocs Mamba et des blocs d'attention classique. Le modèle publié compte 52 milliards de paramètres au total, dont 12 milliards actifs par requête grâce à un mélange d'experts, une fenêtre de contexte de 256 000 tokens, et des poids publiés sous licence Apache 2.0.
- Le x3 vient du fabricant, pas d'un tiers. Selon la mesure publiée par AI21 Labs elle-même, Jamba affiche un débit environ trois fois supérieur sur les contextes longs face à Mixtral 8x7B, un modèle Transformer à mixture d'experts de taille comparable, pas à un Transformer générique non identifié, un chiffre non reproduit à l'identique par un tiers indépendant.
- Chaque laboratoire combine les deux mécanismes autrement. Zyphra (Zamba) partage un seul bloc d'attention entre plusieurs couches du réseau plutôt que d'en dédier un à chacune, pour limiter le surcoût mémoire. Dans Hymba, des têtes d'attention et des têtes Mamba tournent en parallèle dans la même couche, plutôt qu'en couches alternées comme chez Jamba, Bamba ou Zamba.
Un article précédent de ce dossier explique ce qu’est Mamba : une architecture qui remplace le mécanisme d’attention par un état interne de taille fixe, pour garder un coût de calcul linéaire plutôt que quadratique sur les contextes longs. Pour mémoire en une phrase : un bloc d’attention relit tout le texte déjà généré à chaque nouveau mot, un bloc Mamba se contente de mettre à jour un état interne de taille fixe, sans relire. Je ne reviens pas plus loin sur cette mécanique : je réponds ici à une autre question, plus concrète. À quoi ressemble un modèle qui utilise réellement Mamba en production, et qu’est-ce que ça change par rapport à un remplacement pur et simple du Transformer ?
Hybride ne veut pas dire “à la place de”
Ce que les données établissent. Jamba, présenté par AI21 Labs en mars 2024, alterne dans le même réseau des blocs Mamba et des blocs d’attention classique. Certaines couches du modèle traitent le texte avec le balayage séquentiel de Mamba, d’autres continuent d’utiliser l’attention traditionnelle. Le modèle publié compte 52 milliards de paramètres au total, dont 12 milliards actifs par requête grâce à un mélange d’experts, une fenêtre de contexte de 256 000 tokens, et des poids publiés sous licence Apache 2.0.
Ce que la méthode interprète. AI21 Labs revendique elle-même explicitement, dans son annonce, que Jamba est « the world’s first production-grade Mamba based model » : ce n’est donc pas une inférence prudente tirée des dates de publication, mais une auto-revendication directe du fabricant, pas un fait établi par un tiers indépendant. Le papier fondateur de Jamba date de mars 2024 ; les autres architectures hybrides mentionnées plus loin dans cette fiche (Bamba, Granite 4.0, Zamba, Hymba, Nemotron-H) sont toutes documentées par des publications postérieures, ce qui est cohérent avec cette antériorité sans la démontrer par une source tierce. Si un hybride antérieur destiné à la production existe hors de cette cartographie, l’antériorité revendiquée par AI21 tomberait. Ce choix d’architecture a par ailleurs une logique simple une fois qu’on la regarde en face : les deux mécanismes n’ont pas les mêmes forces. Mamba est efficient sur le contexte long, avec un coût de calcul qui reste linéaire quand le texte s’allonge. L’attention, elle, reste réputée meilleure sur certaines tâches précises, notamment celles qui demandent de retrouver une information exacte plus tôt dans un texte long (point détaillé, sources à l’appui, dans la fiche « Qu’est-ce que Mamba ? » de ce dossier). Un modèle purement Mamba sacrifierait cette qualité-là. Un modèle purement Transformer resterait coûteux sur le contexte long. L’architecture hybride est un compromis d’ingénierie assumé, pas une demi-mesure : elle vise à cumuler les deux avantages plutôt qu’à trancher entre eux.
Le chiffre qui rend ce compromis concret
Ce que le fournisseur revendique. Selon la mesure publiée par AI21 Labs elle-même, Jamba affiche un débit environ trois fois supérieur sur les contextes longs face à Mixtral 8x7B, un modèle Transformer à mixture d’experts de taille comparable, pas à un Transformer générique non identifié, un chiffre non reproduit à l’identique par un tiers indépendant (voir plus loin). C’est un gain mesuré sur un modèle réellement déployé, pas sur un prototype de laboratoire isolé de toute contrainte de production.
Ce que la méthode interprète. Ce x3 mérite d’être resitué : ce n’est pas le gain maximal qu’on peut associer à Mamba dans l’absolu (l’article sur Mamba lui-même rapporte un chiffre plus élevé annoncé par le papier fondateur, dans des conditions de mesure différentes), c’est le gain obtenu une fois que l’architecture a fait des compromis pour rester hybride. Un x3 obtenu par un modèle qui alterne les deux mécanismes est, à ce titre, un signal plus directement transposable à un usage réel qu’un chiffre issu d’une architecture Mamba pure testée en conditions de laboratoire.
Ce qui recoupe ce chiffre, et à quel titre. Le x3 reste une mesure publiée par AI21 Labs elle-même. Deux éléments extérieurs permettent de le resituer sans le prendre pour acquis. Artificial Analysis, cabinet de benchmarking tiers sans lien avec AI21, a chronométré en conditions réelles le débit de sortie de Jamba 1.5 Mini sur 10 000 tokens de contexte, mais sans classement comparatif publié face à d’autres modèles : cette page compare les fournisseurs qui hébergent Jamba entre eux, pas Jamba à un Transformer. NVIDIA revendique de son côté pour sa propre famille hybride Nemotron-H un gain « jusqu’à 3 fois » à l’inférence face à des Transformers comparables.
Ce que la méthode interprète. Ni l’un ni l’autre ne réplique le chiffre précis de Jamba : Artificial Analysis ne teste pas le multiplicateur x3, et Nemotron-H est un modèle différent mesuré par son propre éditeur. Le premier élément confirme seulement qu’un tiers indépendant a bien chronométré Jamba, sans le comparer à un concurrent. Le second dit qu’un autre laboratoire, sur une autre architecture hybride, revendique le même ordre de grandeur. Il faut le prendre pour ce qu’il est : NVIDIA mesure son propre modèle et vend le matériel d’inférence sur lequel ce gain se constate, elle a donc un intérêt direct à ce que le chiffre soit élevé. Ce n’est pas un recoupement tiers, c’est une seconde revendication d’acteur intéressé, sur une architecture voisine. Ce qu’elle vaut tient à ce qu’elle ne vient pas du même produit ni du même vendeur : deux acteurs qui se disputent le même marché de l’inférence avancent des chiffres proches pour la même famille d’architecture, sans être de même nature : le « jusqu’à 3 fois » de NVIDIA est un plafond revendiqué, quand le « environ trois fois » d’AI21 est présenté comme une mesure représentative. C’est le niveau de preuve réaliste pour ce type de chiffre commercial, un signal partiel plutôt qu’une vérité établie par un audit extérieur. Ce niveau de preuve n’est d’ailleurs valable qu’à l’inférence : voir plus loin la mesure MFU de NVIDIA elle-même, qui ne retrouve pas cet avantage à l’entraînement.
Jamba n’est pas un cas isolé, en une phrase
Le choix d’alterner Mamba et attention plutôt que de trancher entre les deux n’est pas resté propre à AI21, et chaque laboratoire l’a réinterprété différemment. IBM Research (Bamba, précurseur direct de Granite 4.0) alterne attention et Mamba2 selon un ratio favorable à Mamba ; le ratio précis de 4 couches d’attention pour 36 couches Mamba2 est celui documenté pour Granite 4.0 H-Small, le modèle dérivé de Bamba, pas celui rapporté par IBM sur Bamba lui-même. Zyphra (Zamba) partage un seul bloc d’attention entre plusieurs couches du réseau plutôt que d’en dédier un à chacune, pour limiter le surcoût mémoire. NVIDIA (Hymba) va plus loin : dans Hymba, des têtes d’attention et des têtes Mamba tournent en parallèle dans la même couche, chaque type de tête gardant son rôle propre (rappel précis pour l’attention, résumé de contexte pour Mamba), plutôt qu’en couches alternées comme chez Jamba, Bamba ou Zamba. Le détail complet de chacune dépasse le cadre de cette fiche : ce qui compte ici, c’est que l’arbitrage lui-même, pas seulement son résultat chiffré, s’est reproduit chez plusieurs organisations aux contraintes commerciales distinctes, avec des façons de combiner attention et Mamba à chaque fois différentes (alternance chez Jamba, Bamba et Zamba ; exécution en parallèle chez Hymba).
Ce que l’utilisateur final ne voit jamais
Ce que la méthode interprète. Rien de tout cela n’est visible depuis l’interface d’un produit. Personne n’utilise “Jamba” en tapant son nom dans une barre d’adresse, comme on utiliserait ChatGPT ou Claude. Si un fournisseur de LLM choisit une architecture hybride Mamba-Transformer pour son modèle, l’utilisateur ne verra ni mention, ni case à cocher, ni changement visible dans l’interface. Ce qui change, c’est ce qui se passe en coulisses : le coût de calcul pour faire tourner le modèle sur un contexte long, et éventuellement la vitesse de réponse. Un choix de fondations qu’on ne voit jamais une fois l’immeuble construit.
Une architecture hybride n’est pas un compromis bancal entre deux logiques : c’est un choix d’ingénierie déjà arbitré par plusieurs laboratoires, invisible dans le produit, mais mesurable dans son coût de calcul.
Mes réserves
- Le gain de débit n’est pas universel. Une étude de reclassement de documents (arXiv:2412.14354) trouve Mamba pur, sans blocs d’attention, moins efficace à l’entraînement et à l’inférence qu’un Transformer avec flash attention, sur cette tâche précise. Ce résultat porte sur Mamba seul, pas sur une architecture hybride : rien n’indique s’il tient encore une fois des blocs d’attention réintroduits, comme chez Jamba. Il rappelle en tout cas que le gain de débit ne se transpose pas automatiquement à toute tâche ou toute configuration.
- Le gain ne se lit pas pareil à l’entraînement et à l’inférence. Une étude empirique de NVIDIA (arXiv:2406.07887) mesure la MFU (utilisation du GPU à l’entraînement) sur un hybride Mamba-2/Transformer de 8 milliards de paramètres : 29,9 %, contre 30,7 % pour un Transformer comparable. L’écart est faible, moins d’un point, mais il va dans le sens inverse du gain de débit à l’inférence mis en avant par AI21 et NVIDIA. À l’entraînement, l’hybride testé reste à peu près à parité.
- Le x3 de Jamba provient de la publication d’AI21 Labs elle-même. Il n’a pas été reproduit tel quel par un tiers qui aurait directement chronométré Jamba face à Mixtral 8x7B dans les mêmes conditions ; ce dont je dispose, c’est d’une mesure du débit par un tiers sans lien avec AI21 (Artificial Analysis, sans classement comparatif) et d’une seconde revendication du même ordre de grandeur pour ce type d’architecture par un autre laboratoire (NVIDIA, Nemotron-H), qui mesure son propre modèle et vend le matériel d’inférence associé. Un lecteur qui a besoin du chiffre exact pour un dimensionnement d’infrastructure doit le vérifier sur son propre cas d’usage plutôt que retenir le x3 comme une constante.
Ce qu’il faut demander à un fournisseur de LLM, concrètement
La question “utilisez-vous Mamba” n’est pas la bonne. Quatre questions le sont davantage.
- Le gain annoncé porte-t-il sur l’entraînement ou sur l’inférence ? Les deux ne racontent pas la même histoire. L’écart de MFU mesuré par NVIDIA entre hybride et Transformer reste marginal à l’entraînement, à peine un point. Le gain de débit x3 mis en avant par AI21 pour Jamba porte, lui, sur l’inférence à contexte long.
- Sur quelle tâche et quelle longueur de contexte le gain a été mesuré ? Un gain démontré sur la génération de texte à contexte long ne se transpose pas automatiquement à toute tâche : une étude indépendante de reclassement de documents trouve Mamba pur moins efficace à l’entraînement sur cette tâche (voir plus haut).
- Quel est le coût par token et l’empreinte mémoire du cache d’état à la longueur de contexte visée ? Ni AI21 ni les autres laboratoires cités ici ne publient ces deux métriques de façon comparable entre architectures : elles se demandent directement au fournisseur qui héberge le modèle, pas au multiplicateur de débit affiché en communication.
- Le gain de débit ou de coût s’accompagne-t-il d’une perte de qualité mesurable sur des bancs d’essai standards ? Aucune des sources citées ici ne documente ce compromis pour Jamba : à demander directement au fournisseur, sur ses propres résultats de qualité, pas seulement sur son débit.
Une architecture hybride se juge par tâche et par longueur de contexte, jamais comme une supériorité générale.
Retour au dossier « Comprendre les modèles post-LLM ». Voir aussi Qu’est-ce que Mamba ?.
I source primaire indépendante · S secondaire spécialisée · P partie prenante ayant un intérêt commercial sur le sujet traité.
Lexique
- Transformer↗
- Architecture de réseau de neurones fondée sur le mécanisme d'attention, à la base des grands modèles de langage actuels.
Modification apportée · mis à jour le 4 septembre 2026
Reprise de vérification : le chiffre x3 de Jamba est maintenant attribué explicitement à AI21 Labs plutôt que présenté comme donnée établie, le recoupement AI21/NVIDIA distingue un plafond revendiqué d'une mesure représentative, l'attribution du ratio 4/36 d'IBM est corrigée vers Granite 4.0 H-Small plutôt que le papier Bamba, l'étude arXiv:2412.14354 est recadrée sur Mamba pur et non sur l'architecture hybride, une contradiction interne sur l'alternance chez Hymba est corrigée, une fiche signalétique de Jamba (paramètres, contexte, licence) et une quatrième question sur le compromis qualité sont ajoutées. J'ai ajouté deux encadrés de vulgarisation qui expliquent en langue courante le mécanisme de deux sections, sans rien changer au corps de l'analyse.

Développe une méthode d'analyse destinée à distinguer ce que les preuves établissent, ce qu'elles suggèrent et ce qu'elles ne permettent pas de conclure, puis à traduire cette distinction en décisions professionnelles.
Choix du sujet, direction de la rédaction, validation ou modification des sources, validation et retravail du texte et des illustrations : Axel Morel. Rédaction, choix des sources initiales et plan de rédaction initial : assistance IA.
Responsabilité éditoriale : Axel Morel. Recherche et rédaction assistées par IA selon la méthodologie Probans, sources vérifiées avant publication. Charte éditoriale.
En savoir plus