Transformer
Architecture de réseau de neurones fondée sur le mécanisme d'attention, à la base des grands modèles de langage actuels.
ExempleIntroduit par Google en 2017 dans 'Attention is All You Need', le transformer est l'architecture sous-jacente à GPT, BERT, Claude et la quasi-totalité des LLM actuels.
3 articles utilisant ce terme
Que coûte à Mamba son état de taille fixe ?
Ce que j'appelle une taxe de compression : l'état de taille fixe qui rend le contexte long moins cher est lié à une capacité limitée à retrouver une information mentionnée une seule fois. Une architecture à état sélectif, déjà en production, pensée pour réduire le coût du contexte long face aux Transformers.
L'attention d'un Transformer : 42 Go de cache pour un contexte de 128 000 tokens
Le mécanisme qui a rendu les Transformers redoutables sur le texte a un coût qui grossit plus vite que le contexte lui-même : précisément le problème que Mamba a été conçu pour contourner.
Jamba alterne Mamba et attention : un débit x3 annoncé par AI21 Labs
Un modèle hybride n'élimine pas l'attention : il la combine avec des blocs Mamba, en alternance dans la plupart des cas recensés ici, parfois en parallèle dans une même couche (Hymba). AI21 Labs en a fait un choix d'ingénierie arbitré, pas une hypothèse de recherche.