← Lexique
ia

Quantification (IA)· Quantization

Technique réduisant la précision numérique des paramètres d'un modèle pour diminuer son coût de calcul.

ExempleLlama 3 70B réduit ses paramètres de 16 bits à 4 bits par quantification : le modèle passe de 140 Go à 35 Go en mémoire, permettant une inférence sur un seul GPU grand public.

En clairPour tenir sur une machine plus modeste, on arrondit les réglages internes du modèle. Il devient plus léger et plus rapide, au prix d'un peu de précision. Le compromis est souvent avantageux, mais il se mesure : un modèle allégué équivalent à sa version complète doit le prouver sur vos propres cas, pas sur un classement général.

Aucun article publié pour ce terme

Newsletter

Recevoir les prochaines analyses

Choisissez les catégories qui vous intéressent.

Catégories