← Lexique
ia

RLHF· Reinforcement Learning from Human Feedback

Méthode d'entraînement affinant un modèle à partir de préférences exprimées par des évaluateurs humains.

ExempleChatGPT a été affiné par RLHF : des évaluateurs ont classé des réponses candidates, entraînant un modèle de récompense dont le signal guide l'optimisation du LLM vers des réponses jugées utiles et sûres.

En clairC'est l'étape où des personnes comparent des réponses et indiquent laquelle est préférable, ce qui apprend au modèle un ton et des refus. Deux conséquences peu discutées : ce que le système juge acceptable reflète le jugement de ces évaluateurs, et un modèle entraîné à plaire a tendance à donner raison à son interlocuteur.

Aucun article publié pour ce terme

Newsletter

Recevoir les prochaines analyses

Choisissez les catégories qui vous intéressent.

Catégories