RLHF· Reinforcement Learning from Human Feedback
Méthode d'entraînement affinant un modèle à partir de préférences exprimées par des évaluateurs humains.
ExempleChatGPT a été affiné par RLHF : des évaluateurs ont classé des réponses candidates, entraînant un modèle de récompense dont le signal guide l'optimisation du LLM vers des réponses jugées utiles et sûres.
En clairC'est l'étape où des personnes comparent des réponses et indiquent laquelle est préférable, ce qui apprend au modèle un ton et des refus. Deux conséquences peu discutées : ce que le système juge acceptable reflète le jugement de ces évaluateurs, et un modèle entraîné à plaire a tendance à donner raison à son interlocuteur.