Probans
← Lexique
ia

RLHF· Reinforcement Learning from Human Feedback

Méthode d'entraînement affinant un modèle à partir de préférences exprimées par des évaluateurs humains.

ExempleChatGPT a été affiné par RLHF : des évaluateurs ont classé des réponses candidates, entraînant un modèle de récompense dont le signal guide l'optimisation du LLM vers des réponses jugées utiles et sûres.

Aucun article publié pour ce terme

Newsletter

Recevoir les prochaines analyses

Choisissez les catégories qui vous intéressent.

Catégories