TécnicoEntrenamiento de modelos
Aprendizaje por refuerzo con retroalimentación humana
Reinforcement learning from human feedbackRLHF
También: Reinforcement learning from human feedback, RLHF
Método que ajusta un modelo usando preferencias humanas como señal para favorecer unas respuestas sobre otras.
Definición técnica
Pipeline de postentrenamiento que aprende una señal de recompensa a partir de comparaciones humanas y optimiza una política bajo restricciones de desviación.