J
jeremy
Video
Reinforcement Learning With Human Feedback in Large Language Models
Steps through the RLHF pipeline: supervised fine-tuning, collecting ranked human preference data, fitting a reward model, and optimizing the policy with reinforcement learning while a KL term keeps i…