rlhf-trains-reward-model
OUT premise — entries/2026/06/21/wiki-Large_language_model.md
Created 2026-06-21T09:50:09+00:00
RLHF works by training a reward model on human preference comparisons, then fine-tuning the LLM via reinforcement learning to maximize that reward