rlhf-trains-reward-model

OUT premiseentries/2026/06/21/wiki-Large_language_model.md

Created 2026-06-21T09:50:09+00:00

RLHF works by training a reward model on human preference comparisons, then fine-tuning the LLM via reinforcement learning to maximize that reward