rlhf-reward-model-scaling-vs-data
OUT premise — entries/2026/06/21/wiki-Reinforcement_learning_from_human_feedback-chunk-1.md
Created 2026-06-21T09:50:10+00:00
In RLHF, scaling up reward model size is more effective than scaling up data volume for improving performance