deepseek-r1-rl-without-sft

IN premiseentries/2026/06/21/wiki-Reinforcement_learning-chunk-4.md

Created 2026-06-21T09:55:53+00:00

DeepSeek-R1 uses large-scale RL without supervised fine-tuning (SFT) as a preliminary step and achieves reasoning performance comparable to OpenAI-o1-1217

Dependents

These beliefs depend on this one: