safe-rl-uses-cvar-constrained-optimization

IN premiseentries/2026/06/21/wiki-Reinforcement_learning-chunk-3.md

Created 2026-06-21T09:55:52+00:00

Safe RL optimizes policies while respecting safety constraints using CVaR or constrained optimization, but CVaR optimization requires care to avoid gradient bias and 'blindness to success'