safe-rl-uses-cvar-constrained-optimization
IN premise — entries/2026/06/21/wiki-Reinforcement_learning-chunk-3.md
Created 2026-06-21T09:55:52+00:00
Safe RL optimizes policies while respecting safety constraints using CVaR or constrained optimization, but CVaR optimization requires care to avoid gradient bias and 'blindness to success'