optimizer-hierarchy-speed-vs-cost
IN premise — entries/2026/06/21/wiki-Gradient_descent-chunk-5.md
Created 2026-06-21T09:55:50+00:00
The optimizer hierarchy in terms of convergence speed vs per-iteration cost is: gradient descent → momentum → Nesterov → quasi-Newton (BFGS)