Optimalizácia politík v reinforcement learningu: Stanford pohľad
Optimalizácia politík v reinforcement learningu priamo ladí parametre politiky agenta pre maximalizáciu odmeny. Prednáška zo Stanfordu vysvetlila gradientný výstup, vzorec gradientu politiky a riešenia variability, vrátane AlphaGo.