ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

RL-10-TD算法-ActorCritic04-连续动作控制04:SAC02【从 Soft Bellman 到现代 SAC 完整训练体系】

RL-10-TD算法-ActorCritic04-连续动作控制04:SAC02【从 Soft Bellman 到现代 SAC 完整训练体系】 :::writing{variant=“document” id=“73164” title=“SAC 技术文档·第二部分:现代 SAC 完整训练、Auto-Alpha、工程实现与算法对比”}第一章 从 Soft Bellman Equation 到真正可训练的 SAC Critic1 现在我们已经有什么第一部分已经得到:Vπ(s)=Ea∼π[Qπ(s,a)−αlog⁡π(a∣s)]V^\pi(s)=\mathbb E_{a\sim\pi}\left[Q^\pi(s,a)-\alpha\log\pi(a|s)\right]V
返回列表