☰
RL-10-赵-Actor-Critic01-在线算法01:QAC【Actor:Policy函数拟合算法】【Critic:Sarsa算法】【π>0,具有探索性】【Q表示action value】
2026/9/29 10:42:52 网站建设 项目流程



我们知道基于Monte-Carlo的Policy Gradient算法如下图所示:


我们将估计action values的方法换成“Temporal-difference learning”,现在给出第一个Actor-Critic算法:QAC

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询