第5部分:DDPG、TD3、SAC数学统一比较 + A2C/PPO/SAC探索机制比较 + SAC完整总结
前面已经完成:
- SAC网络结构;
- Soft Bellman Equation;
- Twin Q Critic Loss;
- Actor Loss数学推导;
- Reparameterization Trick;
- Tanh Gaussian Policy。
本部分从更高层次总结:
DDPG→TD3→SAC DDPG\rightarrow TD3\rightarrow SACDDPG→TD3→SAC
以及:
A2C→PPO→SAC A2C\rightarrow PPO\rightarrow SACA2C→PPO→SAC
之间的关系。
64. DDPG → TD3 → SAC算法演化路线
连续控制强化学习的发展:
65. DDPG核心思想
DDPG:
Deep Deterministic Policy Gradient。
它解决:
连续动作空间无法直接使用Q-Learning。
65.1 DDPG Actor
确定性策略:
a=μθ(s) a=\mu_\theta(s)a=μθ(s)
输入:
s ss
输出:
a aa
65.2 DDPG Critic
学习:
Qϕ(s,a) Q_\phi(s,a)Qϕ(s,a)
目标:
y=r+γQϕ′(s′,μθ′(s′)) y=r+\gamma Q_{\phi'}(s',\mu_{\theta'}(s'))y=r+γQϕ′(s′,μθ′(s′))
65.3 DDPG Loss
Critic:
LQ=12(Qϕ(s,a)−y)2 L_Q=\frac12(Q_\phi(s,a)-y)^2LQ=21(Qϕ(s,a)−y)2
Actor:
Lπ=−Es[Qϕ(s,μθ(s))] L_\pi=-E_s[Q_\phi(s,\mu_\theta(s))]Lπ=−Es[Qϕ(s,μθ(s))]
66. DDPG的问题
66.1 Q值过高估计
DDPG依赖:
Q(s,a) Q(s,a)Q(s,a)
Actor不断寻找:
maxaQ(s,a) \max_aQ(s,a)amaxQ(s,a)
如果:
Qestimate>Qtrue Q_{estimate}>Q_{true}Qestimate