RL-10-TD算法-ActorCritic04-连续动作控制02:DDPG02【在线/目标Actor、在线/目标Critic、Replay Buffer、Noise与深度网络的完整作用】

发布时间:2026/10/7 22:50:48
RL-10-TD算法-ActorCritic04-连续动作控制02:DDPG02【在线/目标Actor、在线/目标Critic、Replay Buffer、Noise与深度网络的完整作用】 第一章 DDPG整体架构与核心思想1.1 DDPG算法简介深度确定性策略梯度(Deep Deterministic Policy Gradient,DDPG)是一种用于解决连续动作控制问题(Continuous Control Problem)的经典深度强化学习算法。DDPG属于:Actor-Critic(行动者-评价者)架构它同时学习两个不同类型的模型:策略模型(Policy Model)负责:根据当前状态决定执行什么动作。对应:Actor网络(Actor Network)数学表示:a=μθ(s)a=\mu_\theta(s)a