复写:DDPG是确定性策略梯度算法Deep Deterministic Policy Gradient可以分成包括Deep-深度网络和Deterministic Policy Gradient-确定性策略梯度。确定性策略和随机策略相对应其中随机性策略对于同样状态采取一个基于概率分布的动作即动作实际上是不确定的。但是对于确定性策略来说可以在同一个状态生成相同的策略也就是会产生相同的动作。
DDPG是Deep Deterministic Policy Gradient的缩写,是一种确定性策略梯度算法。它由两个主要组成部分组成:Deep(深度网络)和Deterministic Policy Gradient(确定性策略梯度)。
相对于随机策略,确定性策略在同一状态下生成相同的策略,即采取相同的动作。随机策略则根据概率分布来选择不确定的动作。
原文地址: https://www.cveoy.top/t/topic/fcIY 著作权归作者所有。请勿转载和采集!