在测试阶段,我们首先将DQN、DDQN和Dueling DDQN模型的权重参数固定为训练10000个回合时的参数。然后,我们将这三种模型的固定权重参数进行集成,并在输出端增加集成层,从而形成集成深度强化学习模型。我们记录了这三种网络模型和集成深度强化学习模型在仿真环境中运行100个回合的车辆驾驶行为决策数据。如图10和表4所示,图10展示了不同模型在100个测试回合内的驾驶行为统计情况,而表4则展示了不同模型的驾驶行为决策成功率、车辆平均车速和平均耗时等数据。其中,驾驶行为决策成功率定义为成功测试回合与总测试回合之比,当仿真回合终止条件为(3)时,则表示一个成功的测试回合。


原文地址: https://www.cveoy.top/t/topic/mTiX 著作权归作者所有。请勿转载和采集!

免费AI点我,无需注册和登录