软件学报

北大核心,INSPEC,JST,Pж(AJ),EI

国内刊号:11-2560/TP

国际刊号:1000-9825

软件学报杂志2023年第11期:融合引力搜索的双延迟深度确定策略梯度方法

发布日期:

作者:徐平安,刘全,郝少璞,张立华

单位:徐平安,苏州大学 计算机科学与技术学院, 江苏 苏州 21500611,刘全,苏州大学 计算机科学与技术学院, 江苏 苏州 215006;软件新技术与产业化协同创新中心(南京), 江苏 南京 210093;符号计算与知识工程教育部重点实验室 (吉林大学), 吉林 长春 130012;江苏省计算机信息处理技术重点实验室 (苏州大学), 江苏 苏州 21500602,郝少璞,苏州大学 计算机科学与技术学院, 江苏 苏州 21500603,张立华,苏州大学 计算机科学与技术学院, 江苏 苏州 21500604

关键词:深度强化学习;元启发式算法;引力搜索;确定策略梯度;策略搜索

基金:国家自然科学基金(61772355, 61702055, 61876217, 62176175); 江苏高校优势学科建设工程

近年来, 深度强化学习在复杂控制任务中取得了令人瞩目的效果, 然而由于超参数的高敏感性和收敛性难以保证等原因, 严重影响了其对现实问题的适用性. 元启发式算法作为一类模拟自然界客观规律的黑盒优化方法, 虽然能够有效避免超参数的敏感性, 但仍存在无法适应待优化参数量规模巨大和样本使用效率低等问题. 针对以上问题, 提出融合引力搜索的双延迟深度确定策略梯度方法(twin delayed deep deterministic policy gradient based on gravitational search algorithm, GSA-TD3). 该方法融合两类算法的优势: 一是凭借梯度优化的方式更新策略, 获得更高的样本效率和更快的学习速度; 二是将基于万有引力定律的种群更新方法引入到策略搜索过程中, 使其具有更强的探索性和更好的稳定性. 将GSA-TD3应用于一系列复杂控制任务中, 实验表明, 与前沿的同类深度强化学习方法相比, GSA-TD3在性能上具有显著的优势.

来源:2023年第11期

《软件学报》期刊编辑部

查看软件学报杂志2023年第11期

联系我们

  • 地址:北京8718信箱
  • 电话:010-62562563
  • E-mail:jos (a) iscas. ac. cn

咨询工作人员