国内刊号:11-2560/TP
国际刊号:1000-9825
发布日期:
作者:徐平安,刘全,郝少璞,张立华
单位:徐平安,苏州大学 计算机科学与技术学院, 江苏 苏州 21500611,刘全,苏州大学 计算机科学与技术学院, 江苏 苏州 215006;软件新技术与产业化协同创新中心(南京), 江苏 南京 210093;符号计算与知识工程教育部重点实验室 (吉林大学), 吉林 长春 130012;江苏省计算机信息处理技术重点实验室 (苏州大学), 江苏 苏州 21500602,郝少璞,苏州大学 计算机科学与技术学院, 江苏 苏州 21500603,张立华,苏州大学 计算机科学与技术学院, 江苏 苏州 21500604
关键词:深度强化学习;元启发式算法;引力搜索;确定策略梯度;策略搜索
基金:国家自然科学基金(61772355, 61702055, 61876217, 62176175); 江苏高校优势学科建设工程
近年来, 深度强化学习在复杂控制任务中取得了令人瞩目的效果, 然而由于超参数的高敏感性和收敛性难以保证等原因, 严重影响了其对现实问题的适用性. 元启发式算法作为一类模拟自然界客观规律的黑盒优化方法, 虽然能够有效避免超参数的敏感性, 但仍存在无法适应待优化参数量规模巨大和样本使用效率低等问题. 针对以上问题, 提出融合引力搜索的双延迟深度确定策略梯度方法(twin delayed deep deterministic policy gradient based on gravitational search algorithm, GSA-TD3). 该方法融合两类算法的优势: 一是凭借梯度优化的方式更新策略, 获得更高的样本效率和更快的学习速度; 二是将基于万有引力定律的种群更新方法引入到策略搜索过程中, 使其具有更强的探索性和更好的稳定性. 将GSA-TD3应用于一系列复杂控制任务中, 实验表明, 与前沿的同类深度强化学习方法相比, GSA-TD3在性能上具有显著的优势.
来源:2023年第11期
《软件学报》期刊编辑部