国内刊号:11-2560/TP
国际刊号:1000-9825
发布日期:
作者:余超,董银昭,郭宪,冯旸赫,卓汉逵,张强
单位:余超,中山大学计算机学院, 广东 广州 51000611,董银昭,大连理工大学 计算机科学与技术学院, 辽宁 大连 11608102,郭宪,南开大学 人工智能学院, 天津 30035403,冯旸赫,国防科技大学 系统工程学院, 湖南 长沙 41007304,卓汉逵,中山大学计算机学院, 广东 广州 51000605,张强,大连理工大学 计算机科学与技术学院, 辽宁 大连 11608106
关键词:机器人控制;深度强化学习;结构分解;可解释性
基金:国家自然科学基金(U1908214, 62076259); 腾讯犀牛鸟基金(JR202063)
针对深度强化学习在高维机器人行为控制中训练效率低下和策略不可解释等问题, 提出一种基于结构交互驱动的机器人深度强化学习方法(structure-motivated interactive deep reinforcement learning, SMILE).首先, 利用结构分解方法将高维的单机器人控制问题转化为低维的多关节控制器协同学习问题, 从而缓解连续运动控制的维度灾难难题; 其次, 通过两种协同图模型(ATTENTION和PODT)动态推理控制器之间的关联关系, 实现机器人内部关节的信息交互和协同学习; 最后, 为了平衡ATTENTION和PODT协同图模型的计算复杂度和信息冗余度, 进一步提出两种协同图模型更新方法APDODT和PATTENTION, 实现控制器之间长期关联关系和短期关联关系的动态自适应调整. 实验结果表明, 基于结构驱动的机器人强化学习方法能显著提升机器人控制策略学习效率. 此外, 基于协同图模型的关系推理及协同机制, 可为最终学习策略提供更为直观和有效的解释.
来源:2023年第4期
《软件学报》期刊编辑部