软件学报

北大核心,INSPEC,JST,Pж(AJ),EI

国内刊号:11-2560/TP

国际刊号:1000-9825

软件学报杂志2020年第4期:基于自回归预测模型的深度注意力强化学习方法

发布日期:

作者:梁星星,冯旸赫,黄金才,王琦,马扬,刘忠

单位:梁星星,国防科技大学 系统工程学院, 湖南 长沙 41007211,冯旸赫,国防科技大学 系统工程学院, 湖南 长沙 41007202,黄金才,国防科技大学 系统工程学院, 湖南 长沙 41007203,王琦,国防科技大学 系统工程学院, 湖南 长沙 41007204,马扬,国防科技大学 系统工程学院, 湖南 长沙 41007205,刘忠,国防科技大学 系统工程学院, 湖南 长沙 41007206

关键词:注意力机制;深度强化学习;actor-critic算法;变分自动编码;混合密度网络-循环神经网络

基金:国家自然科学基金(71701205)

近年来,深度强化学习在各种决策、规划问题中展示了强大的智能性和良好的普适性,出现了诸如AlphaGo、OpenAI Five、Alpha Star等成功案例.然而,传统深度强化学习对计算资源的重度依赖及低效的数据利用率严重限制了其在复杂现实任务中的应用.传统的基于模型的强化学习算法通过学习环境的潜在动态性,可充分利用样本信息,有效提升数据利用率,加快模型训练速度,但如何快速建立准确的环境模型是基于模型的强化学习面临的难题.结合基于模型和无模型两类强化学习的优势,提出了一种基于时序自回归预测模型的深度注意力强化学习方法.利用自编码模型压缩表示潜在状态空间,结合自回归模型建立环境预测模型,基于注意力机制结合预测模型估计每个决策状态的值函数,通过端到端的方式统一训练各算法模块,实现高效的训练.通过CartPole-V0等经典控制任务的实验结果表明,该模型能够高效地建立环境预测模型,并有效结合基于模型和无模型两类强化学习方法,实现样本的高效利用.最后,针对导弹突防智能规划问题进行了算法实证研究,应用结果表明,采用所提出的学习模型可在特定场景取得优于传统突防规划的效果.

来源:2020年第4期

《软件学报》期刊编辑部

查看软件学报杂志2020年第4期

联系我们

  • 地址:北京8718信箱
  • 电话:010-62562563
  • E-mail:jos (a) iscas. ac. cn

咨询工作人员