软件学报

北大核心,INSPEC,JST,Pж(AJ),EI

国内刊号:11-2560/TP

国际刊号:1000-9825

软件学报杂志2022年第4期:基于预测编码的样本自适应行动策略规划

发布日期:

作者:梁星星,马扬,冯旸赫,张驭龙,张龙飞,廖世江,刘忠

单位:梁星星,国防科技大学 系统工程学院, 湖南 长沙 41007211,马扬,国防科技大学 系统工程学院, 湖南 长沙 41007202,冯旸赫,国防科技大学 系统工程学院, 湖南 长沙 41007203,张驭龙,国防科技大学 系统工程学院, 湖南 长沙 410072;31002部队04,张龙飞,国防科技大学 系统工程学院, 湖南 长沙 41007205,廖世江,国防科技大学 系统工程学院, 湖南 长沙 41007206,刘忠,国防科技大学 系统工程学院, 湖南 长沙 41007207

关键词:行动规划;强化学习;兵棋推演;预测编码;样本自适应

基金:国家自然科学基金(71701205)

军事行动、反恐突击等强对抗场景中,实时信息的碎片化、不确定性对制定具有博弈优势的弹性行动方案提出了更高的要求,研究具有自学习能力的智能行动策略规划方法已成为编队级强对抗任务的核心问题.针对复杂场景下行动策略规划状态表征困难、数据效率低下等问题,提出了基于预测编码的样本自适应行动策略规划方法.利用自编码模型压缩表示任务的原始状态空间,通过任务环境的状态转移样本,在低维度状态空间中使用混合密度分布网络对任务环境的动态模型进行学习,获得了表征环境动态性的预测编码;基于预测编码展开行动策略规划研究,利用时间差分敏感的样本自适应方法对状态评估值函数进行预测,改善了数据效率,加速了算法收敛.为了验证算法的有效性,基于全国兵棋推演大赛机机挑战赛的想定,构建了包含大赛获奖选手操作策略的5种规则智能体,利用消融实验验证编码方式、样本采样策略等不同因子组合对算法的影响,并使用Elo评分机制对各个智能体进行排序;实验结果表明:基于预测编码的样本自适应算法——MDN-AF得分排序最高,对战平均胜率为71%,其中大比分获胜局占比为67.6%,而且学习到了自主波次划分、补充侦察策略、“蛇形”打击策略、轰炸机靠后突袭等4种长时行动策略.该算法框架应用于2020年全国兵棋推演大赛的智能体开发,并获得了全国一等奖.

来源:2022年第4期

《软件学报》期刊编辑部

查看软件学报杂志2022年第4期

联系我们

  • 地址:北京8718信箱
  • 电话:010-62562563
  • E-mail:jos (a) iscas. ac. cn

咨询工作人员