国内刊号:11-2560/TP
国际刊号:1000-9825
发布日期:
作者:田树聪,谢愈,张远龙,周正春,高阳
单位:田树聪,西南交通大学 信息科学与技术学院, 四川 成都 61175611,谢愈,国防科技大学 智能科学学院, 湖南 长沙 41007302,张远龙,国防科技大学 智能科学学院, 湖南 长沙 41007303,周正春,西南交通大学 信息科学与技术学院, 四川 成都 61175604,高阳,计算机软件新技术国家重点实验室(南京大学), 江苏 南京 21002305
关键词:参数化动作空间;多智能体强化学习;中心化策略梯度分解;多巡航导弹突防
基金:国家自然科学基金(62173336, 92271108)
近年来, 多智能体强化学习方法凭借AlphaStar、AlphaDogFight、AlphaMosaic等成功案例展示出卓越的决策能力以及广泛的应用前景. 在真实环境的多智能体决策系统中, 其任务的决策空间往往是同时具有离散型动作变量和连续型动作变量的参数化动作空间. 这类动作空间的复杂性结构使得传统单一针对离散型或连续型的多智能体强化学习算法不在适用, 因此研究能用于参数化动作空间的多智能体强化学习算法具有重要的现实意义. 提出一种面向参数化动作空间的多智能体中心化策略梯度分解算法, 利用中心化策略梯度分解算法保证多智能体的有效协同, 结合参数化深度确定性策略梯度算法中双头策略输出实现对参数化动作空间的有效耦合. 通过在Hybrid Predator-Prey场景中不同参数设置下的实验结果表明该算法在经典的多智能体参数化动作空间协作任务上具有良好的性能. 此外, 在多巡航导弹协同突防场景中进行算法效能验证, 实验结果表明该算法在多巡航导弹突防这类具有高动态、行为复杂化的协同任务中有效性和可行性.
来源:2025年第2期
《软件学报》期刊编辑部