软件学报

北大核心,INSPEC,JST,Pж(AJ),EI

国内刊号:11-2560/TP

国际刊号:1000-9825

软件学报杂志2025年第8期:因果时空语义驱动的深度强化学习抽象建模方法

发布日期:

作者:田丽丽,杜德慧,聂基辉,陈逸康,李荥达

单位:田丽丽,华东师范大学 计算机科学与技术学院, 上海200062;华东师范大学 智能教育研究院, 上海 200062;上海市高可信计算重点实验室(华东师范大学), 上海 20006211,杜德慧,华东师范大学 软件工程学院, 上海200062;华东师范大学 智能教育研究院, 上海 200062;上海市高可信计算重点实验室(华东师范大学), 上海 20006202,聂基辉,华东师范大学 软件工程学院, 上海200062;上海市高可信计算重点实验室(华东师范大学), 上海 20006203,陈逸康,华东师范大学 软件工程学院, 上海200062;上海市高可信计算重点实验室(华东师范大学), 上海 20006204,李荥达,华东师范大学 软件工程学院, 上海200062;上海市高可信计算重点实验室(华东师范大学), 上海 20006205

关键词:深度强化学习;抽象建模;因果时空语义;智能信息物理融合系统(ICPS);马尔可夫决策过程(MDP)

随着智能信息物理融合系统(intelligent cyber-physical system, ICPS)的快速发展, 智能技术在感知、决策、规控等方面的应用日益广泛. 其中, 深度强化学习因其在处理复杂的动态环境方面的高效性, 已被广泛用于ICPS的控制组件中. 然而, 由于运行环境的开放性和ICPS系统的复杂性, 深度强化学习在学习过程中需要对复杂多变的状态空间进行探索, 这极易导致决策生成时效率低下和泛化性不足等问题. 目前对于该问题的常见解决方法是将大规模的细粒度马尔可夫决策过程(Markov decision process, MDP)抽象为小规模的粗粒度马尔可夫决策过程, 从而简化模型的计算复杂度并提高求解效率. 但这些方法尚未考虑如何保证原状态的时空语义信息、聚类抽象的系统空间和真实系统空间之间的语义一致性问题. 针对以上问题, 提出基于因果时空语义的深度强化学习抽象建模方法. 首先, 提出反映时间和空间价值变化分布的因果时空语义, 并在此基础上对状态进行双阶段语义抽象以构建深度强化学习过程的抽象马尔可夫模型; 其次, 结合抽象优化技术对抽象模型进行调优, 以减少抽象状态与相应具体状态之间的语义误差; 最后, 结合车道保持、自适应巡航、交叉路口会车等案例进行了大量的实验, 并使用验证器PRISM对模型进行评估分析, 结果表明所提出的抽象建模技术在模型的抽象表达能力、准确性及语义等价性方面具有较好的效果.

来源:2025年第8期

《软件学报》期刊编辑部

查看软件学报杂志2025年第8期

联系我们

  • 地址:北京8718信箱
  • 电话:010-62562563
  • E-mail:jos (a) iscas. ac. cn

咨询工作人员