软件学报

北大核心,INSPEC,JST,Pж(AJ),EI

国内刊号:11-2560/TP

国际刊号:1000-9825

软件学报杂志2023年第8期:显式知识推理和深度强化学习结合的动态决策

发布日期:

作者:张昊迪,陈振浩,陈俊扬,周熠,连德富,伍楷舜,林方真

单位:张昊迪,深圳大学 计算机与软件学院, 广东 深圳 51805211,陈振浩,深圳大学 计算机与软件学院, 广东 深圳 51805202,陈俊扬,深圳大学 计算机与软件学院, 广东 深圳 51805203,周熠,上海脑科学与类脑研究中心, 上海 20003104,连德富,中国科学技术大学 计算机科学与技术学院, 安徽 合肥 23002605,伍楷舜,深圳大学 计算机与软件学院, 广东 深圳 51805206,林方真,香港科技大学 计算机科学与工程系, 香港 99907707

关键词:知识表示与推理;可解释性;深度强化学习;动态序列决策

基金:国家自然科学基金(61806132,U2001207,61872248);广东省自然科学基金(2017A030312008);深圳市自然科学基金(ZDSYS20190902092853047,R2020A045);珠江人才计划(2019ZT08X603);广东省普通高校创新团队项目(2019KCXTD005)

近年来, 深度强化学习在序列决策领域被广泛应用并且效果良好, 尤其在具有高维输入、大规模状态空间的应用场景中优势明显. 然而, 深度强化学习相关方法也存在一些局限, 如缺乏可解释性、初期训练低效与冷启动等问题. 针对这些问题, 提出了一种基于显式知识推理和深度强化学习的动态决策框架, 将显式的知识推理与深度强化学习结合. 该框架通过显式知识表示将人类先验知识嵌入智能体训练中, 让智能体在强化学习中获得知识推理结果的干预, 以提高智能体的训练效率, 并增加模型的可解释性. 将显式知识分为两种, 即启发式加速知识与规避式安全知识. 前者在训练初期干预智能体决策, 加快训练速度; 而后者将避免智能体作出灾难性决策, 使其训练过程更为稳定. 实验表明, 该决策框架在不同强化学习算法上、不同应用场景中明显提高了模型训练效率, 并增加了模型的可解释性.

来源:2023年第8期

《软件学报》期刊编辑部

查看软件学报杂志2023年第8期

联系我们

  • 地址:北京8718信箱
  • 电话:010-62562563
  • E-mail:jos (a) iscas. ac. cn

咨询工作人员