软件学报

北大核心,INSPEC,JST,Pж(AJ),EI

国内刊号:11-2560/TP

国际刊号:1000-9825

软件学报杂志2023年第6期:基于模型的强化学习中可学习的样本加权机制

发布日期:

作者:黄文振,尹奇跃,张俊格,黄凯奇

单位:黄文振,中国科学院大学 人工智能学院, 北京 100049;中国科学院 自动化研究所 智能系统与工程研究中心, 北京 10019011,尹奇跃,中国科学院大学 人工智能学院, 北京 100049;中国科学院 自动化研究所 智能系统与工程研究中心, 北京 10019002,张俊格,中国科学院大学 人工智能学院, 北京 100049;中国科学院 自动化研究所 智能系统与工程研究中心, 北京 10019003,黄凯奇,中国科学院大学 人工智能学院, 北京 100049;中国科学院 自动化研究所 智能系统与工程研究中心, 北京 100190;中国科学院 脑科学与智能技术卓越创新中心, 上海 20003104

关键词:基于模型的强化学习;模型误差;元学习;强化学习;深度学习

基金:国家自然科学基金(61876181,61673375);北京市科技创新计划(Z19110000119043);中国科学院青年创新促进会项目;中国科学院项目(QYZDB-SSW-JSC006)

基于模型的强化学习方法利用已收集的样本对环境进行建模并使用构建的环境模型生成虚拟样本以辅助训练,因而有望提高样本效率.但由于训练样本不足等问题,构建的环境模型往往是不精确的,其生成的样本也会因携带的预测误差而对训练过程产生干扰.针对这一问题,提出了一种可学习的样本加权机制,通过对生成样本重加权以减少它们对训练过程的负面影响.该影响的量化方法为,先使用待评估样本更新价值和策略网络,再在真实样本上计算更新前后的损失值,使用损失值的变化量来衡量待评估样本对训练过程的影响.实验结果表明,按照该加权机制设计的强化学习算法在多个任务上均优于现有的基于模型和无模型的算法.

来源:2023年第6期

《软件学报》期刊编辑部

查看软件学报杂志2023年第6期

联系我们

  • 地址:北京8718信箱
  • 电话:010-62562563
  • E-mail:jos (a) iscas. ac. cn

咨询工作人员