国内刊号:11-2560/TP
国际刊号:1000-9825
发布日期:
作者:陈奕宇,霍静,丁天雨,高阳
单位:陈奕宇,南京大学 计算机科学与技术系, 江苏 南京 210043;计算机软件新技术国家重点实验室(南京大学), 江苏 南京 21004311,霍静,南京大学 计算机科学与技术系, 江苏 南京 210043;计算机软件新技术国家重点实验室(南京大学), 江苏 南京 21004302,丁天雨,Applied Sciences Group, Microsoft, Redmond, WA 98034, USA03,高阳,南京大学 计算机科学与技术系, 江苏 南京 210043;计算机软件新技术国家重点实验室(南京大学), 江苏 南京 21004304
关键词:元强化学习;强化学习;深度强化学习;元学习
基金:科技创新2030—“新一代人工智能”重大项目(2021ZD0113303);国家自然科学基金(62192783, 62276128)
近年来, 深度强化学习(deep reinforcement learning, DRL)已经在诸多序贯决策任务中取得瞩目成功, 但当前, 深度强化学习的成功很大程度依赖于海量的学习数据与计算资源, 低劣的样本效率和策略通用性是制约其进一步发展的关键因素. 元强化学习(meta-reinforcement learning, Meta-RL)致力于以更小的样本量适应更广泛的任务, 其研究有望缓解上述限制从而推进强化学习领域发展. 以元强化学习工作的研究对象与适用场景为脉络, 对元强化学习领域的研究进展进行了全面梳理: 首先, 对深度强化学习、元学习背景做基本介绍; 然后, 对元强化学习作形式化定义及常见的场景设置总结, 并从元强化学习研究成果的适用范围角度展开介绍元强化学习的现有研究进展; 最后, 分析了元强化学习领域的研究挑战与发展前景.
来源:2024年第4期
《软件学报》期刊编辑部