国内刊号:11-2560/TP
国际刊号:1000-9825
发布日期:
作者:吕沈欢,陈一赫,姜远
单位:吕沈欢,计算机软件新技术国家重点实验室 (南京大学), 江苏 南京 210023;软件新技术与产业化协同创新中心 (南京大学), 江苏 南京 21002311,陈一赫,计算机软件新技术国家重点实验室 (南京大学), 江苏 南京 210023;软件新技术与产业化协同创新中心 (南京大学), 江苏 南京 21002302,姜远,计算机软件新技术国家重点实验室 (南京大学), 江苏 南京 210023;软件新技术与产业化协同创新中心 (南京大学), 江苏 南京 21002303
关键词:深度森林;多标记学习;特征交互;标记相关性;表示学习
基金:国家自然科学基金(62176117)
在多标记学习中, 每个样本都与多个标记关联, 关键任务是如何在构建模型时利用标记之间的相关性. 多标记深度森林算法尝试在深度集成学习的框架下使用逐层的表示学习来挖掘标记之间的相关性, 并利用得到的标记概率表示提升预测精度. 然而, 一方面标记概率表示与标记信息高度相关, 这会导致其多样性较低. 随着深度森林的深度增加, 性能会下降. 另一方面, 标记概率的计算需要我们存储所有层数的森林结构并在测试阶段逐一使用, 这会造成难以承受的计算和存储开销. 针对这些问题, 提出基于交互表示的多标记深度森林算法(interaction- representation-based multi-label deep forest, iMLDF). iMLDF从森林模型的决策路径中挖掘特征空间中的结构信息, 利用随机交互树抽取决策树路径中的特征交互, 分别得到特征置信度得分和标记概率分布两种交互表示. iMLDF一方面充分利用模型中的特征结构信息来丰富标记间的相关信息, 另一方面通过交互表达式计算所有的表示, 从而使得算法无需存储森林结构, 大大地提升了计算效率. 实验结果表明: 在交互表示基础上进行表示学习的iMLDF算法取得了更好的预测性能, 而且针对样本较多的数据集, 计算效率比MLDF算法提升了一个数量级.
来源:2024年第4期
《软件学报》期刊编辑部