软件学报

北大核心,INSPEC,JST,Pж(AJ),EI

国内刊号:11-2560/TP

国际刊号:1000-9825

软件学报杂志2020年第4期:基于标签语义注意力的多标签文本分类

发布日期:

作者:肖琳,陈博理,黄鑫,刘华锋,景丽萍,于剑

单位:肖琳,交通数据分析与挖掘北京市重点实验室(北京交通大学), 北京 10004411,陈博理,交通数据分析与挖掘北京市重点实验室(北京交通大学), 北京 10004402,黄鑫,交通数据分析与挖掘北京市重点实验室(北京交通大学), 北京 10004403,刘华锋,交通数据分析与挖掘北京市重点实验室(北京交通大学), 北京 10004404,景丽萍,交通数据分析与挖掘北京市重点实验室(北京交通大学), 北京 10004405,于剑,交通数据分析与挖掘北京市重点实验室(北京交通大学), 北京 10004406

关键词:多标签学习;文本分类;标签语义;注意力机制

基金:国家自然科学基金(61822601,61773050,61632004);北京市自然科学基金(Z180006);北京市科委项目(Z181100008918012)

自大数据蓬勃发展以来,多标签分类一直是令人关注的重要问题,在现实生活中有许多实际应用,如文本分类、图像识别、视频注释、多媒体信息检索等.传统的多标签文本分类算法将标签视为没有语义信息的符号,然而,在许多情况下,文本的标签是具有特定语义的,标签的语义信息和文档的内容信息是有对应关系的,为了建立两者之间的联系并加以利用,提出了一种基于标签语义注意力的多标签文本分类(LAbel Semantic Attention Multi-label Classification,简称LASA)方法,依赖于文档的文本和对应的标签,在文档和标签之间共享单词表示.对于文档嵌入,使用双向长短时记忆(bi-directional long short-term memory,简称Bi-LSTM)获取每个单词的隐表示,通过使用标签语义注意力机制获得文档中每个单词的权重,从而考虑到每个单词对当前标签的重要性.另外,标签在语义空间里往往是相互关联的,使用标签的语义信息同时也考虑了标签的相关性.在标准多标签文本分类的数据集上得到的实验结果表明,所提出的方法能够有效地捕获重要的单词,并且其性能优于当前先进的多标签文本分类算法.

来源:2020年第4期

《软件学报》期刊编辑部

查看软件学报杂志2020年第4期

联系我们

  • 地址:北京8718信箱
  • 电话:010-62562563
  • E-mail:jos (a) iscas. ac. cn

咨询工作人员