国内刊号:11-2560/TP
国际刊号:1000-9825
发布日期:
作者:郁俊杰,王星,陈文亮,张民
单位:郁俊杰,苏州大学 计算机科学与技术学院, 江苏 苏州 21500611,王星,腾讯AI Lab, 广东 深圳 51800002,陈文亮,苏州大学 计算机科学与技术学院, 江苏 苏州 21500603,张民,苏州大学 计算机科学与技术学院, 江苏 苏州 21500604
关键词:自然语言处理;信息抽取;关系抽取;低资源;自训练
基金:国家自然科学基金(62376177, 61936010)
自训练是缓解标注数据不足问题的常见方法, 其通常做法是利用教师模型去获取高置信度的自动标注数据作为可靠数据. 然而在低资源场景关系抽取任务上, 该方法不仅存在教师模型泛化能力差的问题, 而且受到关系抽取任务中易混淆关系类别的影响, 导致难以从自动标注数据中有效地识别出可靠数据, 同时产生大量难以利用的低置信度噪音数据. 因此, 提出一种有效利用低置信度数据的自训练方法ST-LRE (self-training approach for low-resource relation extraction). 该方法一方面基于复述增强的预测方法来加强教师模型筛选可靠数据的能力; 另一方面, 基于部分标注模式从低置信度数据中提炼出可利用的模糊数据. 基于模糊数据的候选类别集合, 提出了基于负标签集合的负向训练方法. 最后, 为了支持可靠数据和模糊数据的融合训练, 提出一种支持正负向训练的联合方法. 在两个广泛使用的关系抽取数据集SemEval2010 Task-8和Re-TACRED的低资源场景上进行实验, ST-LRE方法取得显著且一致的提升.
来源:2025年第4期
《软件学报》期刊编辑部