国内刊号:11-2560/TP
国际刊号:1000-9825
发布日期:
作者:张云婷,叶麟,唐浩林,张宏莉,李尚
单位:张云婷,哈尔滨工业大学 网络空间安全学院, 黑龙江 哈尔滨 15000111,叶麟,哈尔滨工业大学 网络空间安全学院, 黑龙江 哈尔滨 15000102,唐浩林,哈尔滨工业大学 网络空间安全学院, 黑龙江 哈尔滨 15000103,张宏莉,哈尔滨工业大学 网络空间安全学院, 黑龙江 哈尔滨 15000104,李尚,哈尔滨工业大学 网络空间安全学院, 黑龙江 哈尔滨 15000105
关键词:深度神经网络;对抗样本;文本对抗攻击;中文BERT;掩码语言模型
基金:国家自然科学基金(61872111)
对抗文本是一种能够使深度学习分类器作出错误判断的恶意样本, 敌手通过向原始文本中加入人类难以察觉的微小扰动制作出能欺骗目标模型的对抗文本. 研究对抗文本生成方法, 能对深度神经网络的鲁棒性进行评价, 并助力于模型后续的鲁棒性提升工作. 当前针对中文文本设计的对抗文本生成方法中, 很少有方法将鲁棒性较强的中文BERT模型作为目标模型进行攻击. 面向中文文本分类任务, 提出一种针对中文BERT的攻击方法Chinese BERT Tricker. 该方法使用一种汉字级词语重要性打分方法——重要汉字定位法; 同时基于掩码语言模型设计一种包含两类策略的适用于中文的词语级扰动方法实现对重要词语的替换. 实验表明, 针对文本分类任务, 所提方法在两个真实数据集上均能使中文BERT模型的分类准确率大幅下降至40%以下, 且其多种攻击性能明显强于其他基线方法.
来源:2024年第7期
《软件学报》期刊编辑部