软件学报

北大核心,INSPEC,JST,Pж(AJ),EI

国内刊号:11-2560/TP

国际刊号:1000-9825

软件学报杂志2019年第S2期:基于知识蒸馏和生成对抗网络的远场语音识别

发布日期:

作者:邬龙,黎塔,王丽,颜永红

单位:邬龙,语言声学与内容理解重点实验室(中国科学院 声学研究所), 北京 100190;中国科学院大学, 北京 10004911,黎塔,语言声学与内容理解重点实验室(中国科学院 声学研究所), 北京 10019002,王丽,语言声学与内容理解重点实验室(中国科学院 声学研究所), 北京 10019003,颜永红,语言声学与内容理解重点实验室(中国科学院 声学研究所), 北京 100190;中国科学院大学, 北京 100049;新疆民族语音语言信息处理实验室(中国科学院 新疆理化技术研究所), 乌鲁木齐 83001104

关键词:远场语音识别;知识蒸馏;生成对抗式网络;多任务学习;语音增强

基金:国家自然科学基金(11590774,11590770);新疆维吾尔自治区重大科技专项(2016A03007-1);中国科学院声学研究所青年英才计划(QNYC201602)

为了进一步利用近场语音数据来提高远场语音识别的性能,提出一种基于知识蒸馏和生成对抗网络相结合的远场语音识别算法.该方法引入多任务学习框架,在进行声学建模的同时对远场语音特征进行增强.为了提高声学建模能力,使用近场语音的声学模型(老师模型)来指导远场语音的声学模型(学生模型)进行训练.通过最小化相对熵使得学生模型的后验概率分布逼近老师模型.为了提升特征增强的效果,加入鉴别网络来进行对抗训练,从而使得最终增强后的特征分布更逼近近场特征.AMI数据集上的实验结果表明,该算法的平均词错误率(WER)与基线相比在单通道的情况下,在没有说话人交叠和有说话人交叠时分别相对下降5.6%和4.7%.在多通道的情况下,在没有说话人交叠和有说话人交叠时分别相对下降6.2%和4.1%.TIMIT数据集上的实验结果表明,该算法获得了相对7.2%的平均词错误率下降.为了更好地展示生成对抗网络对语音增强的作用,对增强后的特征进行了可视化分析,进一步验证了该方法的有效性.

来源:2019年第S2期

《软件学报》期刊编辑部

查看软件学报杂志2019年第S2期

联系我们

  • 地址:北京8718信箱
  • 电话:010-62562563
  • E-mail:jos (a) iscas. ac. cn

咨询工作人员