软件学报

北大核心,INSPEC,JST,Pж(AJ),EI

国内刊号:11-2560/TP

国际刊号:1000-9825

软件学报杂志2025年第7期:新兴软件与系统的可信赖性与安全专题前言

发布日期:

作者:向剑文,陈厅,杨珉,周俊伟

单位:向剑文,武汉理工大学 计算机与人工智能学院, 湖北 武汉 43007011,陈厅,电子科技大学 计算机科学与工程学院, 四川 成都 61173102,杨珉,复旦大学 计算机科学技术学院, 上海 20043303,周俊伟,武汉理工大学 计算机与人工智能学院, 湖北 武汉 43007004

关键词:符号音乐理解;音乐知识结构化表征;卷积神经网络;Transformer;特征融合

基金:国家自然科学基金 (62201524)

符号音乐理解(Symbolic Music Understanding, SMU)是多媒体内容理解的重要任务之一,旨在从符号化音乐表示中提取旋律、力度、作曲家风格、情感与流派等多维音乐属性.现有方法在音乐序列依赖建模方面取得了显著进展,但是仍然存在两方面关键问题:(1)表示单一化:将复杂的音乐结构简化为线性符号序列,忽略了音乐固有的多维层级信息;(2)乐理知识缺乏:基于序列数据驱动的模型难以融入系统化乐理知识,限制了对音乐深层语义的理解.针对上述问题,本文提出了一种融合音乐知识结构化表征的高精度符号音乐理解模型CNN-Midiformer.该模型首先基于音乐理论构建音乐知识和音乐序列的结构化表征;其次,设计互补音乐特征提取模块,利用卷积神经网络(Convolutional Neural Networks, CNN)提取音乐知识结构化表征的深层局部特征,并通过Transformer编码器的自注意力机制捕获音乐序列的深层语义特征;最后,设计音乐知识自适应增强的特征融合模块,利用高效的交叉注意力机制将CNN提取的深层音乐知识特征与Transformer编码器的深层语义特征进行动态融合,实现对序列语境的感知与特征增强.在6个公开符号音乐理解数据集Pop1K7、ASAP、POP909、Pianist8、EMOPIA和ADL上的对比实验表明,本文提出的模型CNN-Midiformer在旋律识别、力度预测、作曲家分类、情感分类和流派分类5个符号音乐理解的基准下游任务上均优于最新方法,相较于基线模型精度平均提高0.21%~7.14%.

来源:2025年第7期

《软件学报》期刊编辑部

查看软件学报杂志2025年第7期

联系我们

  • 地址:北京8718信箱
  • 电话:010-62562563
  • E-mail:jos (a) iscas. ac. cn

咨询工作人员