国内刊号:11-2560/TP
国际刊号:1000-9825
发布日期:
作者:黄恒焱,邹逸,时乐轩,程皓楠,叶龙
单位:黄恒焱,中国传媒大学 数据科学与智能媒体学院, 北京 10002411,邹逸,媒体融合与传播国家重点实验室(中国传媒大学), 北京 10002402,时乐轩,中国传媒大学 音乐与录音艺术学院, 北京 10002403,程皓楠,媒体融合与传播国家重点实验室(中国传媒大学), 北京 10002404,叶龙,中国传媒大学 数据科学与智能媒体学院, 北京 100024;媒介音视频教育部重点实验室(中国传媒大学), 北京 10002405
关键词:符号音乐理解;音乐知识结构化表征;卷积神经网络;Transformer;特征融合
基金:国家自然科学基金 (62201524)
符号音乐理解(symbolic music understanding, SMU)是多媒体内容理解的重要任务之一, 旨在从符号化音乐表示中提取旋律、力度、作曲家风格、情感与流派等多维音乐属性. 现有方法在音乐序列依赖建模方面取得了显著进展, 但是仍然存在两方面关键问题: (1)表示单一化: 将复杂的音乐结构简化为线性符号序列, 忽略了音乐固有的多维层级信息; (2)乐理知识缺乏: 基于序列数据驱动的模型难以融入系统化乐理知识, 限制了对音乐深层语义的理解. 针对上述问题, 提出了一种融合音乐知识结构化表征的高精度符号音乐理解模型CNN-Midiformer. 该模型首先基于音乐理论构建音乐知识和音乐序列的结构化表征; 其次, 设计互补音乐特征提取模块, 利用卷积神经网络(convolutional neural network, CNN)提取音乐知识结构化表征的深层局部特征, 并通过Transformer编码器的自注意力机制捕获音乐序列的深层语义特征; 最后, 设计音乐知识自适应增强的特征融合模块, 利用高效的交叉注意力机制将CNN提取的深层音乐知识特征与Transformer编码器的深层语义特征进行动态融合, 实现对序列语境的感知与特征增强. 在6个公开符号音乐理解数据集Pop1K7、ASAP、POP909、Pianist8、EMOPIA和ADL上的对比实验表明, 所提出的模型CNN-Midiformer在旋律识别、力度预测、作曲家分类、情感分类和流派分类这5个符号音乐理解的基准下游任务上均优于最新方法, 相较于基线模型准确率提升0.21–7.14个百分点.
来源:2026年第5期
《软件学报》期刊编辑部