国内刊号:11-2560/TP
国际刊号:1000-9825
发布日期:
作者:张广朋,张冬明,张菁,王川宁,王立冬,邹学强
单位:张广朋,北京工业大学 信息学部, 北京 10012411,张冬明,国家计算机网络应急技术处理协调中心, 北京 10002902,张菁,北京工业大学 信息学部, 北京 10012403,王川宁,北京工业大学 信息学部, 北京 10012404,王立冬,北京广播电视台, 北京 10002205,邹学强,国家计算机网络应急技术处理协调中心, 北京 10002906
关键词:数据合成;度量学习;可伸缩;台标检测和识别
基金:国家重点研发计划(2018YFB080402); 国家自然科学基金(61672495, 61971016); 北京市自然科学基金-市教委联合资助项目(KZ201910005007)
台标是视频的重要语义信息, 其检测与识别面临类别多、结构复杂、区域小、信息量低、背景干扰大等难题. 为提高模型的泛化能力, 提出将台标图像叠加到背景图像中合成台标数据, 来构建训练数据集. 进一步, 提出两阶段可伸缩台标检测与识别(scalable logo detection and recognition, SLDR)方法, 其采用batch-hard度量学习方法快速训练匹配模型, 确定台标类别. SLDR的检测与识别分离机制使得其可将检测目标扩展到未知类别. 实验结果表明, 合成数据可以有效提升模型的泛化能力和检测精度. 实验亦显示SLDR方法在不更新检测模型的情况下, 即可获得与端到端模型相当的精度.
来源:2022年第9期
《软件学报》期刊编辑部