国内刊号:11-2560/TP
国际刊号:1000-9825
发布日期:
作者:陈浙哲,鄢萌,夏鑫,刘忠鑫,徐洲,雷晏
单位:陈浙哲,信息物理社会可信服务计算教育部重点实验室(重庆大学), 重庆 400044;重庆大学 大数据与软件学院, 重庆 40133111,鄢萌,信息物理社会可信服务计算教育部重点实验室(重庆大学), 重庆 400044;重庆大学 大数据与软件学院, 重庆 40133102,夏鑫,Faculty of Information Technology, Monash University, Melbourne, VIC 3800, Australia03,刘忠鑫,浙江大学 计算机科学与技术学院, 浙江 杭州 31000704,徐洲,信息物理社会可信服务计算教育部重点实验室(重庆大学), 重庆 400044;重庆大学 大数据与软件学院, 重庆 40133105,雷晏,信息物理社会可信服务计算教育部重点实验室(重庆大学), 重庆 400044;重庆大学 大数据与软件学院, 重庆 40133106
关键词:代码自然性;软件仓库挖掘;代码语言模型
基金:国家自然科学基金(62002034);中央高校基本科研业务费(2020CDCGRJ072,2020CDJQYA021,2021CDJKYJH032);国防基础科研计划(WDZC20205500308);中国博士后基金(2020M673137);重庆市自然科学基金(cstc2020jcyj-bshX0114)
代码自然性(code naturalness)研究是自然语言处理领域和软件工程领域共同的研究热点之一,旨在通过构建基于自然语言处理技术的代码自然性模型,以解决各种软件工程任务.近年来,随着开源软件社区中源代码和数据规模的不断扩大,越来越多的研究人员注重钻研源代码中蕴藏的信息,并且取得了一系列研究成果.但与此同时,代码自然性研究在代码语料库构建、模型构建和任务应用等环节面临许多挑战.鉴于此,从代码自然性技术的代码语料库构建、模型构建和任务应用等方面对近年来代码自然性研究及应用进展进行梳理和总结.主要内容包括:(1)介绍了代码自然性的基本概念及其研究概况;(2)归纳目前代码自然性研究的语料库,并对代码自然性模型建模方法进行分类与总结;(3)总结代码自然性模型的实验验证方法和模型评价指标;(4)总结并归类了目前代码自然性的应用现状;(5)归纳代码自然性技术的关键问题;(6)展望代码自然性技术的未来发展.
来源:2022年第8期
《软件学报》期刊编辑部