软件学报

北大核心,INSPEC,JST,Pж(AJ),EI

国内刊号:11-2560/TP

国际刊号:1000-9825

软件学报杂志2026年第8期:面向软件测试领域知识问答的大模型评估

发布日期:

作者:陈煜磊,聂钰格,吴化尧

单位:陈煜磊,南京大学 计算机科学与技术学院, 江苏 南京 21002311,聂钰格,南京大学 计算机科学与技术学院, 江苏 南京 21002302,吴化尧,南京大学 计算机科学与技术学院, 江苏 南京 21002303

关键词:软件测试;知识问答;大语言模型;性能评估

基金:国家自然科学基金(62472209); 江苏省重点研发计划(BE2023025-2)

大语言模型(large language model, LLM)在通用任务中已展现出卓越的性能, 但其在专业领域中的可信性、鲁棒性与可用性仍缺乏系统化评估. 以软件测试教材编写为代表性应用场景, 围绕100个核心测试概念与方法精心构建了700个测试问题, 并选取5个代表性LLM, 系统评估了其在阅读理解、问答及文本生成方面的能力. 实验结果表明, LLM在大多数问题上整体表现优良, 在答案的准确性、完整性和流畅性方面均达到较高水准; 然而, 在涉及研究现状与复杂概念时, 仍存在幻觉与推理偏差等可靠性问题. 进一步分析显示, 大模型生成的内容在知识覆盖度与教育性上较传统教材具有较为明显的优势, 能够为软件测试教材的修订与教学提供有效支持. 不仅系统揭示了LLM在专业领域知识处理中的具体能力边界与典型缺陷, 也为基于问答驱动的智能化评估方法在专业教育与应用中的推广提供了实证依据与方法参考.

来源:2026年第8期

《软件学报》期刊编辑部

查看软件学报杂志2026年第8期

联系我们

  • 地址:北京8718信箱
  • 电话:010-62562563
  • E-mail:jos (a) iscas. ac. cn

咨询工作人员