软件学报

北大核心,INSPEC,JST,Pж(AJ),EI

国内刊号:11-2560/TP

国际刊号:1000-9825

软件学报杂志2026年第8期:面向Linux内核开发知识的大模型问答能力评测

发布日期:

作者:欧闻毅,吴毅坚,黄宸一,彭鑫

单位:欧闻毅,复旦大学 计算与智能创新学院, 上海 200438;上海市数据科学重点实验室(复旦大学), 上海 20043811,吴毅坚,复旦大学 计算与智能创新学院, 上海 200438;上海市数据科学重点实验室(复旦大学), 上海 20043802,黄宸一,复旦大学 计算与智能创新学院, 上海 20043803,彭鑫,复旦大学 计算与智能创新学院, 上海 200438;上海市数据科学重点实验室(复旦大学), 上海 20043804

关键词:问答能力评测;基准数据集;Linux内核;开发知识

基金:国家自然科学基金(62172099)

大语言模型(large language model, LLM)在软件开发技术问答任务中展现出强大潜力, 为代码知识获取和理解提供了新途径. 然而, 在以Linux内核为代表的复杂系统软件领域, LLM在代码实现、关键机制理解、演化历史追溯及设计决策分析等方面的真实能力仍缺乏系统验证. 现有评测基准多针对通用任务, 存在领域深度不足、难度逐渐饱和及评测问题与工程实践存在偏差等局限, 难以保障特定领域开发知识问答的客观性、准确性和全面性. 为客观评估LLM在复杂系统软件中的知识问答能力, 研究提出一种LLM问答能力评测基准数据集构建方法, 并构建面向Linux内核的高质量问答评测基准LKQABench, 同时设计一种多裁判协同的代码知识问答评测方法MJ-CCE. LKQABench基于开发者社区的真实技术问答数据, 经过语义分析和人工审核修订, 构建202个标准问答对, 覆盖Linux内核主要模块和不同认知维度. MJ-CCE方法定义多个裁判大模型的协同评分与投票机制, 从关键知识点覆盖度、事实正确性与表达清晰度等维度对回答进行多维度评估. 在LKQABench上对主流大模型的实证研究表明, 当前大模型能较好回答内核实现的单点知识问题, 但在涉及跨主题知识整合、深度推理及版本演化关联的问题中, 存在知识点遗漏、逻辑链条不完整等不足. 研究不仅揭示了大模型在软件开发知识问答中的能力边界, 也为其在该领域的持续优化提供了实证数据支撑.

来源:2026年第8期

《软件学报》期刊编辑部

查看软件学报杂志2026年第8期

联系我们

  • 地址:北京8718信箱
  • 电话:010-62562563
  • E-mail:jos (a) iscas. ac. cn

咨询工作人员