国内刊号:11-2560/TP
国际刊号:1000-9825
发布日期:
作者:丁瑞卿,赵俊峰,王乐业
单位:丁瑞卿,高可信软件技术教育部重点实验室(北京大学), 北京 100871;北京大学 计算机学院, 北京 10087111,赵俊峰,高可信软件技术教育部重点实验室(北京大学), 北京 100871;北京大学 计算机学院, 北京 10087102,王乐业,高可信软件技术教育部重点实验室(北京大学), 北京 100871;北京大学 计算机学院, 北京 10087103
关键词:中文医疗知识图谱;多源知识图谱对齐;大语言模型应用;本体信息;实体语义;对齐错误传递
基金:国家自然科学基金(U23A20468, 62133004, 72188101)
知识图谱作为结构化的知识表示形式, 在医疗领域具有广泛应用. 实体对齐, 即识别不同图谱中的等价实体, 是构建大规模知识图谱的基础步骤. 尽管已有大量研究关注此问题, 但主要集中在两个图谱的对齐任务上, 一般通过捕捉实体语义和图谱结构信息生成实体的向量表示, 之后计算向量相似度以确定等价实体. 在发现多源图谱对齐过程中存在对齐错误传递的问题的基础上, 考虑到医疗场景对实体对齐的准确性要求较高, 设计综合实体语义和本体信息的多源中文医疗知识图谱实体对齐方法(MSOI-Align). 该方法首先将多个图谱进行两两组合, 利用表示学习生成实体向量表示, 并且综合实体名称的相似度和本体一致性约束, 借助大语言模型筛选得到候选实体集合. 随后, 基于三元闭包理论结合大语言模型对候选实体集合进行自动化的对齐错误传递识别与纠正. 在4个中文医疗知识图谱上的实验结果表明, MSOI-Align方法显著提升了实体对齐任务的精确性, 与最优的基准方法相比, Hits@1指标从0.42提升至0.92. 融合后的知识图谱CMKG包含13类本体、19万实体和约70万三元组. 考虑到版权限制, 开源了受限图谱外的另外3个图谱融合的结果——OpenCMKG.
来源:2025年第11期
《软件学报》期刊编辑部