☰
【EMNLP 2024】GoG 论文解读:让大模型同时充当智能体与知识图谱,破解不完整知识图谱问答|从知识图谱问答与大模型知识融合视角
2026/10/10 6:22:59 网站建设 项目流程

摘要

本文解读 EMNLP 2024 论文《Generate-on-Graph: Treat LLM as both Agent and KG for Incomplete Knowledge Graph Question Answering》。该论文提出IKGQA(不完整知识图谱问答)这一更贴近真实场景的任务,并给出训练-free 框架GoG(Generate-on-Graph),通过融合Thinking–Searching–Generating 三步循环、动态子图扩张检索与LLM 内生知识生成并验证三元组,让大模型在缺失关键事实的知识图谱上仍能回答复杂问题,其特别之处在于让 LLM 同时充当探索图谱的智能体与生成缺失事实的知识图谱本身。实验表明GoG 在 CWQ 与 WebQSP 上全面超过全部提示式方法:GPT-4 底座下完整 KG 达 75.2 / 84.4 Hits@1,即便随机删去 40% 关键三元组仍达 60.4 / 80.3,为「大模型与外部知识源的真正融合」提供了重要借鉴。

视频讲解:点击观看 B 站视频

  • 摘要
  • 论文基本信息
  • 背景与动机
  • 研究主线:从问题到结论
  • 基准/方法设计
  • 分类全景
  • 方法细节
  • 实验设计与结果
  • 结果对比总结
  • 关键发现
  • 局限性
  • 常见问题(FAQ)
    • GoG 到底解决什么问题?
    • IKGQA 与普通 KGQA 的区别是什么?
    • GoG 需要训练吗?
    • GoG 与 ToG 的关键差别?
    • GoG 的主要误差来源?
  • 参考链接

论文基本信息

项目内容
标题(英文)Generate-on-Graph: Treat LLM as both Agent and KG for Incomplete Knowledge Graph Question Answering
标题(中文)GoG:让大模型同时充当智能体与知识图谱,破解不完整知识图谱问答
作者Yao Xu, Shizhu He, Jiabei Chen, Zihao Wang, Yangqiu Song, Hanghang Tong, Guang Liu, Jun Zhao, Kang Liu
机构中科院自动化研究所(NLPR) · 中国科学院大学 · 香港科技大学 · 伊利诺伊大学厄巴纳-香槟分校 · 北京智源人工智能研究院
会议EMNLP 2024 Main(pp. 18410–18430)
arXiv2404.14741
项目网站github.com/YaooXu/GoG

背景与动机

知识图谱问答(KGQA)长期被视为「在图上找路径」的任务,但它默认了一个被普遍忽略的前提:回答问题所需的事实三元组,全部都在给定的知识图谱里。论文把这个前提直接摆上台面——传统的 KGQA 在评测时,每道题所需的事实三元组都被 KG 完全覆盖,此时大模型更像一个「解析器」,只需把自然语言里的关系对齐到 KG 上的谓词,沿着关系路径走到答案实体即可,并没有真正融合 LLM 的内部知识与外部图谱知识。

现实恰恰相反。论文给出的例子是问题「Apple 总部所在地的时区是什么?」:当三元组 $(Cupertino, timezone, Pacific\ Standard\ Time)$ 在 KG 中缺失时,依赖图谱完整性的方法立刻失灵。这引出全文的核心设问:能否让 LLM 与不完整的 KG 协同回答复杂问题?

围绕这个问题,论文点名了三类已有路线并指出其局限:

  • 仅提示(w.o. KG):IO prompt、CoT、CoT+SC 完全不看图谱。在 CWQ 上最高只到 45.4 Hits@1,说明纯靠参数化知识不足以覆盖长尾事实。
  • 语义解析(SP):KB-BINDER、ChatKBQA 把自然语言转成 SPARQL 再执行。它们不与图谱交互,因此对「三元组已被删除」毫无感知——ChatKBQA 在 CWQ 上从完整 KG 的 76.5 崩到 IKG-40% 的 39.3。
  • 检索增强(RA):ToG、RoG、StructGPT 从图谱检索路径或子图作为上下文。答案仍必须在 KG 内,一旦关键边缺失就无路可走——ToG 在 CWQ 上完整 KG 为 47.2,删去 40% 关键三元组后降到 37.9,甚至低于完全不用 KG 的 45.4。

第 3 类结果正是全文的动机支点:性能反而输给「不用 KG」,说明这些方法本质上还是在「找答案」,而非「融合内部与外部知识」。附录中的基准对比进一步确认:RoG(需要微调的 SOTA)在 CWQ 上完整 KG 为 66.1、IKG-40% 为 54.2;而 GoG 以训练-free 的方式,在同样两档上达到 55.7 / 44.3(GPT-3.5),并在 GPT-4 底座上把完整 KG 推到 75.2 / 84.4,超过绝大多数需要微调的方法。

研究主线:从问题到结论

图 7:GoG 研究主线(Mermaid 流程图)——问题(真实 KG 不完整)→ 动机(完整性假设被默认)→ 基准(IKGQA 四档缺失率)→ 方法(思维-搜索-生成)→ 实验(CWQ 与 WebQSP)→ 结论(LLM 既是 Agent 也是 KG)。

基准/方法设计

论文的第一项贡献不是方法,而是任务与基准。它把「KG 不完整」从工程缺陷重述为一个可研究的问题:

  1. 任务定义(IKGQA):与 KGQA 的唯一差别在于,黄金关系路径 $w_g = e_t \xrightarrow{r_1} e_1 \xrightarrow{r_2} \dots \xrightarrow{r_l} e_a$ 上存在至少一条三元组不在图谱中;模型必须从 LLM 内部知识或子图信息中把它补回来。
  2. 数据构造:以 Freebase 为背景图谱,基于 WebQSP 与 CWQ 两个公开数据集,用 SPARQL 取回每题涉及的全部三元组,过滤属性节点后按概率 $p$ 采样删除($p$ 取 20% / 40% / 60% / 80%);除该三元组外,两个实体之间的全部关系也一并删除,避免「只删一条边」的取巧。为控制成本,每档各取 1{,}000 题,并丢弃删除后主题实体成为孤立点的样本。
  3. 统计特征:CWQ 在四档下平均删除 2.2 / 4.3 / 6.4 / 7.9 条边,主题实体中位邻居数稳定在 26–27;WebQSP 对应为 6.6 / 13.9 / 20.3 / 27.4 条边,中位邻居数 426–428。WebQSP 以单跳题为主、CWQ 含更多多跳与 CVT 结构,这解释了两者对缺失敏感度的差异。

图 1:论文 Figure 1 —— 三类问答任务的对比:(a) 仅用 LLM、(b) 知识图谱问答(KGQA)、(c) 不完整知识图谱问答(IKGQA),其中三元组 (Cupertino, timezone, Pacific Standard Time) 已从图谱中缺失;黄色与红色节点分别表示主题实体与答案实体。

分类全景

论文把「LLM + KG」的结合方式归为三类范式,GoG 在此基础上新增了「生成式补全」这一路:

图 8:LLM + KG 问答方法分类全景(Mermaid 树状图)——语义解析(KB-BINDER / ChatKBQA)、检索增强(ToG / RoG / StructGPT)、仅提示(IO / CoT / CoT+SC),以及 GoG 的生成式补全(Thinking-Searching-Generating)。

图 2:论文 Figure 2 —— LLM 与 KG 结合的三种范式:(a) 语义解析把 LLM 当解析器、(b) 路径检索把 LLM 当路径查找器、(c) GoG 让 LLM 既是探索图谱的智能体,又是生成新三元组的 KG。

方法细节

GoG 是一个训练-free框架:不更新任何参数,全部能力来自提示工程与模型底座。它以 ReAct 式的Thought–Action–Observation交错推进,每一步先产出一个思考 $t_i$,再据此选择动作 $a_i$,直到信息充分后输出 $Finish[e_a]$(也可能输出 $Finish[unknown]$,此时回退多搜一跳):

  • Thinking(思考):分解原问题(Thought 1)、决定下一个要解的子问题(Thought 2),或判断信息是否已足够输出答案(Thought 4)。它相当于给搜索注入了「全局规划」,而 ToG 缺少整体规划,容易重复探索或迷路。
  • Searching(搜索):以 $Search[e_i]$ 形式调用,先由预定义 SPARQL 查询取回目标实体的全部邻居关系 $R_i$,再让 LLM 依据当前思考筛出最相关的 top-N 关系 $R'_i$,从而得到最相关实体集合 $E_i$。例如从 ${founder, headquarter, CEO}$ 中只为「Apple 总部在哪」选出 $headquarter$。其搜索是动态子图扩张的:信息不足就多搜一跳,因此能处理被 ToG 跳过的 CVT 节点。
  • Generating(生成):以 $Generate[t_i]$ 形式调用,分三步——先用 BM25 从历史 Observation 中挑出最相关的三元组(choosing),再让 LLM 结合内部知识生成新的候选三元组(generating,重复 $n$ 次以压低幻觉),最后用 LLM 验证并保留更可能正确的部分(verifying)。若生成了此前未探索的实体,还需经 BM25 检索候选实体并用 LLM 依据类型完成实体链接。

图 3:论文 Figure 2(c) / 框架图 —— GoG 的 Thinking–Searching–Generating 循环:LLM 既作为探索图谱的智能体,又作为生成缺失事实三元组的 KG。

实验设计与结果

评测指标为Hits@1(top-1 预测正确的题目占比)。基线分三组:仅提示(IO prompt、CoT、CoT+SC)、语义解析(KB-BINDER、ChatKBQA)、检索增强(StructGPT、RoG、ToG)。四个底座 LLM 为 GPT-3.5、GPT-4、Qwen-1.5-72B-Chat 与 LLaMA-3-70B-Instruct;每次生成上限 256 tokens、温度 0.7、提示一律 3-shot。

主结果(完整 KG 记 CKG,随机删去 40% 关键三元组记 IKG-40%):

方法CWQ CKGCWQ IKG-40%WebQSP CKGWebQSP IKG-40%
CoT+SC(无 KG)45.4—61.1—
ChatKBQA(需绑定)76.539.378.149.5
ToG(GPT-3.5)47.237.976.963.4
GoG(GPT-3.5)55.744.378.766.6
ToG(GPT-4)71.056.180.371.8
GoG(GPT-4)75.260.484.480.3

要点:GoG 在完整图与不完整图上同时领先全部提示式方法;GPT-4 底座下完整 KG 的 75.2 / 84.4 已超过大多数需要微调的方法。

不同缺失档位下的表现(GPT-3.5):

数据集 / 方法CKGIKG-20%IKG-40%IKG-60%IKG-80%
CWQ · ToG47.240.537.933.731.4
CWQ ·GoG55.744.944.336.234.4
WebQSP · ToG76.970.361.460.655.9
WebQSP ·GoG78.770.866.662.656.5

在 CWQ 上 GoG 相对对比方法平均提升约 5.0 个百分点;即便图谱删去 80% 关键三元组,GoG 仍保持领先(CWQ 34.4 vs ToG 31.4)。

Generate 动作消融(Qwen-1.5-72B 底座):

设置CWQ CKGCWQ IKG-40%WebQSP CKGWebQSP IKG-40%
GoG 去掉 Generate62.748.674.769.4
GoG 含 Generate63.350.677.971.1

去掉生成动作后四个设置全部下降,验证了「生成式补全」承担了关键性能。论文同时分析了相关三元组数量的影响:性能随相关子图先升后降——子图能激活 LLM 记忆、生成更准确的三元组,但过多会引入噪声。

图 4:论文 Figure 4 —— Generate 动作中相关三元组数量对 GoG 在 CWQ 与 WebQSP 上 Hits@1 的影响(底座 Qwen-1.5-72b-chat),性能先升后降。

典型案例——CVT 结构:Freebase 用复合值类型(CVT)节点建模事件(可含起止时间、地点等)。ToG 倾向于认为 CVT 节点「不值得继续探索」而在其处走失,GoG 则因动态子图扩张而向 CVT 外多搜一跳,取回正确实体。

图 5:论文附录图 —— Freebase 中的复合值类型(CVT)节点示例;ToG 倾向于跳过 CVT,GoG 会继续外扩。

错误分析:论文把错误分为四类——生成错误、分解错误、幻觉、假阴性。剔除假阴性后,幻觉是实际错误的主要来源;而在不完整 KG 下假阴性更常见(例如模型输出 "The US" 而标准答案是 "America")。

图 6:论文附录图 —— GoG 在不同数据集与不同 KG 设置下的错误占比;剔除假阴性后仍以幻觉为主导。

结果对比总结

图 9:GoG 与 ToG 结果对比(Mermaid 流程图)——CWQ 完整 KG 71.0→75.2、IKG-40% 56.1→60.4,均实现约 4 个百分点的提升;不用 KG 的 CoT+SC 在 CWQ 上仅 45.4。

关键发现

  • 「完整性假设」是被实测证伪的:ChatKBQA 在 CWQ 上从 76.5 崩到 39.3,ToG 从 47.2 降到 37.9,后者甚至低于不用 KG 的 45.4——说明它们并未真正融合内部与外部知识。
  • 生成式补全承担了性能:去掉 Generate 动作后四个设置一致下降——CWQ 完整 KG 63.3→62.7、IKG-40% 50.6→48.6,WebQSP 完整 KG 77.9→74.7、IKG-40% 71.1→69.4。
  • 动态子图扩张是 CVT 的解药:GoG 在 CVT 密集的 CWQ 完整 KG 上以 55.7 超过 ToG 的 47.2,差距约 8.5 个百分点。
  • 底座越强收益越明显:GPT-4 下 GoG 在 CWQ / WebQSP 的 IKG-40% 达到 60.4 / 80.3,完整 KG 达到 75.2 / 84.4,超过绝大多数微调方法。
  • LLM 的两种角色并不等价:NKG 设置下 Llama-3 稳定优于 Qwen-1.5,而 CKG 设置下恰好相反——说明「当 KG」与「当 Agent」的能力可分离,值得后续研究。
  • 幻觉是首要误差来源:剔除假阴性后,四类错误中幻觉占比最高,且随图谱不完整度上升,假阴性占比也明显抬升。

局限性

  • 生成动作可能产生幻觉:LLM 生成的缺失三元组本身可能错误,论文认为这对现有 LLM 无法根除。
  • 极端不完整下不及 CoT:当 KG 非常不完整时,GoG 的表现可能低于 CoT 提示,仍有改进空间。
  • 评测用「随机删除」模拟不完整:这与真实世界图谱的非随机缺失方式未必一致,泛化性有待验证。
  • 底座版本较早:实验使用 gpt-3.5-turbo-0613、gpt-4-0613、Qwen-1.5-72B、Llama-3-70B 等模型,结论在新一代模型上是否同样成立仍需检验。
  • 实体链接依赖 BM25 + LLM 判别:生成新实体时需要额外链接到 Freebase 的 MID,这一环节也可能成为误差来源。

常见问题(FAQ)

GoG 到底解决什么问题?

它解决「知识图谱不完整」这一真实但被传统 KGQA 评测忽略的问题:当回答问题所需的三元组不在图谱里时,让 LLM 一方面当智能体探索图谱,一方面当知识图谱生成并验证缺失的事实三元组。

IKGQA 与普通 KGQA 的区别是什么?

唯一区别在于黄金关系路径上是否存在缺失的三元组。KGQA 保证路径上的每条三元组都在图谱中,而 IKGQA 允许缺失,因此模型必须真正融合 LLM 内部知识与外部图谱知识。

GoG 需要训练吗?

不需要。GoG 是训练-free 的,全部能力来自提示工程(Thinking-Searching-Generating 三步提示,均 3-shot)与底座模型本身,换数据集或换底座只需改提示。

GoG 与 ToG 的关键差别?

ToG 只探索与图谱路径,缺乏全局规划,容易重复探索或走失;GoG 每步先分解子问题并做动态子图扩张,还能在找不到答案时生成缺失三元组,因此在完整图与不完整图上都更强。

GoG 的主要误差来源?

剔除假阴性后以幻觉为主——生成动作可能产出错误三元组,或最终答案不被上下文证据支持,但因 LLM 自验证并非独立事实核查,这类错误难以完全消除。

参考链接

  • 论文 arXiv 摘要页:arxiv.org/abs/2404.14741
  • ACL Anthology 正式版:aclanthology.org/2024.emnlp-main.1023
  • 官方代码库:github.com/YaooXu/GoG
  • 关键基线 ToG:Think-on-Graph (arXiv 2307.07697)
  • 关键基线 ReAct:ReAct: Synergizing Reasoning and Acting (arXiv 2210.03629)

给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群:白拾的小屋 (750365700)

⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页:YhbCode000(工程文件)

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询