摘要
本文解读 EMNLP 2024 论文《Generate-on-Graph: Treat LLM as both Agent and KG for Incomplete Knowledge Graph Question Answering》。该论文提出IKGQA(不完整知识图谱问答)这一更贴近真实场景的任务,并给出训练-free 框架GoG(Generate-on-Graph),通过融合Thinking–Searching–Generating 三步循环、动态子图扩张检索与LLM 内生知识生成并验证三元组,让大模型在缺失关键事实的知识图谱上仍能回答复杂问题,其特别之处在于让 LLM 同时充当探索图谱的智能体与生成缺失事实的知识图谱本身。实验表明GoG 在 CWQ 与 WebQSP 上全面超过全部提示式方法:GPT-4 底座下完整 KG 达 75.2 / 84.4 Hits@1,即便随机删去 40% 关键三元组仍达 60.4 / 80.3,为「大模型与外部知识源的真正融合」提供了重要借鉴。
视频讲解:点击观看 B 站视频
- 摘要
- 论文基本信息
- 背景与动机
- 研究主线:从问题到结论
- 基准/方法设计
- 分类全景
- 方法细节
- 实验设计与结果
- 结果对比总结
- 关键发现
- 局限性
- 常见问题(FAQ)
- GoG 到底解决什么问题?
- IKGQA 与普通 KGQA 的区别是什么?
- GoG 需要训练吗?
- GoG 与 ToG 的关键差别?
- GoG 的主要误差来源?
- 参考链接
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | Generate-on-Graph: Treat LLM as both Agent and KG for Incomplete Knowledge Graph Question Answering |
| 标题(中文) | GoG:让大模型同时充当智能体与知识图谱,破解不完整知识图谱问答 |
| 作者 | Yao Xu, Shizhu He, Jiabei Chen, Zihao Wang, Yangqiu Song, Hanghang Tong, Guang Liu, Jun Zhao, Kang Liu |
| 机构 | 中科院自动化研究所(NLPR) · 中国科学院大学 · 香港科技大学 · 伊利诺伊大学厄巴纳-香槟分校 · 北京智源人工智能研究院 |
| 会议 | EMNLP 2024 Main(pp. 18410–18430) |
| arXiv | 2404.14741 |
| 项目网站 | github.com/YaooXu/GoG |
背景与动机
知识图谱问答(KGQA)长期被视为「在图上找路径」的任务,但它默认了一个被普遍忽略的前提:回答问题所需的事实三元组,全部都在给定的知识图谱里。论文把这个前提直接摆上台面——传统的 KGQA 在评测时,每道题所需的事实三元组都被 KG 完全覆盖,此时大模型更像一个「解析器」,只需把自然语言里的关系对齐到 KG 上的谓词,沿着关系路径走到答案实体即可,并没有真正融合 LLM 的内部知识与外部图谱知识。
现实恰恰相反。论文给出的例子是问题「Apple 总部所在地的时区是什么?」:当三元组 $(Cupertino, timezone, Pacific\ Standard\ Time)$ 在 KG 中缺失时,依赖图谱完整性的方法立刻失灵。这引出全文的核心设问:能否让 LLM 与不完整的 KG 协同回答复杂问题?
围绕这个问题,论文点名了三类已有路线并指出其局限:
- 仅提示(w.o. KG):IO prompt、CoT、CoT+SC 完全不看图谱。在 CWQ 上最高只到 45.4 Hits@1,说明纯靠参数化知识不足以覆盖长尾事实。
- 语义解析(SP):KB-BINDER、ChatKBQA 把自然语言转成 SPARQL 再执行。它们不与图谱交互,因此对「三元组已被删除」毫无感知——ChatKBQA 在 CWQ 上从完整 KG 的 76.5 崩到 IKG-40% 的 39.3。
- 检索增强(RA):ToG、RoG、StructGPT 从图谱检索路径或子图作为上下文。答案仍必须在 KG 内,一旦关键边缺失就无路可走——ToG 在 CWQ 上完整 KG 为 47.2,删去 40% 关键三元组后降到 37.9,甚至低于完全不用 KG 的 45.4。
第 3 类结果正是全文的动机支点:性能反而输给「不用 KG」,说明这些方法本质上还是在「找答案」,而非「融合内部与外部知识」。附录中的基准对比进一步确认:RoG(需要微调的 SOTA)在 CWQ 上完整 KG 为 66.1、IKG-40% 为 54.2;而 GoG 以训练-free 的方式,在同样两档上达到 55.7 / 44.3(GPT-3.5),并在 GPT-4 底座上把完整 KG 推到 75.2 / 84.4,超过绝大多数需要微调的方法。
研究主线:从问题到结论
图 7:GoG 研究主线(Mermaid 流程图)——问题(真实 KG 不完整)→ 动机(完整性假设被默认)→ 基准(IKGQA 四档缺失率)→ 方法(思维-搜索-生成)→ 实验(CWQ 与 WebQSP)→ 结论(LLM 既是 Agent 也是 KG)。
基准/方法设计
论文的第一项贡献不是方法,而是任务与基准。它把「KG 不完整」从工程缺陷重述为一个可研究的问题:
- 任务定义(IKGQA):与 KGQA 的唯一差别在于,黄金关系路径 $w_g = e_t \xrightarrow{r_1} e_1 \xrightarrow{r_2} \dots \xrightarrow{r_l} e_a$ 上存在至少一条三元组不在图谱中;模型必须从 LLM 内部知识或子图信息中把它补回来。
- 数据构造:以 Freebase 为背景图谱,基于 WebQSP 与 CWQ 两个公开数据集,用 SPARQL 取回每题涉及的全部三元组,过滤属性节点后按概率 $p$ 采样删除($p$ 取 20% / 40% / 60% / 80%);除该三元组外,两个实体之间的全部关系也一并删除,避免「只删一条边」的取巧。为控制成本,每档各取 1{,}000 题,并丢弃删除后主题实体成为孤立点的样本。
- 统计特征:CWQ 在四档下平均删除 2.2 / 4.3 / 6.4 / 7.9 条边,主题实体中位邻居数稳定在 26–27;WebQSP 对应为 6.6 / 13.9 / 20.3 / 27.4 条边,中位邻居数 426–428。WebQSP 以单跳题为主、CWQ 含更多多跳与 CVT 结构,这解释了两者对缺失敏感度的差异。
图 1:论文 Figure 1 —— 三类问答任务的对比:(a) 仅用 LLM、(b) 知识图谱问答(KGQA)、(c) 不完整知识图谱问答(IKGQA),其中三元组 (Cupertino, timezone, Pacific Standard Time) 已从图谱中缺失;黄色与红色节点分别表示主题实体与答案实体。
分类全景
论文把「LLM + KG」的结合方式归为三类范式,GoG 在此基础上新增了「生成式补全」这一路:
图 8:LLM + KG 问答方法分类全景(Mermaid 树状图)——语义解析(KB-BINDER / ChatKBQA)、检索增强(ToG / RoG / StructGPT)、仅提示(IO / CoT / CoT+SC),以及 GoG 的生成式补全(Thinking-Searching-Generating)。
图 2:论文 Figure 2 —— LLM 与 KG 结合的三种范式:(a) 语义解析把 LLM 当解析器、(b) 路径检索把 LLM 当路径查找器、(c) GoG 让 LLM 既是探索图谱的智能体,又是生成新三元组的 KG。
方法细节
GoG 是一个训练-free框架:不更新任何参数,全部能力来自提示工程与模型底座。它以 ReAct 式的Thought–Action–Observation交错推进,每一步先产出一个思考 $t_i$,再据此选择动作 $a_i$,直到信息充分后输出 $Finish[e_a]$(也可能输出 $Finish[unknown]$,此时回退多搜一跳):
- Thinking(思考):分解原问题(Thought 1)、决定下一个要解的子问题(Thought 2),或判断信息是否已足够输出答案(Thought 4)。它相当于给搜索注入了「全局规划」,而 ToG 缺少整体规划,容易重复探索或迷路。
- Searching(搜索):以 $Search[e_i]$ 形式调用,先由预定义 SPARQL 查询取回目标实体的全部邻居关系 $R_i$,再让 LLM 依据当前思考筛出最相关的 top-N 关系 $R'_i$,从而得到最相关实体集合 $E_i$。例如从 ${founder, headquarter, CEO}$ 中只为「Apple 总部在哪」选出 $headquarter$。其搜索是动态子图扩张的:信息不足就多搜一跳,因此能处理被 ToG 跳过的 CVT 节点。
- Generating(生成):以 $Generate[t_i]$ 形式调用,分三步——先用 BM25 从历史 Observation 中挑出最相关的三元组(choosing),再让 LLM 结合内部知识生成新的候选三元组(generating,重复 $n$ 次以压低幻觉),最后用 LLM 验证并保留更可能正确的部分(verifying)。若生成了此前未探索的实体,还需经 BM25 检索候选实体并用 LLM 依据类型完成实体链接。
图 3:论文 Figure 2(c) / 框架图 —— GoG 的 Thinking–Searching–Generating 循环:LLM 既作为探索图谱的智能体,又作为生成缺失事实三元组的 KG。
实验设计与结果
评测指标为Hits@1(top-1 预测正确的题目占比)。基线分三组:仅提示(IO prompt、CoT、CoT+SC)、语义解析(KB-BINDER、ChatKBQA)、检索增强(StructGPT、RoG、ToG)。四个底座 LLM 为 GPT-3.5、GPT-4、Qwen-1.5-72B-Chat 与 LLaMA-3-70B-Instruct;每次生成上限 256 tokens、温度 0.7、提示一律 3-shot。
主结果(完整 KG 记 CKG,随机删去 40% 关键三元组记 IKG-40%):
| 方法 | CWQ CKG | CWQ IKG-40% | WebQSP CKG | WebQSP IKG-40% |
|---|---|---|---|---|
| CoT+SC(无 KG) | 45.4 | — | 61.1 | — |
| ChatKBQA(需绑定) | 76.5 | 39.3 | 78.1 | 49.5 |
| ToG(GPT-3.5) | 47.2 | 37.9 | 76.9 | 63.4 |
| GoG(GPT-3.5) | 55.7 | 44.3 | 78.7 | 66.6 |
| ToG(GPT-4) | 71.0 | 56.1 | 80.3 | 71.8 |
| GoG(GPT-4) | 75.2 | 60.4 | 84.4 | 80.3 |
要点:GoG 在完整图与不完整图上同时领先全部提示式方法;GPT-4 底座下完整 KG 的 75.2 / 84.4 已超过大多数需要微调的方法。
不同缺失档位下的表现(GPT-3.5):
| 数据集 / 方法 | CKG | IKG-20% | IKG-40% | IKG-60% | IKG-80% |
|---|---|---|---|---|---|
| CWQ · ToG | 47.2 | 40.5 | 37.9 | 33.7 | 31.4 |
| CWQ ·GoG | 55.7 | 44.9 | 44.3 | 36.2 | 34.4 |
| WebQSP · ToG | 76.9 | 70.3 | 61.4 | 60.6 | 55.9 |
| WebQSP ·GoG | 78.7 | 70.8 | 66.6 | 62.6 | 56.5 |
在 CWQ 上 GoG 相对对比方法平均提升约 5.0 个百分点;即便图谱删去 80% 关键三元组,GoG 仍保持领先(CWQ 34.4 vs ToG 31.4)。
Generate 动作消融(Qwen-1.5-72B 底座):
| 设置 | CWQ CKG | CWQ IKG-40% | WebQSP CKG | WebQSP IKG-40% |
|---|---|---|---|---|
| GoG 去掉 Generate | 62.7 | 48.6 | 74.7 | 69.4 |
| GoG 含 Generate | 63.3 | 50.6 | 77.9 | 71.1 |
去掉生成动作后四个设置全部下降,验证了「生成式补全」承担了关键性能。论文同时分析了相关三元组数量的影响:性能随相关子图先升后降——子图能激活 LLM 记忆、生成更准确的三元组,但过多会引入噪声。
图 4:论文 Figure 4 —— Generate 动作中相关三元组数量对 GoG 在 CWQ 与 WebQSP 上 Hits@1 的影响(底座 Qwen-1.5-72b-chat),性能先升后降。
典型案例——CVT 结构:Freebase 用复合值类型(CVT)节点建模事件(可含起止时间、地点等)。ToG 倾向于认为 CVT 节点「不值得继续探索」而在其处走失,GoG 则因动态子图扩张而向 CVT 外多搜一跳,取回正确实体。
图 5:论文附录图 —— Freebase 中的复合值类型(CVT)节点示例;ToG 倾向于跳过 CVT,GoG 会继续外扩。
错误分析:论文把错误分为四类——生成错误、分解错误、幻觉、假阴性。剔除假阴性后,幻觉是实际错误的主要来源;而在不完整 KG 下假阴性更常见(例如模型输出 "The US" 而标准答案是 "America")。
图 6:论文附录图 —— GoG 在不同数据集与不同 KG 设置下的错误占比;剔除假阴性后仍以幻觉为主导。
结果对比总结
图 9:GoG 与 ToG 结果对比(Mermaid 流程图)——CWQ 完整 KG 71.0→75.2、IKG-40% 56.1→60.4,均实现约 4 个百分点的提升;不用 KG 的 CoT+SC 在 CWQ 上仅 45.4。
关键发现
- 「完整性假设」是被实测证伪的:ChatKBQA 在 CWQ 上从 76.5 崩到 39.3,ToG 从 47.2 降到 37.9,后者甚至低于不用 KG 的 45.4——说明它们并未真正融合内部与外部知识。
- 生成式补全承担了性能:去掉 Generate 动作后四个设置一致下降——CWQ 完整 KG 63.3→62.7、IKG-40% 50.6→48.6,WebQSP 完整 KG 77.9→74.7、IKG-40% 71.1→69.4。
- 动态子图扩张是 CVT 的解药:GoG 在 CVT 密集的 CWQ 完整 KG 上以 55.7 超过 ToG 的 47.2,差距约 8.5 个百分点。
- 底座越强收益越明显:GPT-4 下 GoG 在 CWQ / WebQSP 的 IKG-40% 达到 60.4 / 80.3,完整 KG 达到 75.2 / 84.4,超过绝大多数微调方法。
- LLM 的两种角色并不等价:NKG 设置下 Llama-3 稳定优于 Qwen-1.5,而 CKG 设置下恰好相反——说明「当 KG」与「当 Agent」的能力可分离,值得后续研究。
- 幻觉是首要误差来源:剔除假阴性后,四类错误中幻觉占比最高,且随图谱不完整度上升,假阴性占比也明显抬升。
局限性
- 生成动作可能产生幻觉:LLM 生成的缺失三元组本身可能错误,论文认为这对现有 LLM 无法根除。
- 极端不完整下不及 CoT:当 KG 非常不完整时,GoG 的表现可能低于 CoT 提示,仍有改进空间。
- 评测用「随机删除」模拟不完整:这与真实世界图谱的非随机缺失方式未必一致,泛化性有待验证。
- 底座版本较早:实验使用 gpt-3.5-turbo-0613、gpt-4-0613、Qwen-1.5-72B、Llama-3-70B 等模型,结论在新一代模型上是否同样成立仍需检验。
- 实体链接依赖 BM25 + LLM 判别:生成新实体时需要额外链接到 Freebase 的 MID,这一环节也可能成为误差来源。
常见问题(FAQ)
GoG 到底解决什么问题?
它解决「知识图谱不完整」这一真实但被传统 KGQA 评测忽略的问题:当回答问题所需的三元组不在图谱里时,让 LLM 一方面当智能体探索图谱,一方面当知识图谱生成并验证缺失的事实三元组。
IKGQA 与普通 KGQA 的区别是什么?
唯一区别在于黄金关系路径上是否存在缺失的三元组。KGQA 保证路径上的每条三元组都在图谱中,而 IKGQA 允许缺失,因此模型必须真正融合 LLM 内部知识与外部图谱知识。
GoG 需要训练吗?
不需要。GoG 是训练-free 的,全部能力来自提示工程(Thinking-Searching-Generating 三步提示,均 3-shot)与底座模型本身,换数据集或换底座只需改提示。
GoG 与 ToG 的关键差别?
ToG 只探索与图谱路径,缺乏全局规划,容易重复探索或走失;GoG 每步先分解子问题并做动态子图扩张,还能在找不到答案时生成缺失三元组,因此在完整图与不完整图上都更强。
GoG 的主要误差来源?
剔除假阴性后以幻觉为主——生成动作可能产出错误三元组,或最终答案不被上下文证据支持,但因 LLM 自验证并非独立事实核查,这类错误难以完全消除。
参考链接
- 论文 arXiv 摘要页:arxiv.org/abs/2404.14741
- ACL Anthology 正式版:aclanthology.org/2024.emnlp-main.1023
- 官方代码库:github.com/YaooXu/GoG
- 关键基线 ToG:Think-on-Graph (arXiv 2307.07697)
- 关键基线 ReAct:ReAct: Synergizing Reasoning and Acting (arXiv 2210.03629)
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟复旦大学 FudanNLP 团队自研 切问学术
官网:qiewenpaper.com
覆盖3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群:白拾的小屋 (750365700)
⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页:YhbCode000(工程文件)