☰
AI-Researcher 论文影响力挖掘:Step 1 引文模式分析(Citation Pattern Analysis)指令深度解读
2026/10/2 2:22:49 网站建设 项目流程
  • 人工智能
  • 大模型
  • AI Agent
  • 自主智能体
  • 深度研究
  • Agent 工作流
  • 科研
  • AI 评测

【免费下载链接】AI-Researcher

[NeurIPS2025] "AI-Researcher: Autonomous Scientific Innovation" -- A production-ready version: https://novix.science/chat

项目地址:https://gitcode.com/GitHub_Trending/aire/AI-Researcher
点击查看免费下载

本文围绕 AI-Researcher 创新图谱(Innovation Graph)构建流水线中的Step 1:引文模式分析(Citation Pattern Analysis)指令展开,讲解该指令如何引导大语言模型(LLM)从一篇论文的参考文献中构建"引文统计地图",并阐明其在整个五步创新图谱流水线中的定位、JSON 输出契约与源码级调用链。读完本文,你将掌握该指令的字段语义、与 Step 2~5 的衔接关系,以及如何在1_create_inno_graph.py中实际驱动这一分析步骤。

一、Step 1 指令在流水线中的定位

AI-Researcher 的 benchmark 构建脚本 1_create_inno_graph.py 负责将一批论文加工成"创新图谱"数据集。在load_instructions()中,脚本一次性加载了 8 份指令文件,其中 5 份构成核心分析链:

指令文件步骤核心任务
create_innovation_graph_instruction_overall.md全局按三类标准识别最有影响力的参考文献
create_innovation_graph_instruction_step1.mdStep 1引文模式分析(统计地图)
create_innovation_graph_instruction_step2.mdStep 2上下文分析(影响力指标)
create_innovation_graph_instruction_step3.mdStep 3证据收集(借用与改进)
create_innovation_graph_instruction_step4.mdStep 4影响力度量(加权打分)
create_innovation_graph_instruction_step5.mdStep 5最终筛选(Top 15–25 排序)

Step 1 是整个链条的第一环,其产出直接喂给 Step 2 做上下文分析(results作为previous_results传入后续步骤)。从源码看,process_step在拼接提示词时会把前序步骤的 JSON 结果追加到当前提示词末尾:

if previous_results and step_num > 1: prev_results_str = json.dumps(previous_results, indent=2) prompt += f"\n\nResults from previous steps:\n{prev_results_str}"

因此 Step 1 的citation_map质量决定了后续所有步骤的分析基底。

二、全局指令:三类影响力判据(Overall Instruction)

在进入 Step 1 之前,LLM 首先收到 overall 指令,它定义了贯穿全流程的影响力判定框架:

  1. 方法论奠基(Methodological Foundation):提供核心方法的论文;
  2. 关键组件(Critical Components):其具体技术被整合进新模型的论文;
  3. 概念启发(Conceptual Inspiration):塑造研究方向的论文。

这三类判据在 Step 3 的evidence.type字段(foundation/component/inspiration)和 Step 5 的top_papers.type字段(methodological/component/conceptual)中被显式落地,Step 1 的统计结果则为其提供候选池。

三、Step 1 任务分解:四类统计动作

Step 1 指令 的核心是"为论文中的引用创建统计地图(statistical map)",共包含四项动作:

  • 统计引用频率(Count citation frequency):对每篇被引论文统计其在全文被引用的次数,这是后续 Step 4 中frequency(权重 30%)的直接数据来源;
  • 追踪引用位置(Track citation locations):记录引用出现在哪些章节(如 Introduction、Methodology、Experiments),对应 Step 4 中location(权重 25%)的判定依据——出现在方法章节的引用通常比出现在引言中的引用更具影响力;
  • 标注跨章节引用(Note cross-section citations):识别同一篇论文被多个章节引用的情况,这通常是该文献具备"全局影响力"的信号,也是区分奠基性工作与一次性引用文献的关键;
  • 列出至少 15 篇最高频被引论文(List at least 15 most frequently cited papers):为 Step 5 的"Top 15–25 最终筛选"提供最小候选集下限,保证最终图谱的节点规模。

四、输出契约:citation_map JSON 结构

Step 1 要求 LLM 严格按如下 JSON Schema 输出:

{ "citation_map": [ { "reference": "the exact paper title in references", "count": number, "sections": ["section names"], "quotes": ["citation contexts"] } ] }

各字段语义与下游用途:

字段类型说明下游消费
referencestring参考文献中的精确论文标题(非编号),这是整条流水线的"主键"Step 2/3/4/5 均以reference对齐各篇论文,并在最终输出中作为source_papers[].reference持久化
countnumber该论文在全文中的被引次数Step 4 的frequency打分(占比 30%)
sectionsstring[]引用出现的章节名列表Step 4 的location打分(占比 25%)
quotesstring[]引用上下文原文片段Step 2 的indicators/quotes、Step 3 的evidence均以此为原始证据

要求reference必须使用"references 中的精确论文标题",这与脚本中的filter_self_references()逻辑直接相关——该函数通过source["reference"].lower().strip() == target_title.lower().strip()精确匹配来剔除论文对自身的引用(self-reference),标题不精确将导致自引无法被正确识别。

五、源码级调用链:指令如何被实际执行

在 process_step 中,Step 1 的执行流程如下:

  1. 组装提示词:overall_instruction + step_instruction + Paper Metadata(JSON) + Paper Content(pdf_text),并通过truncate_text(prompt, max_tokens=128000)控制输入长度;
  2. 注入系统提示:告知 LLM 它是论文分析专家、当前执行 Step 1、必须按指令规定的 JSON 格式输出;
  3. 调用 LLM:client.chat(prompt, temperature=0.7),温度设为 0.7 以在结构化输出与多样性之间取得平衡;
  4. 响应清洗:剥离```json/```围栏后执行json.loads(response),解析失败则该步骤返回None;
  5. 失败重试:外层for attempt in range(max_retries)(默认 3 次)对每次解析失败或异常进行退避重试((attempt + 1) * 5秒等待)。

每篇论文的完整 LLM 交互(Prompt + Response)会通过log_output()写入innovation_graph/logs/llm_output_*.log,便于事后审计与复现。Step 1 成功后,结果存入results["step1"],随后立即执行await asyncio.sleep(5)做限流,再进入 Step 2。

六、与后续步骤的衔接:从统计到排序

理解 Step 1 的价值必须放到五步链条中看:

  • Step 2(Context Analysis)接收citation_map,对高频论文分析其讨论语境,提取"based on / extends"等影响力指示短语,并判定讨论深度(detailed/moderate/brief)与是否属于方法论引用(is_method);
  • Step 3(Evidence Collection)针对显著引用识别借用概念(borrowed)、改进方式(changes)、佐证引文(evidence)及影响类型;
  • Step 4(Impact Scoring)按四维权重打分:frequency 30%、location 25%、depth 25%、influence 20%;
  • Step 5(Final Selection)依据总分排序选出 Top 15–25 篇最具影响力论文,作为该目标论文的source_papers写入创新图谱。

以仓库实际产物 innovation_graph.json 为例,HGCL 论文的source_papers中,"Sequential recommendation with graph neural networks" 以type: ["methodological"]排第 1 位,usage字段明确写道其 GNN 概念是 HGCL 的方法论主干——这正是从 Step 1 的引用频率统计出发,经 Step 2~5 层层筛选后沉淀出的结构化结论。

七、使用前提与注意事项

  • 运行环境:需要全局配置 OpenAI API Key(或修改 utils/openai_utils.py),执行顺序为:先准备papers_to_search文件 → 运行python 0_crawl_paper.py采集论文 → 运行python 1_create_inno_graph.py生成图谱;
  • 自引过滤:最终数据集 innovation_graph_final.json 经过filter_self_references()剔除自引,统计信息写入日志;评测使用的 merged_papers_with_fields.json 还经过额外人工修订;
  • 输出契约的严格性:Step 1 要求reference精确匹配参考文献标题,后续所有步骤的论文对齐与自引剔除都依赖这一约束,实践时应提示模型禁用"文献编号"代替标题。

综上所述,Step 1 引文模式分析并非简单的"数引用次数",而是为整条创新图谱流水线建立数据主键、频次基线与证据池的关键起点。开发者可直接复用该指令文件、按上述 JSON 契约自行构建论文影响力分析,也可结合1_create_inno_graph.py的调用逻辑将其接入自己的批量论文分析流程。

  • 人工智能
  • 大模型
  • AI Agent
  • 自主智能体
  • 深度研究
  • Agent 工作流
  • 科研
  • AI 评测

【免费下载链接】AI-Researcher

[NeurIPS2025] "AI-Researcher: Autonomous Scientific Innovation" -- A production-ready version: https://novix.science/chat

项目地址:https://gitcode.com/GitHub_Trending/aire/AI-Researcher
点击查看免费下载

相关推荐

上一篇:Nexus Trust Exchange:面向 AI Agent 的去中心化信任交换层设计与实现解析
下一篇:CANN AMCT 结构化剪枝实战指南:从 MiniMLP 到 Qwen3.6-35B-A3B 的 MoE 专家剪枝与恢复微调

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询