- 人工智能
- 大模型
- AI Agent
- 自主智能体
- 深度研究
- Agent 工作流
- 科研
- AI 评测
【免费下载链接】AI-Researcher
[NeurIPS2025] "AI-Researcher: Autonomous Scientific Innovation" -- A production-ready version: https://novix.science/chat
本文围绕 AI-Researcher 创新图谱(Innovation Graph)构建流水线中的Step 1:引文模式分析(Citation Pattern Analysis)指令展开,讲解该指令如何引导大语言模型(LLM)从一篇论文的参考文献中构建"引文统计地图",并阐明其在整个五步创新图谱流水线中的定位、JSON 输出契约与源码级调用链。读完本文,你将掌握该指令的字段语义、与 Step 2~5 的衔接关系,以及如何在1_create_inno_graph.py中实际驱动这一分析步骤。
一、Step 1 指令在流水线中的定位
AI-Researcher 的 benchmark 构建脚本 1_create_inno_graph.py 负责将一批论文加工成"创新图谱"数据集。在load_instructions()中,脚本一次性加载了 8 份指令文件,其中 5 份构成核心分析链:
| 指令文件 | 步骤 | 核心任务 |
|---|---|---|
| create_innovation_graph_instruction_overall.md | 全局 | 按三类标准识别最有影响力的参考文献 |
| create_innovation_graph_instruction_step1.md | Step 1 | 引文模式分析(统计地图) |
| create_innovation_graph_instruction_step2.md | Step 2 | 上下文分析(影响力指标) |
| create_innovation_graph_instruction_step3.md | Step 3 | 证据收集(借用与改进) |
| create_innovation_graph_instruction_step4.md | Step 4 | 影响力度量(加权打分) |
| create_innovation_graph_instruction_step5.md | Step 5 | 最终筛选(Top 15–25 排序) |
Step 1 是整个链条的第一环,其产出直接喂给 Step 2 做上下文分析(results作为previous_results传入后续步骤)。从源码看,process_step在拼接提示词时会把前序步骤的 JSON 结果追加到当前提示词末尾:
if previous_results and step_num > 1: prev_results_str = json.dumps(previous_results, indent=2) prompt += f"\n\nResults from previous steps:\n{prev_results_str}"因此 Step 1 的citation_map质量决定了后续所有步骤的分析基底。
二、全局指令:三类影响力判据(Overall Instruction)
在进入 Step 1 之前,LLM 首先收到 overall 指令,它定义了贯穿全流程的影响力判定框架:
- 方法论奠基(Methodological Foundation):提供核心方法的论文;
- 关键组件(Critical Components):其具体技术被整合进新模型的论文;
- 概念启发(Conceptual Inspiration):塑造研究方向的论文。
这三类判据在 Step 3 的evidence.type字段(foundation/component/inspiration)和 Step 5 的top_papers.type字段(methodological/component/conceptual)中被显式落地,Step 1 的统计结果则为其提供候选池。
三、Step 1 任务分解:四类统计动作
Step 1 指令 的核心是"为论文中的引用创建统计地图(statistical map)",共包含四项动作:
- 统计引用频率(Count citation frequency):对每篇被引论文统计其在全文被引用的次数,这是后续 Step 4 中
frequency(权重 30%)的直接数据来源; - 追踪引用位置(Track citation locations):记录引用出现在哪些章节(如 Introduction、Methodology、Experiments),对应 Step 4 中
location(权重 25%)的判定依据——出现在方法章节的引用通常比出现在引言中的引用更具影响力; - 标注跨章节引用(Note cross-section citations):识别同一篇论文被多个章节引用的情况,这通常是该文献具备"全局影响力"的信号,也是区分奠基性工作与一次性引用文献的关键;
- 列出至少 15 篇最高频被引论文(List at least 15 most frequently cited papers):为 Step 5 的"Top 15–25 最终筛选"提供最小候选集下限,保证最终图谱的节点规模。
四、输出契约:citation_map JSON 结构
Step 1 要求 LLM 严格按如下 JSON Schema 输出:
{ "citation_map": [ { "reference": "the exact paper title in references", "count": number, "sections": ["section names"], "quotes": ["citation contexts"] } ] }各字段语义与下游用途:
| 字段 | 类型 | 说明 | 下游消费 |
|---|---|---|---|
reference | string | 参考文献中的精确论文标题(非编号),这是整条流水线的"主键" | Step 2/3/4/5 均以reference对齐各篇论文,并在最终输出中作为source_papers[].reference持久化 |
count | number | 该论文在全文中的被引次数 | Step 4 的frequency打分(占比 30%) |
sections | string[] | 引用出现的章节名列表 | Step 4 的location打分(占比 25%) |
quotes | string[] | 引用上下文原文片段 | Step 2 的indicators/quotes、Step 3 的evidence均以此为原始证据 |
要求reference必须使用"references 中的精确论文标题",这与脚本中的filter_self_references()逻辑直接相关——该函数通过source["reference"].lower().strip() == target_title.lower().strip()精确匹配来剔除论文对自身的引用(self-reference),标题不精确将导致自引无法被正确识别。
五、源码级调用链:指令如何被实际执行
在 process_step 中,Step 1 的执行流程如下:
- 组装提示词:
overall_instruction + step_instruction + Paper Metadata(JSON) + Paper Content(pdf_text),并通过truncate_text(prompt, max_tokens=128000)控制输入长度; - 注入系统提示:告知 LLM 它是论文分析专家、当前执行 Step 1、必须按指令规定的 JSON 格式输出;
- 调用 LLM:
client.chat(prompt, temperature=0.7),温度设为 0.7 以在结构化输出与多样性之间取得平衡; - 响应清洗:剥离
```json/```围栏后执行json.loads(response),解析失败则该步骤返回None; - 失败重试:外层
for attempt in range(max_retries)(默认 3 次)对每次解析失败或异常进行退避重试((attempt + 1) * 5秒等待)。
每篇论文的完整 LLM 交互(Prompt + Response)会通过log_output()写入innovation_graph/logs/llm_output_*.log,便于事后审计与复现。Step 1 成功后,结果存入results["step1"],随后立即执行await asyncio.sleep(5)做限流,再进入 Step 2。
六、与后续步骤的衔接:从统计到排序
理解 Step 1 的价值必须放到五步链条中看:
- Step 2(Context Analysis)接收
citation_map,对高频论文分析其讨论语境,提取"based on / extends"等影响力指示短语,并判定讨论深度(detailed/moderate/brief)与是否属于方法论引用(is_method); - Step 3(Evidence Collection)针对显著引用识别借用概念(
borrowed)、改进方式(changes)、佐证引文(evidence)及影响类型; - Step 4(Impact Scoring)按四维权重打分:frequency 30%、location 25%、depth 25%、influence 20%;
- Step 5(Final Selection)依据总分排序选出 Top 15–25 篇最具影响力论文,作为该目标论文的
source_papers写入创新图谱。
以仓库实际产物 innovation_graph.json 为例,HGCL 论文的source_papers中,"Sequential recommendation with graph neural networks" 以type: ["methodological"]排第 1 位,usage字段明确写道其 GNN 概念是 HGCL 的方法论主干——这正是从 Step 1 的引用频率统计出发,经 Step 2~5 层层筛选后沉淀出的结构化结论。
七、使用前提与注意事项
- 运行环境:需要全局配置 OpenAI API Key(或修改 utils/openai_utils.py),执行顺序为:先准备
papers_to_search文件 → 运行python 0_crawl_paper.py采集论文 → 运行python 1_create_inno_graph.py生成图谱; - 自引过滤:最终数据集 innovation_graph_final.json 经过
filter_self_references()剔除自引,统计信息写入日志;评测使用的 merged_papers_with_fields.json 还经过额外人工修订; - 输出契约的严格性:Step 1 要求
reference精确匹配参考文献标题,后续所有步骤的论文对齐与自引剔除都依赖这一约束,实践时应提示模型禁用"文献编号"代替标题。
综上所述,Step 1 引文模式分析并非简单的"数引用次数",而是为整条创新图谱流水线建立数据主键、频次基线与证据池的关键起点。开发者可直接复用该指令文件、按上述 JSON 契约自行构建论文影响力分析,也可结合1_create_inno_graph.py的调用逻辑将其接入自己的批量论文分析流程。
- 人工智能
- 大模型
- AI Agent
- 自主智能体
- 深度研究
- Agent 工作流
- 科研
- AI 评测
【免费下载链接】AI-Researcher
[NeurIPS2025] "AI-Researcher: Autonomous Scientific Innovation" -- A production-ready version: https://novix.science/chat
相关推荐
AI-Researcher 创新图构建实战:五步 LLM 指令流水线挖掘论文影响力并生成基准数据集
AI Researcher 创新图构建实战:五步 LLM 指令流水线挖掘论文影响力并生成基准数据集 导读 本文深入剖析 AI Researcher 开源仓库中
人工智能大模型AI Agent自主智能体深度研究Agent 工作流科研AI 评测Wekan 数据持久化架构升级实战:泳道高度与列表宽度的 Per-Board/Per-User 分离方案
Wekan 数据持久化架构升级实战:泳道高度与列表宽度的 Per Board/Per User 分离方案 本文是一份围绕 Wekan(基于 Meteor 的开源
人工智能大模型AI Agent自主智能体深度研究Agent 工作流科研AI 评测Tegon自定义视图终极指南:如何创建完美适配团队需求的工作面板
Tegon自定义视图终极指南:如何创建完美适配团队需求的工作面板 Tegon是一款面向开发者的开源问题跟踪工具,作为Jira和Linear的替代品,它提供了强大
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考