终极开源AI研究Agent AutoResearch:从研究Idea到论文就绪证据的完整指南
【免费下载链接】AutoResearchAI/ML research agents from idea to paper-ready evidence. An EvoMap open-source project.项目地址: https://gitcode.com/gh_mirrors/autore/AutoResearch
AutoResearch 是一个开源 AI 研究 Agent工作流:给它一份研究 Idea(或让它自己从近期论文、开发者社区与开源趋势中寻找方向),它会自动完成实验规划、编码、审查、运行、结果分析与独立评审,最终产出一份可直接用于论文写作的"论文就绪证据"包。整个流程有状态、可恢复,长任务中断后可以接着跑。本指南将带你三步上手这个 AI 研究 Agent。
📌 一句话核心理念:Insight In, Hallucination Out—— 用真实研究信号约束问题发现,用多模型交叉评审防止"模型自己给自己打分",负结果也可以作为合法终态保留证据。
一、为什么你需要一个 AI 研究 Agent?
对研究者来说,最耗时的往往不是 Idea 本身,而是这三件事:
- 发现问题:海量新论文中,怎么找到值得做的方向?
- 实验管理:规划、编码、运行、日志、分析,任何一步缺失结果都不可用;
- 自评估偏差:让单个模型"自己出题自己批",自评虚高几乎是必然。
AutoResearch 的 6 项核心能力正是对症下药:
| 能力 | 你能得到什么 |
|---|---|
| 跨领域 Idea 生成 | 用近期外部信号发现问题,再叠加你自己的领域知识 |
| 多模型独立评审 | Idea 生成至少 3 个不同模型参与,避免单模型自我通过 |
| 有状态实验执行 | 计划、代码、日志、结论全部落盘,长任务中断可恢复 |
| 先预实验再决定放大 | 用小成本验证可行性,再决定正式实验还是及时止损 |
| 证据与来源可追踪 | Forge 来源、知识方向、实验结果、盲审全程留痕 |
| 支持负结果 | 假设不成立时保留证据并结束,不必强行"成功" |
二、一键安装步骤:克隆仓库并初始化环境
环境要求很低:一台 Linux/SSH 机器 + Python 3.10+ 即可:
git clone https://gitcode.com/gh_mirrors/autore/AutoResearch cd AutoResearch bash scripts/bringup.shscripts/bringup.sh 会自动创建虚拟环境、安装依赖、运行基础测试与密钥扫描,并检查模型配置——全程不向模型服务发请求、不产生任何 API 费用。
💡 提示:首次运行还没填 API Key 时,最终显示
BLOCKED或非零退出是正常现象,只表示环境就绪,接下来补齐凭证即可。
三、最快配置方法:模型服务三步接入
第 1 步,创建本地配置(已有文件时不会覆盖):
test -f .env || cp .env.example .env test -f config/providers.local.json || \ cp config/providers.example.json config/providers.local.json第 2 步,编辑两个文件:
.env:存放 API 地址、Key 等本机私密值(严禁提交到 Git);config/providers.local.json(模板见 config/providers.example.json):声明 endpoint、模型代称,以及每个角色使用哪些模型。
⚠️ 注意:AutoResearch不要求固定的 Gemini + GPT + Claude 组合,任意兼容端点都可以;同一端点也可以承载多个不同模型。
第 3 步,实测预检:
set -a; . ./.env; set +a .venv/bin/python scripts/preflight.py --live退出码为0说明所有角色都有可用模型,且多模型环节满足独立性要求。完整配置字段说明见 docs/unified_provider_config.md 与 docs/llm_provider_setup.md。
四、Idea 生成流程:从研究信号到实验计划
如果你还没有明确 Idea,推荐走这条路径。
4.1 三步"领域交叉"法
- 采集:从 arXiv、HuggingFace Daily Papers、GitHub Trending、Hacker News、OpenReview 等 11 个公开渠道收集近期研究信号;
- 筛选:聚合、跨天去重、模型初筛与深入研判;
- 交叉:入选信号与 knowledge_base/ 中的本地知识方向组合,由 3 个以上模型独立构思、交叉评审,最终生成实验计划。
内置知识方向可以这样列出或按关键词过滤:
.venv/bin/python src/idea_forge/b_library.py agent想新增自己的知识方向,复制 knowledge_base/TEMPLATE.md,按模板写清问题、约束、基线与常见误区即可。知识库看板由 src/generate_kb_dashboard.py 生成,效果如下:
该看板展示每个领域方向对应的知识文档、大小与章节数。仓库附带的是合成示例方向,请替换为自己的真实领域知识。
4.2 运行流水线并选择 Idea
.venv/bin/python idea_generation.py主要产出:
| 路径 | 内容 |
|---|---|
data/candidates/ | 聚合后的候选研究信号 |
data/verified/ | 筛选与深度研判结果 |
data/idea_forge/ | 完整 Idea、评审结果与实验计划 |
logs/ | 运行日志 |
🔄 如果之前已采集过种子,可用 run_pending_forge.py 直接补跑 Forge,无需重新联网采集。
Idea 生成不会自动替你挑选最终计划。用 src/idea_provenance.py 列出可执行计划并导出到你选中的 Idea 文件,导出时自动写入 Forge 文件校验和、种子序号、计划序号与知识方向——每个实验结果从此都可溯源。
五、已有 Idea 直接执行:从研究想法到论文证据
如果研究假设已经就绪,把它写进一个文本文件(至少描述假设、可用数据、成功指标、算力与时间约束),放到data/ideas/下即可开始。
执行运行时位于 ar-runtime/ 目录,推进顺序为:
Idea → 计划 → 计划评审 → 编码 → 代码评审 →Pilot 预实验→ 放大或停止 → 主实验 → 结果分析 →Critic 独立评审→ 盲审 → 关闭
其中两个设计点尤其值得新手注意:
- 先 Pilot 再放大:预实验失败就及时止损,省下宝贵的 GPU 时间与费用;
- 接受负结果:只要运行证据完整、分析可信,负结果同样是合法终态。
状态机与恢复细节见 ar-runtime/ar-coordinator-startup-flow.md。
5.1 启动 Coordinator
⚠️ 安全提醒:执行环境应当隔离且可丢弃,不要挂载宿主机 home 目录、SSH agent 或云凭证。
cd ar-runtime claude --dangerously-skip-permissions在 Claude Code 内输入:
/ar-coordinator ../data/ideas/my_experiment.txt ../data/projects/my_experiment非交互场景请使用 ar-runtime/scripts/ar-supervisor.sh:它管理超时、重启预算与进程组回收,并为每次 attempt 保存独立 manifest,失败记录不会被后续成功覆盖。
5.2 监控项目进度
项目全过程落盘在data/projects/<项目名>/下:plan.md(实验计划)、code/(实验代码)、results/(日志与指标)、decisions.log(追加式决策日志),以及 Critic 与盲审文件。项目监控看板由 src/generate_project_dashboard.py 生成:
从面板可以直观看到每个工作单元(Initialize → Plan → Implement → Code review → Fix issues → Run experiment → Analyze results → External review → Close)的完成状态、评审门禁结果,以及独立 Critic 主副评审的健康度与置信度。
🎯 GPU 刚就绪时,建议先跑内置的冒烟测试 examples/idea_gpu_smoke.txt,确认执行链路真正用上了 GPU,把"环境问题"与"Idea 问题"分开排查。
六、多模型角色配置:谁用什么模型?
AutoResearch 只有一个模型配置入口:config/providers.local.json。Python 流水线、预检、Claude Code 投影与 reviewer/critic 全部读取同一组角色定义。角色分三大组:
| 阶段 | 主要角色 | 模型要求 |
|---|---|---|
| Idea 信号筛选 | screener初筛、judge研判、consensus_checker共识核查 | 各 1 个模型 |
| Idea 生成与验证 | ideator多模型构思、planner实验计划、freshness_refresher时效刷新 | ideator需≥3 个不同模型 |
| Idea 执行 | agent驱动、code_reviewer代码评审、critic(+可选critic_secondary)、run_monitor日志压缩 | 两个 Critic 角色必须互不相同 |
简化的角色映射示例:
{ "roles": { "screener": {"models": ["fast-model"]}, "judge": {"models": ["strong-model"]}, "ideator": {"models": ["strong-model-a", "strong-model-b", "strong-model-c"]}, "planner": {"models": ["strong-model-a"]}, "agent": {"models": ["strong-model-a"]}, "code_reviewer": {"models": ["strong-model-b"]}, "critic": {"models": ["strong-model-c"]} } }注意:独立性按实际模型身份计数——两个代称解析到同一底层模型只算一个模型,不同模型则可以共用一个端点。
七、新手避坑 FAQ
Q:必须同时用 Gemini、GPT 和 Claude 吗?不需要。普通角色可以共用同一个模型,只有 Idea Forge(≥3 个不同模型)与两个启用的 Critic 角色(互不相同)有独立性要求,且它们可以来自同一个提供商或同一个兼容端点。
Q:没有 GPU 能用吗?可以。Idea 生成流程在 CPU 机器上就能跑;执行阶段是否需要 GPU 取决于实验本身,而流程天生以 Pilot 预实验开场,资源不匹配会被尽早发现。
Q:某个采集渠道返回 403 怎么办?外部站点可能有地域、频率或出口 IP 限制。某个渠道失败时,流水线会记录失败、跳过该渠道并继续处理其他来源,不会把缺失伪装成成功。
Q:为什么 Idea 生成很慢?调用量随种子数、知识方向数与模型席位数增长,交叉评审还会再次调用每个席位。建议先用小集合知识方向 + 默认并发验证流程,稳定后再放大。
八、延伸阅读清单
- 完整文档:README_CN.md / README.md
- 架构与数据流:ARCHITECTURE.md
- 统一模型配置详解:docs/unified_provider_config.md
- 模型提供商接入与验证:docs/llm_provider_setup.md
- 知识库模板:knowledge_base/TEMPLATE.md
AutoResearch 不保证每个结论都正确,但它保留了研究者复查所需的全部证据与状态——这正是一个靠谱的 AI 研究 Agent 最该做到的事。
【免费下载链接】AutoResearchAI/ML research agents from idea to paper-ready evidence. An EvoMap open-source project.项目地址: https://gitcode.com/gh_mirrors/autore/AutoResearch
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考