AI-Scientist 快速上手指南:如何跑通第一个全自动科研实验
2026/9/12 3:58:22 网站建设 项目流程

AI-Scientist 快速上手指南:如何跑通第一个全自动科研实验

【免费下载链接】AI-ScientistThe AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery 🧑‍🔬项目地址: https://gitcode.com/GitHub_Trending/ai/AI-Scientist

它是什么:AI-Scientist 在全自动科研里做什么 🧑‍🔬

当「提想法 → 跑实验 → 写论文」这条链路可以压缩成一条启动命令时,你要做的不再是逐行写实验代码,而是选模板、配密钥、验收交付的 PDF。The AI Scientist(AI-Scientist)就是一个由大语言模型驱动的全自动科学发现系统:它替你生成研究想法、修改并执行实验脚本、用 LaTeX 写出论文,最后再让 LLM 以审稿人身份打分。系统内置三大官方模板——NanoGPT(Transformer 下一词元预测)、2D Diffusion(低维数据的扩散生成)和 Grokking(深度网络的突然泛化),入口统一在 launch_scientist.py,核心逻辑分布在 ai_scientist/ 的generate_ideas.pyperform_experiments.pyperform_writeup.py等模块中。

选择你的部署路径:三种方案按背景自选

快速起步:5 行命令内完成安装

最简路径是克隆仓库、建一个 Python 3.11 的 Conda 环境并装上 requirements.txt 里的依赖:

git clone https://gitcode.com/GitHub_Trending/ai/AI-Scientist cd AI-Scientist conda create -n ai_scientist python=3.11 && conda activate ai_scientist pip install -r requirements.txt

注意:实验依赖 NVIDIA GPU(CUDA + PyTorch),纯 CPU 机器上模板跑不完,这点在仓库 README 中有明确说明。

容器化部署:一个镜像打包依赖与基线

如果你不想在本机装 texlive 这类重型依赖,可以用仓库自带的 Dockerfile 构建镜像。镜像基于 python:3.11,已预装 texlive-full 并跑好了三个模板的基线run_0

docker build -t ai-scientist -f experimental/Dockerfile . docker run -e OPENAI_API_KEY=$OPENAI_API_KEY ai-scientist --experiment grokking --num-ideas 2

镜像的 entrypoint 直接调用launch_scientist.py,所以第二条命令就是完整的一次实验。

完整配置:补上 LaTeX 与模板依赖

在宿主机上跑完整流程,还需补两类依赖:论文编译需要pdflatexchktex(来自 texlive-full),grokking 模板需要einops,2D Diffusion 模板需要scikit-learn(外加 NPEET 库):

sudo apt-get install texlive-full pip install einops scikit-learn

texlive-full安装耗时较长属正常现象;装完后launch_scientist.py会在启动前自动检查pdflatex/chktex是否可用。

选一个模板跑第一个实验:三大模板对比与启动命令

先按你的场景挑模板。三个官方模板的数据需求和运行入口各不相同,对比如下:

模板适合场景数据 / 额外依赖运行入口
nanoGPTTransformer 下一词元预测优化enwik8、shakespeare_char、text8,需先跑 data/ 下 3 个prepare.pypython experiment.py --out_dir run_0
2d_diffusion低维数据上的扩散生成模型模板内置 DatasaurusDozen 数据集;需装 NPEET + scikit-learnpython experiment.py --out_dir run_0
grokking泛化与学习速度(突然理解)研究内置算术任务;只需pip install einopspython experiment.py --out_dir run_0

新手推荐从 grokking 起步:数据自包含、依赖最少。启动顺序是「先在本机跑基线 run_0(不同硬件的运行时间对比才准确),再启动 AI-Scientist 本体」:

cd templates/grokking && python experiment.py --out_dir run_0 && python plot.py cd ../.. && python launch_scientist.py --experiment grokking --num-ideas 2

跑之前先给要用的模型配置密钥,OpenAI / Claude / DeepSeek 三选一(ai_scientist/llm.py 里可见完整支持列表):

export OPENAI_API_KEY="你的密钥" export ANTHROPIC_API_KEY="你的密钥" export DEEPSEEK_API_KEY="你的密钥"

--num-ideas 2表示只生成并执行 2 个想法(默认 50),首次跑通全流程足够。

看结果:如何读实验图表、曲线与生成样本 📈

实验结束后,每个想法的产物都落在results/<模板名>/<时间戳>_<想法名>/目录下。优先看四个文件:notes.txt记录了 run_0 基线与后续各 run 的指标对比;run_0run_N里的final_info.json存着各项指标的均值;review.txt是 LLM 审稿结果,包含 1~10 的 Overall 分数与 Accept/Reject 决定;同名的.pdf则是写好的论文。判断想法是否有效,核心动作是拿 run_1 之后的曲线去对比 run_0 基线。

grokking 模板的图重点看泛化跃迁:下面这张验证准确率对比图中,横轴是训练步数,x_plus_yx_minus_y等四条任务曲线在训练准确率爬升后,验证准确率会同步跳升到接近 99%——这个「突然变好」的拐点就是 grokking 现象,也是论文结论的主要依据。

2D Diffusion 模板则用肉眼验收:生成样本图展示模型在低维数据上采样的点云分布,与真实数据集形状越贴合,说明分布捕捉得越好;配套的train_loss.png类曲线用于确认训练本身收敛。

调优与排障:控成本、开并行、解决常见报错 🛠️

调优时抓住三个参数就够:

  • --num-ideas:想法数量,默认 50。首次建议 2~3 个验证流程,确认稳定后再放大。
  • --parallel--gpus:多卡环境用--parallel 2 --gpus "0,1"让每张 GPU 领一个想法;GPU 数不够时会自动降回可用卡数。
  • --model:决定成本与成功率。官方 FAQ 给出参考值——Claude Sonnet 3.5 下每篇论文通常不足 15 美元,DeepSeek Coder V2 更省钱;审稿环节建议用 GPT-4o 以获得更稳定的输出格式。

常见报错按「症状 → 解决方案」自查:

症状解决方案
报缺少数据文件先运行对应模板的数据准备脚本,如python data/enwik8/prepare.py
提示pdflatexchktex未找到安装texlive-full,或改用容器化镜像
Semantic Scholar 查重/引用失败改用--engine openalex(免 API 密钥),或用--skip-novelty-check跳过
某个想法没生成 PDF 或 review成功率取决于模板与基础模型,换更强的模型(如 Claude Sonnet 3.5)重试
担心 LLM 生成代码的自主执行风险用 Docker 镜像运行并限制网络访问,README 对此有专门警示

一条launch_scientist.py命令就能让 AI-Scientist 自主走完「想法 → 实验 → LaTeX 论文 → LLM 审稿」四个环节,交付物是带审稿意见的 PDF 论文。如果你有自研方向,可以照着templates/experiment.py+plot.py+prompt.json的格式再扩一个自己的模板。现在就去配好密钥,选 grokking 模板,跑通你的第一个想法吧。

【免费下载链接】AI-ScientistThe AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery 🧑‍🔬项目地址: https://gitcode.com/GitHub_Trending/ai/AI-Scientist

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询