AI-Scientist 快速上手指南:如何跑通第一个全自动科研实验
【免费下载链接】AI-ScientistThe AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery 🧑🔬项目地址: https://gitcode.com/GitHub_Trending/ai/AI-Scientist
它是什么:AI-Scientist 在全自动科研里做什么 🧑🔬
当「提想法 → 跑实验 → 写论文」这条链路可以压缩成一条启动命令时,你要做的不再是逐行写实验代码,而是选模板、配密钥、验收交付的 PDF。The AI Scientist(AI-Scientist)就是一个由大语言模型驱动的全自动科学发现系统:它替你生成研究想法、修改并执行实验脚本、用 LaTeX 写出论文,最后再让 LLM 以审稿人身份打分。系统内置三大官方模板——NanoGPT(Transformer 下一词元预测)、2D Diffusion(低维数据的扩散生成)和 Grokking(深度网络的突然泛化),入口统一在 launch_scientist.py,核心逻辑分布在 ai_scientist/ 的generate_ideas.py、perform_experiments.py、perform_writeup.py等模块中。
选择你的部署路径:三种方案按背景自选
快速起步:5 行命令内完成安装
最简路径是克隆仓库、建一个 Python 3.11 的 Conda 环境并装上 requirements.txt 里的依赖:
git clone https://gitcode.com/GitHub_Trending/ai/AI-Scientist cd AI-Scientist conda create -n ai_scientist python=3.11 && conda activate ai_scientist pip install -r requirements.txt注意:实验依赖 NVIDIA GPU(CUDA + PyTorch),纯 CPU 机器上模板跑不完,这点在仓库 README 中有明确说明。
容器化部署:一个镜像打包依赖与基线
如果你不想在本机装 texlive 这类重型依赖,可以用仓库自带的 Dockerfile 构建镜像。镜像基于 python:3.11,已预装 texlive-full 并跑好了三个模板的基线run_0:
docker build -t ai-scientist -f experimental/Dockerfile . docker run -e OPENAI_API_KEY=$OPENAI_API_KEY ai-scientist --experiment grokking --num-ideas 2镜像的 entrypoint 直接调用launch_scientist.py,所以第二条命令就是完整的一次实验。
完整配置:补上 LaTeX 与模板依赖
在宿主机上跑完整流程,还需补两类依赖:论文编译需要pdflatex和chktex(来自 texlive-full),grokking 模板需要einops,2D Diffusion 模板需要scikit-learn(外加 NPEET 库):
sudo apt-get install texlive-full pip install einops scikit-learntexlive-full安装耗时较长属正常现象;装完后launch_scientist.py会在启动前自动检查pdflatex/chktex是否可用。
选一个模板跑第一个实验:三大模板对比与启动命令
先按你的场景挑模板。三个官方模板的数据需求和运行入口各不相同,对比如下:
| 模板 | 适合场景 | 数据 / 额外依赖 | 运行入口 |
|---|---|---|---|
| nanoGPT | Transformer 下一词元预测优化 | enwik8、shakespeare_char、text8,需先跑 data/ 下 3 个prepare.py | python experiment.py --out_dir run_0 |
| 2d_diffusion | 低维数据上的扩散生成模型 | 模板内置 DatasaurusDozen 数据集;需装 NPEET + scikit-learn | python experiment.py --out_dir run_0 |
| grokking | 泛化与学习速度(突然理解)研究 | 内置算术任务;只需pip install einops | python experiment.py --out_dir run_0 |
新手推荐从 grokking 起步:数据自包含、依赖最少。启动顺序是「先在本机跑基线 run_0(不同硬件的运行时间对比才准确),再启动 AI-Scientist 本体」:
cd templates/grokking && python experiment.py --out_dir run_0 && python plot.py cd ../.. && python launch_scientist.py --experiment grokking --num-ideas 2跑之前先给要用的模型配置密钥,OpenAI / Claude / DeepSeek 三选一(ai_scientist/llm.py 里可见完整支持列表):
export OPENAI_API_KEY="你的密钥" export ANTHROPIC_API_KEY="你的密钥" export DEEPSEEK_API_KEY="你的密钥"--num-ideas 2表示只生成并执行 2 个想法(默认 50),首次跑通全流程足够。
看结果:如何读实验图表、曲线与生成样本 📈
实验结束后,每个想法的产物都落在results/<模板名>/<时间戳>_<想法名>/目录下。优先看四个文件:notes.txt记录了 run_0 基线与后续各 run 的指标对比;run_0到run_N里的final_info.json存着各项指标的均值;review.txt是 LLM 审稿结果,包含 1~10 的 Overall 分数与 Accept/Reject 决定;同名的.pdf则是写好的论文。判断想法是否有效,核心动作是拿 run_1 之后的曲线去对比 run_0 基线。
grokking 模板的图重点看泛化跃迁:下面这张验证准确率对比图中,横轴是训练步数,x_plus_y、x_minus_y等四条任务曲线在训练准确率爬升后,验证准确率会同步跳升到接近 99%——这个「突然变好」的拐点就是 grokking 现象,也是论文结论的主要依据。
2D Diffusion 模板则用肉眼验收:生成样本图展示模型在低维数据上采样的点云分布,与真实数据集形状越贴合,说明分布捕捉得越好;配套的train_loss.png类曲线用于确认训练本身收敛。
调优与排障:控成本、开并行、解决常见报错 🛠️
调优时抓住三个参数就够:
--num-ideas:想法数量,默认 50。首次建议 2~3 个验证流程,确认稳定后再放大。--parallel与--gpus:多卡环境用--parallel 2 --gpus "0,1"让每张 GPU 领一个想法;GPU 数不够时会自动降回可用卡数。--model:决定成本与成功率。官方 FAQ 给出参考值——Claude Sonnet 3.5 下每篇论文通常不足 15 美元,DeepSeek Coder V2 更省钱;审稿环节建议用 GPT-4o 以获得更稳定的输出格式。
常见报错按「症状 → 解决方案」自查:
| 症状 | 解决方案 |
|---|---|
| 报缺少数据文件 | 先运行对应模板的数据准备脚本,如python data/enwik8/prepare.py |
提示pdflatex或chktex未找到 | 安装texlive-full,或改用容器化镜像 |
| Semantic Scholar 查重/引用失败 | 改用--engine openalex(免 API 密钥),或用--skip-novelty-check跳过 |
| 某个想法没生成 PDF 或 review | 成功率取决于模板与基础模型,换更强的模型(如 Claude Sonnet 3.5)重试 |
| 担心 LLM 生成代码的自主执行风险 | 用 Docker 镜像运行并限制网络访问,README 对此有专门警示 |
一条launch_scientist.py命令就能让 AI-Scientist 自主走完「想法 → 实验 → LaTeX 论文 → LLM 审稿」四个环节,交付物是带审稿意见的 PDF 论文。如果你有自研方向,可以照着templates/下experiment.py+plot.py+prompt.json的格式再扩一个自己的模板。现在就去配好密钥,选 grokking 模板,跑通你的第一个想法吧。
【免费下载链接】AI-ScientistThe AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery 🧑🔬项目地址: https://gitcode.com/GitHub_Trending/ai/AI-Scientist
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考