Science Skills结构生物学实战:AlphaFold数据库技能快速完成pLDDT置信度与PAE结构域分析
【免费下载链接】science-skillsGDM Science Skills to speed up agentic scientific workflows with better grounding and higher token efficiency. Integrate insights from AlphaGenome, AFDB, UniProt and 30+ other databases and tools.项目地址: https://gitcode.com/gh_mirrors/sc/science-skills
Science Skills是一个面向 AI 科研工作流的开源智能体技能库,集成 AlphaFold 数据库、UniProt、AlphaGenome 等 30+ 数据库与工具。其中AlphaFold 数据库技能(alphafold-database-fetch-and-analyze)只需一个 UniProt 编号,即可一键下载蛋白结构预测文件,并自动完成pLDDT 置信度评估与PAE 结构域边界分析两大结构生物学核心任务——无需手写任何代码,新手也能在几分钟内得到专业的结构可靠性报告。
🧬 技能速览:这个技能能帮你做什么?
| 能力 | 说明 |
|---|---|
| 🔍 结构文件下载 | 按 UniProt ID 从 AlphaFold Database 获取 mmCIF 结构、PAE 矩阵与 API 元数据 |
| 📊 pLDDT 分析 | 评估蛋白整体折叠置信度,识别内在无序区(IDR) |
| 🧩 PAE 结构域分析 | 基于滑动窗口启发式算法检测刚性结构域边界 |
| ⚠️ 智能预警 | 自动提示等异构体(isoform)回退、超大蛋白片段截断等风险 |
该技能适合回答这类问题:"这个蛋白预测得可靠吗?""它有独立的结构域吗?""哪些区域是高度无序的?"
⚠️ 使用前请确认你手里有UniProt 编号(如 P00520)。如果只有蛋白名称或基因名,请先在 UniProt 网站查到编号;如需搜索结构同源物或获取实验结构,应使用 Foldseek 或 RCSB PDB 等对应工具。
✅ 第一步:安装 Science Skills 与 uv 运行环境
Skill 脚本统一使用 Python 包管理器uv执行,依赖会在首次运行时自动安装。安装技能库只需一条命令:
npx skills add google-deepmind/science-skills/如果需要在本地克隆仓库查阅技能文档,可使用:
git clone https://gitcode.com/gh_mirrors/sc/science-skillsuv 的安装细节可参考技能库内的 uv SKILL.md。首次触发技能时,AI 代理会征求你的同意并自动装好 uv,装完后建议重启代理应用。
📥 第二步:一键下载 AlphaFold 结构预测文件
核心脚本是 fetch_structure.py,它会自动执行限速请求(1 次/秒),并智能处理等异构体选择与超大蛋白(>2700 残基)的片段回退:
uv run skills/alphafold_database_fetch_and_analyze/scripts/fetch_structure.py P04637 -o ./data/运行成功后,输出目录会生成三类文件:
| 文件 | 用途 |
|---|---|
AF-XXXXXX-F1.cif(mmCIF 结构文件) | 三维坐标;逐残基 pLDDT 就藏在它的 B-factor 列中 |
*-predicted_aligned_error_v6.json | PAE(预测对齐误差)矩阵,供结构域分析 |
AF-XXXXXX-F1-metadata.json | API 元数据,含全局 pLDDT 与四级置信度占比,供下一步分析 |
脚本遇到查无此 ID(404)、使用了等异构体回退或超大蛋白截断时,都会打印醒目的[!] WARNING,请务必留意转达。
📊 第三步:pLDDT 置信度分析——判断蛋白预测是否可靠
pLDDT(predicted Local Distance Difference Test)是 AlphaFold 给出的逐残基置信度(0–100,越高越可信)。analyze_plddt.py 会读取上一步的元数据文件,输出整体评分与四级占比:
uv run skills/alphafold_database_fetch_and_analyze/scripts/analyze_plddt.py ./data/AF-P04637-F1-metadata.json输出包含:
- Overall Global pLDDT:整条蛋白的全局置信度
- 四级占比:Very Low(<50)/ Low(50–70)/ Confident / Very High
- pLDDT Conclusion:基于阈值(如 Confident+Very High 合计 ≥70% 视为高置信)给出的结论,区分"完全有序"、"含显著无序区"、"结构域与无序区混合"、"高度内在无序"等情形
拿到结论后,你就可以决定后续是放心做对接/结构比较,还是只针对有序片段做分析。
🧩 第四步:PAE 结构域分析——自动识别蛋白结构域边界
PAE(Predicted Aligned Error,预测对齐误差)描述任意两个残基之间相对位置的不确定性:局部值低 = 空间关系可信,跨区值高 = 两个部分可独立摆动。analyze_pae.py 内置了滑动窗口启发式算法:以 7 Å 为切分阈值扫描 PAE 矩阵切出子域,再以 15 Å 阈值合并为全局结构域(>50 残基才保留),并计算平均/最大误差与"高置信残基对(PAE<5 Å)"占比:
uv run skills/alphafold_database_fetch_and_analyze/scripts/analyze_pae.py ./data/AF-P00527-F1-predicted_aligned_error_v6.json你会得到:
- PAE 统计:矩阵形状、Mean / Max / Min Error(Å)、高置信残基对百分比
- Domain Boundary Analysis:检测到的刚性结构域数量及每个域的残基区间(如
Domain 1: residues 12 - 186) - PAE Structural Conclusion:单域(单一刚性折叠体)、多域(由柔性铰链连接的独立结构域)或"可能整体无序"三类结论
对多结构域蛋白,这个残基区间可以直接作为后续 Foldseek 搜索、分子对接或 PyMOL 可视化的分析范围。
📖 如何综合解读结果(避坑清单)
- 先看警告:若输出出现等异构体回退或超大蛋白片段警告,必须在报告中显著说明,不能省略。
- 两条结论合成一句话:把 pLDDT 结论 + PAE 结论合并成整体判断——整体折叠可靠性、无序区位置、结构域布局。
- 高度无序要单独警告:若 Very Low 占比高或检测不到刚性结构域,请勿对整条蛋白做 Foldseek/对接等下游分析,而应限定到小的有序域残基区间。
- 可视化技巧:下载好的 mmCIF 文件 B-factor 列即逐残基 pLDDT,可直接用 PyMOL 按 B-factor 着色画置信度条带。
🗂️ 技能文件清单
| 文件 | 说明 |
|---|---|
| SKILL.md | 技能主说明:适用边界、核心规则、三个脚本用法与输出解读规范 |
| fetch_structure.py | 下载 mmCIF / PAE / 元数据,含等异构体与片段回退逻辑 |
| analyze_plddt.py | pLDDT 全局评分与四级占比、无序区判定 |
| analyze_pae.py | PAE 统计、滑动窗口结构域切分与合并 |
| citation.bib | 引用格式 |
| plugin.json | 技能插件元信息 |
🎯 小结
借助 Science Skills 的 AlphaFold 数据库技能,结构生物学入门工作流被压缩成"一条下载命令 + 两条分析命令":pLDDT告诉你预测可不可信,PAE告诉你结构域在哪——两者结合,就能快速判断蛋白是否适合下游结构分析,并精确圈定有序区间的残基范围。对于希望提升代理式科研工作流效率的普通用户,这正是开箱即用的结构生物学实战模板。
【免费下载链接】science-skillsGDM Science Skills to speed up agentic scientific workflows with better grounding and higher token efficiency. Integrate insights from AlphaGenome, AFDB, UniProt and 30+ other databases and tools.项目地址: https://gitcode.com/gh_mirrors/sc/science-skills
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考