- 人工智能
- AI 应用
- AI 技能
- RAG
- MCP 服务
- 网页爬虫
【免费下载链接】Skill_Seekers
Convert documentation websites, GitHub repositories, and PDFs into Claude AI skills with automatic conflict detection
本文是 Skill Seekers 项目的完整技术指南,系统讲解如何把文档网站、GitHub 仓库、PDF、视频等 18 种来源转化为可供 Claude、Gemini、OpenAI 等平台直接使用的结构化知识资产(AI Skills),并支持导出到 LangChain、Pinecone 等 22 个 RAG/IDE 目标。读完本文,你将掌握create、scan、enhance、package、upload、install-agent等核心命令的完整用法,理解其三层文档发现、C3.x 代码分析、双模式 AI 增强与 MCP 集成的底层实现原理,并能基于仓库源码定位每个环节的实现位置。
项目定位:为 AI 系统构建数据层
Skill Seekers 的定位是"为 AI 系统提供数据层":它把分散的文档站点、代码仓库、PDF、视频、笔记本、Wiki 等资源,转换成结构化的知识资产,供给 AI Skills(Claude、Gemini、OpenAI)、RAG 流水线(LangChain、LlamaIndex、Pinecone)以及 AI 编码助手(Cursor、Windsurf、Cline)使用。其核心理念是"一次准备、处处导出"——同一份知识资产可以不打磨地导出到 22 个目标平台。
从项目元数据看,该仓库要求 Python 3.10+,当前开发版本号为3.10.0.dev0(pyproject.toml),核心依赖覆盖异步爬取(httpx)、AI 增强(anthropic)、PDF 解析(PyMuPDF)、RAG 生态(langchain、llama-index)等,所有可选能力均通过 extras 按需安装。
快速开始:3 条命令产出第一个 Skill
Skill Seekers 的核心工作流极简,官方 Quick Start 仅需三步:
# 1. 安装 pip install skill-seekers # 2. 从任意来源创建 skill(自动检测来源类型) skill-seekers create https://docs.djangoproject.com/ # 3. 为你的 AI 平台打包 skill-seekers package output/django --target claude执行完毕后,你将得到output/django-claude.zip,可直接导入 Claude 使用。如果希望由其他 AI 代理执行内容增强(默认使用 Claude),可以指定代理:
# 选择其他 AI 代理(默认: claude) skill-seekers create https://docs.djangoproject.com/ --agent kimi skill-seekers create https://docs.djangoproject.com/ --agent-cmd "my-custom-agent run"从源码看,create是统一 CLI 的分发入口之一:main.py 中通过COMMAND_CLASSES将create映射到CreateCommand类,并支持--help-web、--help-github、--help-pdf、--help-video、--help-config等渐进式帮助标志,方便按场景查看子选项。此外,create命令对来源类型自动检测,URL、owner/repo、本地文件路径均可直接传入。
AI 驱动的项目扫描:scan 命令
scan命令面向已有代码库,让 AI 代理读取项目的 manifest、README、Dockerfile/CI 及抽样源码导入语句,为每个识别出的框架生成一份 config,并为你的自有代码生成一份<project>-codebase.json:
skill-seekers scan ./my-react-app --out ./configs/scanned/ # → react.json, vite.json, tailwind.json, jest.json, my-react-app-codebase.json skill-seekers create ./configs/scanned/react.json如果某个检测结果没有现成预设,AI 会现场生成新 config;退出时可选择将其发布回社区 config 注册表(configs 目录收录了 react、godot、unity-dotween、claude-code 等大量既有示例,可作为 config 格式参考)。scan同样通过COMMAND_CLASSES分发到 scan_command.py 的ScanCommand。
覆盖 18 种来源类型
create命令支持 18 种来源类型,几乎涵盖常见知识载体:
skill-seekers create facebook/react # GitHub 仓库 skill-seekers create ./my-project # 本地代码库 skill-seekers create manual.pdf # PDF skill-seekers create report.docx # Word skill-seekers create book.epub # EPUB skill-seekers create notebook.ipynb # Jupyter skill-seekers create openapi.yaml # OpenAPI/Swagger skill-seekers create presentation.pptx # PowerPoint skill-seekers create guide.adoc # AsciiDoc skill-seekers create page.html # 本地 HTML(或整个目录) skill-seekers create feed.rss # RSS/Atom skill-seekers create curl.1 # Man page # 视频(YouTube、Vimeo 或本地文件 —— 需要 skill-seekers[video]) skill-seekers create --video-url https://www.youtube.com/watch?v=... --name mytutorial skill-seekers create --setup # 自动安装 GPU 感知的视觉依赖 skill-seekers create --space-key TEAM --name wiki # Confluence skill-seekers create --database-id ... --name docs # Notion skill-seekers create --chat-export-path ./slack-export --name team-chat # Slack/Discord每种来源类型对应的抓取选项详见抓取指南。在源码层面,这些能力由src/skill_seekers/cli/下的多个抓取器实现,例如 unified_scraper.py、github_scraper.py、pdf_scraper.py、video_scraper.py、confluence_scraper.py、notion_scraper.py 等,它们共享一套统一的构建层(scraper_utils),保证不同来源产出结构一致的中间结果。
安装方式与可选扩展
基础安装只需核心依赖,各平台支持以 extras 方式按需添加:
pip install skill-seekers # 核心:scraping、GitHub、PDF、打包 pip install skill-seekers[all-llms] # + 所有 LLM 平台 pip install skill-seekers[mcp] # + MCP 服务器 pip install skill-seekers[all] # 全部能力不确定需要哪些依赖?运行向导:skill-seekers-setup。
| 安装 | 添加内容 |
|---|---|
skill-seekers[gemini] | Google Gemini 支持 |
skill-seekers[openai] | OpenAI ChatGPT 支持 |
skill-seekers[all-llms] | 所有 LLM 平台 |
skill-seekers[mcp] | 面向 Claude Code、Cursor 等的 MCP 服务器 |
skill-seekers[video] | YouTube/Vimeo 转录与元数据提取 |
skill-seekers[video-full] | + Whisper 转录与视觉帧提取 |
skill-seekers[jupyter] | Jupyter Notebook 支持 |
skill-seekers[pptx] | PowerPoint 支持 |
skill-seekers[confluence] | Confluence Wiki 支持 |
skill-seekers[notion] | Notion 页面支持 |
skill-seekers[rss] | RSS/Atom 源支持 |
skill-seekers[chat] | Slack/Discord 聊天导出支持 |
skill-seekers[asciidoc] | AsciiDoc 支持 |
skill-seekers[all] | 全部能力 |
视频视觉依赖(GPU 感知):安装
skill-seekers[video-full]后,运行skill-seekers create --setup会自动检测你的 GPU 并安装匹配的 PyTorch 变体与 easyocr。
这些 extras 与 pyproject.toml 中的[project.optional-dependencies]一一对应:mcp引入mcp>=1.25,<2与 HTTP/SSE 相关依赖,video-full引入yt-dlp、faster-whisper、opencv-python-headless等,rag-upload则聚合 Chroma、Weaviate、Pinecone 等向量库客户端。前置条件为 Python 3.10+ 与 Git,新用户推荐先读防错快速开始。
输出物:一份知识资产,22 个导出目标
| 用途 | 输出 | 谁来消费 |
|---|---|---|
| AI Skills | 详细的SKILL.md+ 引用文件 | Claude Code、Gemini、GPT |
| RAG 流水线 | 带丰富元数据的切片文档 | LangChain、LlamaIndex、Haystack |
| 向量数据库 | 预格式化、可直接 upsert 的数据 | Pinecone、Chroma、Weaviate、FAISS、Qdrant |
| AI 编码助手 | IDE AI 自动读取的上下文文件 | Cursor、Windsurf、Cline、Continue.dev |
22 个导出目标
skill-seekers package output/react --target claude # → Claude Skill(ZIP + YAML) skill-seekers package output/react --target langchain # → LangChain Documents skill-seekers package output/react --target llama-index # → LlamaIndex TextNodes skill-seekers package output/react --target ibm-bob # → IBM Bob skill 目录LLM 平台(12):claude·gemini·openai·minimax·opencode·kimi·deepseek·qwen·openrouter·together·fireworks·markdown
RAG 与向量库(8):langchain·llama-index·haystack·chroma·faiss·weaviate·qdrant·pinecone
其他(2):atlas·ibm-bob
在源码层面,这 22 个目标由src/skill_seekers/cli/adaptors/目录下的平台适配器实现(adaptors),它们全部继承自 base.py 中定义的SkillAdaptor抽象基类。该基类通过format_skill_md()、package()、upload()三个抽象方法规定了统一的平台差异边界:例如 Claude 使用 YAML frontmatter + markdown 并以 ZIP 打包,Gemini 使用纯 markdown 并以 tar.gz 打包,OpenAI 则采用 Assistant 指令格式;RAG 类适配器还会通过_maybe_chunk_content()调用 rag_chunker.py 中的RAGChunker完成智能切片(默认 chunk 512 tokens、保留代码块、按 10% 比例计算重叠),确保代码块与上下文在切分后依然完整。
各平台的详细支持度可查功能矩阵。
为什么值得用
- 速度快:据项目官方文档,可将数天的数据准备压缩到 15–45 分钟;
- Skill 质量高:产出包含示例、模式与指南的 500+ 行
SKILL.md; - RAG 就绪切片:智能切分保留代码块与上下文完整性;
- 多源合一:docs + GitHub + PDF + 视频可合并进同一份知识资产;
- 一次准备、处处导出:无需重复抓取即可导出到 22 个目标;
- 久经验证:仓库 tests 目录包含数百个测试文件,README 声明 3,900+ 测试通过,并内置 68 个工作流预设。
五大核心能力拆解
1. 文档抓取:三层发现 + 弹性解析
对 JavaScript SPA 站点采用三层发现策略:sitemap.xml→llms.txt→ 无头浏览器渲染。若站点存在llms.txt则自动使用(官方称可提速约 10 倍);同时具备智能主题分类,以及"宽容的 HTML 解析器回退"(依赖html5lib,见 pyproject.toml),即使遇到损坏的 markup 也能完成抓取,不再产出空结果。相关实现位于 html_scraper.py、browser_renderer.py、llms_txt_parser.py。详见抓取指南与 llms.txt 支持。
2. GitHub 与代码库分析(C3.x):三流架构
对代码仓库采用三流(three-stream)架构:代码流(AST 解析、设计模式、测试分析)、文档流(README、docs/、Wiki)、社区流(issues、PR、元数据)。C3.x 流水线提供 9 种语言的 10 个 GoF 模式检测器、从测试提取使用示例、AI 撰写的 how-to 指南、config 提取与架构总览。
skill-seekers create ./my-project --preset quick # 1–2 分钟,浅层 skill-seekers create ./my-project --preset standard # 均衡(默认) skill-seekers create ./my-project --preset comprehensive # 深入、详尽这三个预设由 presets/manager.py 中的PRESETS定义:quick(depth=surface,无 AI 增强,1–2 分钟)、standard(depth=deep,SKILL.md 级增强,5–10 分钟,默认)、comprehensive(depth=full,完整 AI 增强,20–60 分钟),预设通过PresetManager.apply_preset()将特性开关映射为skip_*参数,CLI 显式参数优先于预设值。相关文档见模式检测、How-to 指南、测试示例提取。
3. AI 增强:单一传输的 API / LOCAL 双模式
每一次 AI 调用都经由同一个传输层(AgentClient)——要么是API 模式(Anthropic、Google Gemini、OpenAI、Moonshot/Kimi、MiniMax),要么是LOCAL 模式(Claude Code、Kimi Code、Codex、Copilot、OpenCode、自定义代理,无 API 费用)。深度由--enhance-level 0-3控制,代理由--agent选择。
agent_client.py 中的AGENT_PRESETS是 LOCAL 模式的唯一事实来源,定义了 claude、codex、copilot、opencode、kimi 五个内置代理的启动命令与 stdin/权限跳过能力(例如 Claude Code 支持--dangerously-skip-permissions无人值守运行)。API 模式则通过AgentClient(mode="api", provider=..., model=...)统一封装,并对超时、限流、鉴权与截断(truncation)错误做集中分类处理。相关文档:增强指南、增强模式、多代理设置。
4. 统一多源抓取:多来源合并 + 冲突检测
一份 config 可以同时拉取文档、GitHub、PDF、视频等,合并为同一份知识资产,并内置来源间冲突检测与两两合成(pairwise synthesis)。这意味着你可以把官方文档与视频教程、社区 issue 合并成一份更完整的 skill。详见统一抓取。
5. 视频提取:三级转录回退 + 视觉 OCR
支持 YouTube、Vimeo 与本地文件。转录采用三级回退:字幕 → YouTube transcript API → 本地 Whisper;另提供可选的视觉提取,对采样帧上的屏幕代码做 OCR。源码见 video_transcript.py、video_visual.py,完整说明见视频指南。
6. 质量、同步与规模化
- 质量门禁:
skill-seekers quality output/react/ --threshold 7对 skill 打分把关; - 变更同步:检测文档变更并安排定时重抓与通知;
- 流式摄取:面向超大文档集的流式(stream)摄取与增量更新。
实现位于 quality_metrics.py、sync、streaming_ingest.py、incremental_updater.py。详见大文档处理与代码质量。
MCP 集成:让 AI 助手直接调用 Skill 流水线
Skill Seekers 自带 MCP 服务器,可接入 Claude Code、Cursor、Windsurf、VS Code + Cline 与 IntelliJ IDEA:
# stdio 模式(Claude Code、VS Code + Cline) python -m skill_seekers.mcp.server_fastmcp # HTTP 模式(Cursor、Windsurf、IntelliJ) python -m skill_seekers.mcp.server_fastmcp --transport http --port 8765接入后只需对助手说一句:"把 React skill 打包并上传"。当前仓库的 FastMCP 实现(server_fastmcp.py)以装饰器注册工具,工具实现全部委托给 mcp/tools 下的模块化文件,覆盖 config 工具、抓取工具、打包工具、拆分工具、来源工具、市场工具、向量数据库工具与工作流工具等类别(README 徽章标注 40 工具,具体数量随版本演进,例如当前 FastMCP 模块头部文档标注约 34 个工具,可按--help或工具列表核验)。
客户端接入配置可参考仓库根目录的 example-mcp-config.json。更完整的配置见 MCP 设置、MCP 参考与 HTTP 传输。
安装到 19 个 AI 编码代理
生成的 skill 可自动安装到各主流 AI 编码代理中:
skill-seekers install-agent output/react/ --agent cursor skill-seekers install-agent output/react/ --agent all # 安装到所有已识别的代理 skill-seekers install-agent output/react/ --agent cursor --dry-run| 代理 | 路径 | 作用域 |
|---|---|---|
| Claude Code | ~/.claude/skills/ | 全局 |
| Cursor | .cursor/skills/ | 项目 |
| VS Code / Copilot | .github/skills/ | 项目 |
| Amp | ~/.amp/skills/ | 全局 |
| Goose | ~/.config/goose/skills/ | 全局 |
| OpenCode | ~/.opencode/skills/ | 全局 |
| Letta | ~/.letta/skills/ | 全局 |
| Aide | ~/.aide/skills/ | 全局 |
| Windsurf | ~/.windsurf/skills/ | 全局 |
| Neovate | ~/.neovate/skills/ | 全局 |
| Roo Code | .roo/skills/ | 项目 |
| Cline | .cline/skills/ | 项目 |
| Aider | ~/.aider/skills/ | 全局 |
| Bolt | .bolt/skills/ | 项目 |
| Kilo Code | .kilo/skills/ | 项目 |
| Continue | ~/.continue/skills/ | 全局 |
| Kimi Code | ~/.kimi/skills/ | 全局 |
| IBM Bob | .bob/skills/ | 项目 |
这些路径由 install_agent.py 中的AGENT_PATHS字典统一定义(区分~/.<agent>/skills/全局路径与.<agent>/skills/项目相对路径),README 表格将 VS Code 与 Copilot 合并展示,源码层面共维护 19 条路径条目。--dry-run可预先查看将写入的位置而不实际安装。
上传到 Claude
export ANTHROPIC_API_KEY=sk-ant-... skill-seekers package output/react/ --upload # 打包 + 上传 skill-seekers upload output/react.zip # 上传已存在的 zip没有 API key?打包后手动把output/react.zip上传到 claude.ai 的 skills 页面即可。详见上传指南。
工作原理与整体架构
五步流水线:
- 抓取— 提取每个页面(优先检查
llms.txt); - 分类— 将内容按主题组织(API、指南、教程等);
- 增强— AI 撰写带示例的详细
SKILL.md; - 打包— 打包为平台就绪的产物;
- 上传— 发送到你的 AI 平台(可选)。
架构:8 个核心模块 + 5 个工具模块
| 模块 | 用途 |
|---|---|
| CLICore | Git 风格命令分发器、来源自动检测 |
| Scrapers | 共享构建层上的 18 种来源提取器 |
| Adaptors | 统一SkillAdaptorABC 背后的 22 个输出平台格式 |
| Analysis | C3.x 代码库流水线、10 个 GoF 模式检测器 |
| Enhancement | 通过统一AgentClient传输层执行 AI 增强 |
| Packaging | skill 的打包、上传与安装 |
| MCP | FastMCP 服务器(多工具、多工具模块) |
| Sync | 文档变更检测与通知 |
这一模块划分在源码树中可以直接对应:src/skill_seekers/cli/(CLICore、Scrapers、Analysis、Packaging、Enhancement)、src/skill_seekers/cli/adaptors/(Adaptors)、src/skill_seekers/mcp/(MCP)、src/skill_seekers/sync/(Sync)。仓库还提供了 14 张 UML 图(UML 架构)以及 API 参考、Skill 架构 供深入研读。
版本动态(v3.9.0 系列)
README 记录的 v3.9.0 关键改进(当前仓库开发版本号已推进至3.10.0.dev0,完整历史见 CHANGELOG.md):
- 损坏 markup 的 HTML 解析器回退— 严重损坏的页面不再产生空抓取;结构良好的页面保持逐字节一致;
- 临时故障自动重试— 文档抓取器与 MCP
fetch_config对瞬时连接故障与 5xx 做带退避的重试,4xx 仍立即失败; - Whisper 转录回退— 无字幕的本地视频终于能获得真实转录;
- MiniMax 图像 OCR + 注册表驱动多模态— 提供商声明自己的线上协议与图像能力,中国区发布的 key 可对接正确端点;
- 节省 token 的 GitHub issue 默认— GitHub skills 默认不再捆绑已关闭 issue 的完整历史;
- 三个服务器启用 env 驱动 CORS— 不再使用带凭据的通配符来源。
性能参考
据项目官方性能数据(数据规模与耗时仅供参考,实际取决于网络与机器环境):
| 文档规模 | 耗时 | 输出体积 |
|---|---|---|
| 小(< 100 页) | 5–10 分钟 | ~2 MB |
| 中(100–500 页) | 15–30 分钟 | ~10 MB |
| 大(500–2,000 页) | 30–60 分钟 | ~40 MB |
| 超大(10K–40K+ 页) | 使用stream模式 | 参见大文档处理 |
故障排查
skill-seekers doctor # 检查安装与环境 skill-seekers sync-config # 检测 config 漂移常见问题与解决方案见故障排查指南与 TROUBLESHOOTING.md。
生态与进一步阅读
Skill Seekers 是一个多仓库项目:本仓库是核心 CLI 与 MCP 服务器;另有网站/文档仓库、社区 config 注册表、GitHub Action(CI/CD)、Claude Code 插件、Homebrew tap 等配套仓库。若想贡献,官方建议从网站与 configs 仓库入手(详见 CONTRIBUTING.md,项目采用 MIT 协议,见 LICENSE)。
完整的文档索引见 docs/README.md,推荐按需查阅:
| 我想…… | 阅读 |
|---|---|
| 快速上手 | 快速开始 — 3 条命令产出首个 skill |
| 理解概念 | 核心概念 |
| 抓取来源 | 抓取指南 — 全部 18 种来源 |
| AI 增强 skill | 增强指南 · 增强模式 |
| 导出 skill | 打包指南 |
| 创建工作流 | 工作流 |
| 查找命令 | CLI 参考 — 全部命令 |
| 配置 | Config 格式 · 环境变量 |
| MCP 设置 | MCP 设置 · MCP 参考 |
| RAG / IDE 集成 | LangChain · RAG 流水线 · Cursor · Windsurf · Cline |
examples/目录还提供了 Chroma、FAISS、Pinecone、Qdrant、Weaviate、Haystack、LangChain、LlamaIndex 等生态的完整可运行示例,可直接对照上手。
- 人工智能
- AI 应用
- AI 技能
- RAG
- MCP 服务
- 网页爬虫
【免费下载链接】Skill_Seekers
Convert documentation websites, GitHub repositories, and PDFs into Claude AI skills with automatic conflict detection
相关推荐
Skill Seekers Skill Builder:用 MCP 工具链将文档、仓库与 PDF 自动转换为 AI Skill
Skill Seekers Skill Builder:用 MCP 工具链将文档、仓库与 PDF 自动转换为 AI Skill 本文围绕 Skill Seeke
人工智能AI 应用AI 技能RAGMCP 服务网页爬虫Skill Seekers 快速上手:3 步把文档网站与代码仓库转化为可直接使用的 AI 技能
Skill Seekers 快速上手:3 步把文档网站与代码仓库转化为可直接使用的 AI 技能 本文以仓库中的历史文档 QUICKSTART.md https:
人工智能AI 应用AI 技能RAGMCP 服务网页爬虫Skill Seekers:革命性AI技能生成平台,5分钟将文档网站转化为Claude技能
Skill Seekers:革命性AI技能生成平台,5分钟将文档网站转化为Claude技能 在当今AI技术飞速发展的时代,如何快速将现有资源转化为AI可用的技能
人工智能AI 应用AI 技能RAGMCP 服务网页爬虫
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考