MinerU 安装与上手指南:3 步把 PDF 转成结构化 Markdown
2026/8/29 12:00:09 网站建设 项目流程

MinerU 安装与上手指南:3 步把 PDF 转成结构化 Markdown

【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU

MinerU 是一款开源文档解析工具,把 PDF、扫描件图片以及 DOCX、PPTX、XLSX 解析为带标题层级、表格、公式的结构化 Markdown / JSON,供 LLM 检索与 RAG 流程消费。如果你的场景是:手头有一份几十页的论文或扫描版报告,需要提取成干净的 Markdown 喂给知识库或大模型,MinerU 可以直接完成整页布局分析、公式转 LaTeX、表格转 HTML。安装完成后首次解析会自动下载所需模型,无需手动配置模型路径。

路线选型:完整安装、Docker 部署与轻量客户端怎么选

MinerU 本地使用有三条路线:完整包安装、Docker 部署、以及只装基础包的轻量客户端。选型时主要看两点:本机是否有 NVIDIA GPU(Volta 架构及以上)或 Apple Silicon,以及模型服务是否已部署在远端。

路线硬件需求解析精度(OmniDocBench v1.6)适用场景推荐程度
完整安装mineru[all]本地 GPU 8GB+ 显存,内存 32GB 推荐hybrid 后端约 95.3 分有 GPU 的桌面 / 服务器,追求最高解析精度新手默认首选
Docker 部署同完整安装同完整安装Linux / WSL2 服务器,依赖冲突多或需要容器化管理生产环境推荐
轻量客户端 + http-client 后端本地 2GB 显存即可,甚至纯 CPU取决于远端服务低配设备,或模型已部署在远程 OpenAI 兼容服务上边缘 / 调用方场景

提示:Docker 部署仅适用于 Linux 和支持 WSL2 的 Windows 环境,macOS 用户请使用 pip 或 uv 安装;Windows 上 Python 版本需 3.10~3.12,详见 快速入门文档。

完整安装步骤:uv 创建环境、安装包、跑通第一个文档

以下按执行顺序给出全部命令,适合 Windows / Linux / macOS 通用,全程约 3 步。

uv venv .venv && source .venv/bin/activate

创建独立的 Python 虚拟环境并激活,避免污染系统解释器。

uv pip install -U "mineru[all]"

安装完整功能包,mineru[all]已按操作系统自动带上 vllm / lmdeploy / mlx 等推理框架依赖,装完即得到minerumineru-apimineru-gradio等命令。

mineru -p demo/pdfs/demo1.pdf -o output

用仓库自带的示例 PDF 跑一次解析。首次运行会自动从 HuggingFace 下载模型文件(国内网络建议先设置MINERU_MODEL_SOURCE=modelscope,见下一节),完成后在output目录下的auto子目录中找到生成的 Markdown、图片和中间 JSON。

如果选择从源码运行(例如要改代码),可以克隆仓库后执行uv pip install -e .[all],仓库地址为 https://gitcode.com/GitHub_Trending/mi/MinerU 。

关键环境变量与配置项说明

这些配置通过环境变量生效,优先级高于命令行参数,且在minerumineru-apimineru-router等所有命令行工具中都有效。完整清单见 命令行工具文档。

变量名作用默认或推荐值何时需要改
MINERU_MODEL_SOURCE模型下载源(huggingface / modelscope / local)huggingface无法访问 HuggingFace 时设为modelscope;模型已预先下载时设为local
MINERU_HYBRID_BATCH_RATIOhybrid 后端的 batch 倍率,控制单客户端显存占用按显存:6GB 以下设 8,4GB 设 4,2GB 设 1GPU 显存不足报错时下调
MINERU_PROCESSING_WINDOW_SIZE单次处理窗口大小,影响大文档内存占用64超长文档内存吃紧时调小
MINERU_API_MAX_CONCURRENT_REQUESTSmineru-api最大并发请求数3多用户共享服务时上调
MINERU_FORMULA_ENABLE公式解析开关true文档无公式、想提速时设为 false
MINERU_PDF_RENDER_TIMEOUTPDF 渲染为图片的超时秒数300遇到异常 PDF 长时间卡住时调整

命令行侧还有两个高频选项:-b选择解析后端(pipeline/hybrid-engine/vlm-engine/ 两种http-client,默认hybrid-engine),--effort控制 hybrid 的解析强度(默认medium)。两者配合CUDA_VISIBLE_DEVICES可以精确指定用哪张卡,示例见 进阶 CLI 参数文档。

验证安装与常见问题排查

先做两件事确认装对了:执行mineru --version能正常打印版本号,说明命令和依赖没问题;再执行上一节的示例解析命令,输出目录中出现 Markdown 文件和图片目录,说明模型下载与解析链路都通了。

下面是四个高频问题的"现象 → 原因 → 解决":

现象:模型下载失败或下载极慢。原因:默认模型源是 HuggingFace,国内网络访问不稳定。解决:export MINERU_MODEL_SOURCE=modelscope切换到国内镜像源后重跑;更完整的模型源策略见 模型源说明。

现象:Windows 下安装了 CUDA 环境但报错或回退到 CPU。原因:PyTorch 的 CUDA 版本与显卡驱动不匹配。解决:按 FAQ 中 Windows CUDA 加速一节 核对驱动与 torch 版本,或临时改用-b pipeline纯 CPU 后端保证先用起来。

现象:解析长文档时内存或显存溢出。原因:默认处理窗口和 batch 按 32GB 内存、8GB 显存配置。解决:调小MINERU_PROCESSING_WINDOW_SIZEMINERU_HYBRID_BATCH_RATIO,或改用pipeline后端(4GB 显存即可运行)。

现象:解析"找不到输出文件"。原因:输出按输出目录/后端/文档名/嵌套存放(默认后端目录名为auto)。解决:到对应子目录查找,或用--help查看-o参数说明,输出文件结构见 输出文件说明。

小结与延伸阅读

MinerU 的本地使用路径可以概括为:按硬件三选一(完整安装 / Docker / 轻量客户端),mineru[all]一条命令装全,用mineru -p <输入> -o <输出>跑通第一个文档,之后通过环境变量按需调模型源和内存参数。遇到问题先查 FAQ,未解决可以到 项目仓库 提交 issue 并附上样例文档。

延伸阅读:

  • 快速入门与部署对比表:docs/zh/quick_start/index.md
  • CLI 参数与环境变量完整清单:docs/zh/usage/cli_tools.md
  • 扩展模块(vllm / lmdeploy / 轻量 client)安装指南:docs/zh/quick_start/extension_modules.md

【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询