ANNOTARES:德语法律文本逻辑结构提取基准数据集解析
2026/8/28 8:17:00
【免费下载链接】MinerUA high-quality tool for convert PDF to Markdown and JSON.一站式开源高质量数据提取工具,将PDF转换成Markdown和JSON格式。项目地址: https://gitcode.com/OpenDataLab/MinerU
MinerU是一款高质量的开源数据提取工具,专注于将PDF文档转换为结构化的Markdown和JSON格式。支持复杂文档元素(如表格、图像、公式)的精准解析,并提供多后端适配(如transformers、sglang等)。适用于学术文献处理、企业文档自动化等场景。
MinerU项目全景架构图,展示了从预处理到模型处理、管道加工、输出可视化和验证的完整流程
pip install mineru[all] # 安装全部依赖git clone https://gitcode.com/OpenDataLab/MinerU.git cd MinerU pip install -e .[dev] # 开发模式安装docker pull opendatalab/mineru:latest docker run -it --gpus all -v /path/to/data:/data minerufrom mineru import MinerU processor = MinerU(backend="pipeline") # 使用pipeline后端 result = processor.convert("input.pdf", output_format="markdown") print(result)import glob from mineru import MinerU processor = MinerU() for pdf_file in glob.glob("*.pdf"): processor.convert(pdf_file, output_dir="output/")processor = MinerU( backend="vlm", device="cuda:0", table_parse_mode="hybrid" )MinerU布局示例图,展示了文档处理后的布局效果,包含公式、段落等结构化内容
注意:首次运行会自动下载模型权重(约2GB),请确保网络通畅。建议在稳定的网络环境下进行首次使用,以获得最佳体验。
通过以上安装和配置步骤,您可以快速开始使用MinerU进行PDF文档的智能解析和结构化转换。
【免费下载链接】MinerUA high-quality tool for convert PDF to Markdown and JSON.一站式开源高质量数据提取工具,将PDF转换成Markdown和JSON格式。项目地址: https://gitcode.com/OpenDataLab/MinerU
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考