先给你一句话:MinerU 是开源的 PDF / 扫描件结构化解析工具,支持文字、表格、公式、布局分析 + OCR;本地用 pip/uv 最方便,国内建议用 modelscope 源下模型;想快、稳、准,核心是选对后端 + 分批 + 参数调优 + 预处理。 一、环境与安装(Windows/macOS/Linux) 1)硬件建议 CPU:4 核以上;内存 ≥16GB(32GB 更稳) GPU(可选):NVIDIA 6GB+ 显存(加速用) 磁盘:SSD ≥20GB(模型 + 缓存) Python:3.10–3.13(推荐 3.10) 2)推荐安装(uv + pip,最快最稳) bash
1. 升级 pip
pip install —upgrade pip
2. 装 uv(更快的包管理器)
pip install uv
3. 装 MinerU 完整版(含 OCR/表格/公式)
uv pip install -U “mineru[all]” mineru[all]:含所有模型(OCR / 布局 / 公式 / 表格) 只想纯文本:mineru[core] 即可 3)国内下载模型(关键!否则慢 / 失败) bash
用魔搭 modelscope 源(国内高速)
mineru-models-download -s modelscope -m all 模型总大小约 3–5GB,自动生成 mineru.json 配置文件 4)Docker 一键部署(不想折腾环境) bash
拉镜像
docker pull opendatalab/mineru
启动(7860端口,浏览器访问)
docker run -d -p 7860:7860 —name mineru opendatalab/mineru
基础:解析PDF,输出到 ./output
mineru -p input.pdf -o ./output
扫描版PDF(必加 —ocr)
mineru -p scan.pdf -o ./output —ocr
只处理 1–10 页,中英文混合,开表格+公式
mineru -p paper.pdf -o ./output —ocr —lang ch,en —table —formula —start 1 —end 10 输出目录会有:content_list.json(结构化内容)、layout.pdf(布局可视化)、md/(markdown 结果) 2)WebUI(可视化,适合新手) bash
启动 WebUI
mineru-web 浏览器打开 http://localhost:7860,上传 PDF、选参数、点解析即可 3)Python 调用(适合集成到代码) python 运行 from mineru import MinerU
parser = MinerU() result = parser.parse(“input.pdf”, ocr=True, lang=[“ch”, “en”]) print(result[“content”]) # 结构化内容 三、核心窍门(提速 + 提准 + 避坑) ✅ 1. 后端选择(决定速度与精度) pipeline(默认):快、稳,适合电子版 PDF(无扫描) bash mineru -p input.pdf -o ./output -b pipeline vlm-sglang:准、慢,适合扫描件 / 复杂排版 / 公式多 bash mineru -p scan.pdf -o ./output -b vlm-sglang —ocr ✅ 2. 性能优化(大文档不崩、更快) 分批处理(>50 页必做) bash
分1–20页、21–40页…
mineru -p big.pdf -o ./output —start 1 —end 20 CPU 模式(GPU 不够时) 在 ~/.mineru/mineru.json 里设: json “device-mode”: “cpu” 关闭不用功能(提速 30%+) bash
无公式、无表格:关了更快
mineru -p text.pdf -o ./output —no-formula —no-table ✅ 3. 提高识别准确率(OCR / 表格 / 公式) 扫描件先预处理:用 Adobe Scan 或 ABBYY 去噪、纠偏、增强分辨率(≥300DPI) 语言指定:中文 + 英文必写 —lang ch,en,否则乱码 表格倾斜:扫描表格歪了,先旋转矫正再解析 公式乱码:用 vlm-sglang 后端,公式识别更准 ✅ 4. 常见坑 & 解决 模型下载失败:换 modelscope 源(前面命令) 内存溢出(OOM):分批、用 CPU、减小 —ocr-batch-size 排版乱(双栏 / 多栏):用 vlm-sglang 后端,布局分析更强 WebUI 打不开:端口被占,换端口 mineru-web —server-port 7861 四、推荐工作流(从 PDF 到可用结果) 电子版 PDF → pipeline → 直接解析 → 导出 Markdown/JSON 扫描版 PDF → 预处理(去噪 / 纠偏)→ vlm-sglang + —ocr → 分批解析 → 导出结果先给你一句话:MinerU 是开源的 PDF / 扫描件结构化解析工具,支持文字、表格、公式、布局分析 + OCR;本地用 pip/uv 最方便,国内建议用 modelscope 源下模型;想快、稳、准,核心是选对后端 + 分批 + 参数调优 + 预处理。 一、环境与安装(Windows/macOS/Linux) 1)硬件建议 CPU:4 核以上;内存 ≥16GB(32GB 更稳) GPU(可选):NVIDIA 6GB+ 显存(加速用) 磁盘:SSD ≥20GB(模型 + 缓存) Python:3.10–3.13(推荐 3.10) 2)推荐安装(uv + pip,最快最稳) bash
1. 升级 pip
pip install —upgrade pip
2. 装 uv(更快的包管理器)
pip install uv
3. 装 MinerU 完整版(含 OCR/表格/公式)
uv pip install -U “mineru[all]” mineru[all]:含所有模型(OCR / 布局 / 公式 / 表格) 只想纯文本:mineru[core] 即可 3)国内下载模型(关键!否则慢 / 失败) bash
用魔搭 modelscope 源(国内高速)
mineru-models-download -s modelscope -m all 模型总大小约 3–5GB,自动生成 mineru.json 配置文件 4)Docker 一键部署(不想折腾环境) bash
拉镜像
docker pull opendatalab/mineru
1. 升级 pip
pip install —upgrade pip
2. 装 uv(更快的包管理器)
pip install uv
3. 装 MinerU 完整版(含 OCR/表格/公式)
uv pip install -U “mineru[all]” mineru[all]:含所有模型(OCR / 布局 / 公式 / 表格) 只想纯文本:mineru[core] 即可 3)国内下载模型(关键!否则慢 / 失败) bash
用魔搭 modelscope 源(国内高速)
mineru-models-download -s modelscope -m all 模型总大小约 3–5GB,自动生成 mineru.json 配置文件 4)Docker 一键部署(不想折腾环境) bash
拉镜像
docker pull opendatalab/mineru
启动(7860端口,浏览器访问)
docker run -d -p 7860:7860 —name mineru opendatalab/mineru
基础:解析PDF,输出到 ./output
mineru -p input.pdf -o ./output
扫描版PDF(必加 —ocr)
mineru -p scan.pdf -o ./output —ocr
只处理 1–10 页,中英文混合,开表格+公式
mineru -p paper.pdf -o ./output —ocr —lang ch,en —table —formula —start 1 —end 10 输出目录会有:content_list.json(结构化内容)、layout.pdf(布局可视化)、md/(markdown 结果) 2)WebUI(可视化,适合新手) bash
启动 WebUI
mineru-web 浏览器打开 http://localhost:7860,上传 PDF、选参数、点解析即可 3)Python 调用(适合集成到代码) python 运行 from mineru import MinerU
parser = MinerU() result = parser.parse(“input.pdf”, ocr=True, lang=[“ch”, “en”]) print(result[“content”]) # 结构化内容 三、核心窍门(提速 + 提准 + 避坑) ✅ 1. 后端选择(决定速度与精度) pipeline(默认):快、稳,适合电子版 PDF(无扫描) bash mineru -p input.pdf -o ./output -b pipeline vlm-sglang:准、慢,适合扫描件 / 复杂排版 / 公式多 bash mineru -p scan.pdf -o ./output -b vlm-sglang —ocr ✅ 2. 性能优化(大文档不崩、更快) 分批处理(>50 页必做) bash
分1–20页、21–40页…
mineru -p big.pdf -o ./output —start 1 —end 20 CPU 模式(GPU 不够时) 在 ~/.mineru/mineru.json 里设: json “device-mode”: “cpu” 关闭不用功能(提速 30%+) bash
无公式、无表格:关了更快
mineru -p text.pdf -o ./output —no-formula —no-table ✅ 3. 提高识别准确率(OCR / 表格 / 公式) 扫描件先预处理:用 Adobe Scan 或 ABBYY 去噪、纠偏、增强分辨率(≥300DPI) 语言指定:中文 + 英文必写 —lang ch,en,否则乱码 表格倾斜:扫描表格歪了,先旋转矫正再解析 公式乱码:用 vlm-sglang 后端,公式识别更准 ✅ 4. 常见坑 & 解决 模型下载失败:换 modelscope 源(前面命令) 内存溢出(OOM):分批、用 CPU、减小 —ocr-batch-size 排版乱(双栏 / 多栏):用 vlm-sglang 后端,布局分析更强 WebUI 打不开:端口被占,换端口 mineru-web —server-port 7861 四、推荐工作流(从 PDF 到可用结果) 电子版 PDF → pipeline → 直接解析 → 导出 Markdown/JSON 扫描版 PDF → 预处理(去噪 / 纠偏)→ vlm-sglang + —ocr → 分批解析 → 导出结果
启动(7860端口,浏览器访问)
docker run -d -p 7860:7860 —name mineru opendatalab/mineru
基础:解析PDF,输出到 ./output
mineru -p input.pdf -o ./output
扫描版PDF(必加 —ocr)
mineru -p scan.pdf -o ./output —ocr
只处理 1–10 页,中英文混合,开表格+公式
mineru -p paper.pdf -o ./output —ocr —lang ch,en —table —formula —start 1 —end 10 输出目录会有:content_list.json(结构化内容)、layout.pdf(布局可视化)、md/(markdown 结果) 2)WebUI(可视化,适合新手) bash
启动 WebUI
mineru-web 浏览器打开 http://localhost:7860,上传 PDF、选参数、点解析即可 3)Python 调用(适合集成到代码) python 运行 from mineru import MinerU
parser = MinerU() result = parser.parse(“input.pdf”, ocr=True, lang=[“ch”, “en”]) print(result[“content”]) # 结构化内容 三、核心窍门(提速 + 提准 + 避坑) ✅ 1. 后端选择(决定速度与精度) pipeline(默认):快、稳,适合电子版 PDF(无扫描) bash mineru -p input.pdf -o ./output -b pipeline vlm-sglang:准、慢,适合扫描件 / 复杂排版 / 公式多 bash mineru -p scan.pdf -o ./output -b vlm-sglang —ocr ✅ 2. 性能优化(大文档不崩、更快) 分批处理(>50 页必做) bash
分1–20页、21–40页…
mineru -p big.pdf -o ./output —start 1 —end 20 CPU 模式(GPU 不够时) 在 ~/.mineru/mineru.json 里设: json “device-mode”: “cpu” 关闭不用功能(提速 30%+) bash
无公式、无表格:关了更快
mineru -p text.pdf -o ./output —no-formula —no-table ✅ 3. 提高识别准确率(OCR / 表格 / 公式) 扫描件先预处理:用 Adobe Scan 或 ABBYY 去噪、纠偏、增强分辨率(≥300DPI) 语言指定:中文 + 英文必写 —lang ch,en,否则乱码 表格倾斜:扫描表格歪了,先旋转矫正再解析 公式乱码:用 vlm-sglang 后端,公式识别更准 ✅ 4. 常见坑 & 解决 模型下载失败:换 modelscope 源(前面命令) 内存溢出(OOM):分批、用 CPU、减小 —ocr-batch-size 排版乱(双栏 / 多栏):用 vlm-sglang 后端,布局分析更强 WebUI 打不开:端口被占,换端口 mineru-web —server-port 7861 四、推荐工作流(从 PDF 到可用结果) 电子版 PDF → pipeline → 直接解析 → 导出 Markdown/JSON 扫描版 PDF → 预处理(去噪 / 纠偏)→ vlm-sglang + —ocr → 分批解析 → 导出结果