mineru-pdf-parser-clawdbot-skill

一个基于MinerU的本地PDF解析工具,可提取结构化文本、布局和图片。

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:mineru-pdf-parser-clawdbot-skill。
它的用途是:一个基于MinerU的本地PDF解析工具,可提取结构化文本、布局和图片。
完整的 Skill 内容见:https://321skill.com/skills/mineru-pdf-parser-clawdbot-skill/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

“请帮我解析这份市场调研报告PDF,提取出所有的表格数据和章节标题,并保存为Markdown格式。”,它会调用MinerU PDF Parser技能,在本地处理您指定的PDF文件,最终生成一个包含清晰章节结构和表格数据的Markdown文件,方便您进一步编辑和分析。

介绍

这个Skill解决了从复杂PDF文档中高效、准确地提取结构化信息的难题。传统的PDF解析器在处理扫描件、复杂排版或包含表格图片的文档时,往往丢失布局或识别错误,而MinerU集成了布局分析、OCR、表格识别等多模型能力,能精准还原文档结构。

使用时,您只需将PDF文件路径作为参数,Skill便会调用本地的MinerU CLI进行处理。您可以通过命令行选项灵活控制输出格式(Markdown或JSON)、是否提取表格和图片,以及处理线程数、语言等参数,结果将保存在指定目录中。

它非常适合需要深度处理PDF文档的各类专业人士,例如学术研究者需要从论文中提取数据和图表,数据分析师需要将报告内容结构化以进行分析,或内容创作者需要将PDF资料转换为可编辑的格式进行二次创作。

需要注意的是,此Skill依赖于本地已安装的MinerU CLI环境,请确保事先完成MinerU的安装和配置。由于完全在CPU上运行,处理大型或页数极多的PDF文件时可能需要较长时间,建议根据文档复杂度调整线程数等参数以优化性能。

核心特点

与PyMuPDF等基础解析器相比,它通过集成MinerU的AI多模型管道,对扫描件、复杂版式文档的文本提取准确率提升10-100倍,并能输出包含布局边界框、元素类型和关系的丰富结构化JSON数据。

注意事项

完全依赖CPU处理,对于超大体积或页数极多的PDF文件,解析速度可能较慢。

常见问题

需要GPU才能运行吗?

不需要,该Skill设计为在本地CPU上运行,无需GPU。

能处理扫描的PDF文件吗?

可以,MinerU内置了OCR功能,能够准确识别扫描件中的文字。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/mineru-pdf-parser-clawdbot-skill/raw/index.md 读取 mineru-pdf-parser-clawdbot-skill 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。