mineru-pdf-parser-clawdbot-skill
一个基于MinerU的本地PDF解析工具,可提取结构化文本、布局和图片。
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:mineru-pdf-parser-clawdbot-skill。 它的用途是:一个基于MinerU的本地PDF解析工具,可提取结构化文本、布局和图片。 完整的 Skill 内容见:https://321skill.com/skills/mineru-pdf-parser-clawdbot-skill/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
“请帮我解析这份市场调研报告PDF,提取出所有的表格数据和章节标题,并保存为Markdown格式。”,它会调用MinerU PDF Parser技能,在本地处理您指定的PDF文件,最终生成一个包含清晰章节结构和表格数据的Markdown文件,方便您进一步编辑和分析。
介绍
这个Skill解决了从复杂PDF文档中高效、准确地提取结构化信息的难题。传统的PDF解析器在处理扫描件、复杂排版或包含表格图片的文档时,往往丢失布局或识别错误,而MinerU集成了布局分析、OCR、表格识别等多模型能力,能精准还原文档结构。
使用时,您只需将PDF文件路径作为参数,Skill便会调用本地的MinerU CLI进行处理。您可以通过命令行选项灵活控制输出格式(Markdown或JSON)、是否提取表格和图片,以及处理线程数、语言等参数,结果将保存在指定目录中。
它非常适合需要深度处理PDF文档的各类专业人士,例如学术研究者需要从论文中提取数据和图表,数据分析师需要将报告内容结构化以进行分析,或内容创作者需要将PDF资料转换为可编辑的格式进行二次创作。
需要注意的是,此Skill依赖于本地已安装的MinerU CLI环境,请确保事先完成MinerU的安装和配置。由于完全在CPU上运行,处理大型或页数极多的PDF文件时可能需要较长时间,建议根据文档复杂度调整线程数等参数以优化性能。
核心特点
与PyMuPDF等基础解析器相比,它通过集成MinerU的AI多模型管道,对扫描件、复杂版式文档的文本提取准确率提升10-100倍,并能输出包含布局边界框、元素类型和关系的丰富结构化JSON数据。
注意事项
完全依赖CPU处理,对于超大体积或页数极多的PDF文件,解析速度可能较慢。
常见问题
需要GPU才能运行吗?
不需要,该Skill设计为在本地CPU上运行,无需GPU。
能处理扫描的PDF文件吗?
可以,MinerU内置了OCR功能,能够准确识别扫描件中的文字。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/mineru-pdf-parser-clawdbot-skill/raw/index.md 读取 mineru-pdf-parser-clawdbot-skill 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/mineru-pdf-parser-clawdbot-skill/raw/index.md(查看排版版本)