PDF Extract
从PDF和图片中提取表格、文本、图片等结构化数据
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:PDF Extract。 它的用途是:从PDF和图片中提取表格、文本、图片等结构化数据 完整的 Skill 内容见:https://321skill.com/skills/pdf-extract-x-2/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
'从这份季度财报PDF中提取表格数据并保存为CSV',AI会调用PDF Extract技能解析PDF,识别表格边界和内容,输出CSV文件。也可以说:'把这张扫描合同图片中的文字识别出来',它会执行OCR并返回文本。
介绍
PDF Extract 解决的是从非结构化文档(PDF、扫描件、图片)中批量提取结构化数据的难题。传统方法需要手动复制粘贴或使用笨重的OCR工具,而它基于 ComPDF 的 AI 文档解析引擎,能自动识别表格、OCR 文字、内嵌图片、印章等元素,并输出结构化的 JSON 或 CSV 数据,大幅减少人工录入和清洗成本。
使用方式极为简单:在支持 Skill 的 AI 平台(如 Claude、Cursor)中安装后,直接对 AI 说“提取这份PDF中的表格”或“把扫描件转成可编辑文本”,AI 会自动调用该 Skill 完成解析,无需额外配置。支持批量处理,也可通过 API 集成到自动化工作流中。
适合需要频繁处理 PDF 文档的人群,包括数据分析师(从财报、报告中提取数据表)、后端开发(集成到文档处理流程)、学术研究者(提取论文中的实验数据或文献摘要)。同时也适合需要 OCR 识别手写笔记或扫描合同的企业用户。
建议使用时注意文件清晰度,低分辨率扫描件可能影响 OCR 准确率。处理敏感文档时建议确认数据是否通过加密通道传输。对于仅需简单文本提取的场景,可先用系统内置的 PDF 阅读器,避免消耗 API 配额。
核心特点
相比通用的 PDF 解析库(如 pdfplumber、PyMuPDF),PDF Extract 内置了 AI 模型驱动的 OCR 和表格结构识别,能处理手写文字、倾斜扫描件及复杂合并单元格,且无需本地部署 GPU 模型,开箱即用。
注意事项
不适合处理加密或受 DRM 保护的 PDF,且依赖网络连接调用 ComPDF 云服务,离线场景下无法使用。
常见问题
支持哪些文件格式?
支持 PDF、JPG、PNG、TIFF 等常见文档和图片格式,可直接识别扫描件。
提取的表格能保留原格式吗?
可以输出为 Markdown 表格、CSV 或 JSON 结构,保留合并单元格和表头层次,但复杂嵌套表格可能需要二次校正。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/pdf-extract-x-2/raw/index.md 读取 PDF Extract 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/pdf-extract-x-2/raw/index.md(查看排版版本)