PDF Extract

从PDF和图像中提取结构化数据

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:PDF Extract。
它的用途是:从PDF和图像中提取结构化数据
完整的 Skill 内容见:https://321skill.com/skills/pdf-extract-x-4/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

'从这份季度财报PDF中提取所有表格数据,并输出为CSV格式',AI会解析PDF布局,识别表格行列,提取数字和文本,最终生成CSV文件供你直接分析。

介绍

PDF Extract 是一款专注于从 PDF 文档和图像中提取结构化数据的 AI 技能。它能够自动识别并提取表格、OCR 文本、内嵌图片以及印章等元素,将非结构化文件转化为可编辑、可分析的结构化数据。基于 ComPDF 数据提取引擎和 AI 文档处理能力,该技能可高效处理扫描件、图片型 PDF 等复杂文档,解决传统手动复制粘贴或 OCR 工具处理效率低、格式混乱的问题。

使用方式非常简单:您只需将需要处理的 PDF 或图像文件输入给 AI,并指定要提取的内容类型(如表格、文本、图片等),技能便会自动解析文档结构,输出结构化的数据,通常以 Markdown 表格、JSON 或 CSV 格式呈现。整个过程无需手动调整参数,AI 会智能识别布局和内容。

适合需要频繁处理 PDF 文档的数据分析师、文档工程师、内容创作者以及办公效率提升人士。例如,从财务报表中提取表格数据进行分析、从合同扫描件中提取关键条款、从产品手册中提取图片和说明文字等场景下尤为实用。

建议在使用时提供清晰的文档来源(如扫描件质量、语言类型),以获得最佳提取效果。对于复杂排版或手写体较多的文档,提取准确率可能有所下降,建议配合人工校验。同时注意保护文档中的敏感信息,避免将机密文件上传至公共模型。

核心特点

与通用 OCR 工具相比,PDF Extract 深度集成 ComPDF 引擎,不仅支持 OCR 文字识别,还能同时提取表格、图像、印章等多种元素,并保持结构化关系,输出格式友好。

注意事项

对复杂版面(如多栏、自由排版)和手写体较重的文档提取准确率会下降,且不支持直接编辑 PDF 内容。

常见问题

支持哪些文档格式?

支持 PDF 和常见图像格式(如 JPG、PNG、TIFF),可处理扫描件和数字原生 PDF。

提取的表格数据能直接导出吗?

可以,输出通常为 Markdown 表格、JSON 或 CSV 格式,方便直接导入 Excel 或数据库。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/pdf-extract-x-4/raw/index.md 读取 PDF Extract 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。