PDF Extract
从PDF和图像中提取结构化数据
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:PDF Extract。 它的用途是:从PDF和图像中提取结构化数据 完整的 Skill 内容见:https://321skill.com/skills/pdf-extract-x-6/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
'从这份发票PDF中提取所有表格行,包括商品名称、数量和金额,并转为CSV文件。' 它会自动调用ComPDF的AI引擎,识别表格区域,提取结构化数据,然后输出CSV格式。如果是扫描件,还会先进行OCR处理,确保手写数字也能被识别。
介绍
PDF Extract 是一个基于 ComPDF AI 文档提取引擎的智能工具,专门解决从 PDF 和图像中提取非结构化数据并转化为结构化信息的难题。无论是包含表格、文字、图片还是印章的文档,它都能自动识别并提取,输出为可编辑的格式,大幅减少手动整理数据的工作量。
使用方式非常简单:将 PDF 或图像文件路径或 URL 传给该 Skill,它会调用 ComPDF 的 AI 模型进行文档解析。支持批量处理多个文件,提取结果包括表格、OCR 文本、图片和印章等元素,并以 JSON 或 CSV 等结构化格式返回,方便后续分析或存储。
适合需要频繁处理 PDF 文档的用户,如数据分析师、文档工程师、内容创作者、科研人员等。尤其在处理大量发票、报告、合同、扫描件时,可以显著提高效率。也适合集成到自动化工作流中,实现文档数据的自动提取与入库。
建议在使用前确保 PDF 清晰度较高,扫描件分辨率不低于 200 DPI,以获得最佳 OCR 效果。对于包含复杂表格或混合排版的文档,建议先测试小样本,调整参数后再全量处理。注意,该工具依赖 ComPDF 云端服务,需要网络连接。
核心特点
与普通 PDF 解析库不同,PDF Extract 内置了 ComPDF 的 AI 文档理解能力,能同时提取表格、OCR 文本、嵌入图像和印章等多种元素,并保持结构关系,而不仅仅是提取纯文本或简单表格。
注意事项
不适合处理手写体占比高、图像严重模糊或彩色背景复杂的文档,OCR 准确率会下降。
常见问题
支持哪些PDF版本?
支持所有标准PDF,包括扫描版PDF(需OCR)和文字版PDF。
能提取表格中的数字吗?
可以,表格会被识别为结构化数据,数字和文本均保留原有行列关系。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/pdf-extract-x-6/raw/index.md 读取 PDF Extract 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/pdf-extract-x-6/raw/index.md(查看排版版本)