Agent Paddleocr Vision
多语言文档OCR识别与自动分类
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:Agent Paddleocr Vision。 它的用途是:多语言文档OCR识别与自动分类 完整的 Skill 内容见:https://321skill.com/skills/agent-paddleocr-vision-x-8/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
'帮我处理这个发票图片,提取信息并生成可搜索的PDF。',它会自动调用PaddleOCR API解析文档,识别为发票类型,提取订单号、金额、日期等字段,并生成带OCR文本层的PDF文件,同时给出'创建费用'等建议动作。
介绍
这个Skill解决了多语言文档OCR识别与自动分类的问题。在实际业务中,企业经常需要处理大量发票、合同、身份证等不同格式的文档,手动分类和提取关键信息耗时耗力且容易出错。该工具通过PaddleOCR云API,能自动识别文档类型并提取结构化数据,同时提供可操作的后续建议。
使用方式很简单,你只需要配置PaddleOCR的API地址和访问令牌。之后就可以通过命令行处理单个文件或批量处理整个目录,支持生成带搜索层的PDF文档。脚本会自动判断文档类型(如发票、名片、收据、护照等11种),提取对应字段,并给出创建费用、添加联系人等建议动作。
它非常适合需要自动化文档处理流程的团队或个人,尤其是那些已经使用PaddleOCR服务或拥有自有OCR API的企业。智能体开发人员可以将其集成到AI工作流中,实现文档的自动分类与信息提取,数据分析师和电商运营人员也能快速从大量票据中提取关键数据。
建议在需要批量处理发票、合同或身份证件时统一使用此工具。需要注意的是,它主要依赖PaddleOCR云端API,因此需要网络连接和有效的API凭证,且处理超时时间默认为600秒,大文件可能需要调整。
核心特点
与普通OCR工具(如Tesseract)不同,Agent PaddleOCR Vision不仅能提取文字,还能自动将文档分为11种具体类型(如发票、身份证、护照),并针对每种类型提供结构化动作建议(如创建费用、提取身份证信息),而非仅输出纯文本。
注意事项
需要Python环境,依赖PaddleOCR云API(需网络和API密钥),不支持完全离线运行,且处理超时默认600秒,超大文件可能需调整。
常见问题
支持哪些文档类型?
支持11种:发票、名片、收据、表格、合同、身份证、护照、银行流水、驾照、税单、通用文档。
是否需要GPU?
不需要,OCR处理在云端PaddleOCR API完成,本地仅需Python环境运行脚本。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/agent-paddleocr-vision-x-8/raw/index.md 读取 Agent Paddleocr Vision 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/agent-paddleocr-vision-x-8/raw/index.md(查看排版版本)