pdf-ocr-skill

支持多引擎的PDF与图片文字提取工具,兼顾本地与云端识别。

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:pdf-ocr-skill。
它的用途是:支持多引擎的PDF与图片文字提取工具,兼顾本地与云端识别。
完整的 Skill 内容见:https://321skill.com/skills/pdf-ocr-skill/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

‘帮我把这份扫描版的产品手册PDF转换成可编辑的文本,并提取里面的技术参数表格。’ 它会调用PDF OCR Skill,自动将PDF每一页转为图片,使用配置的OCR引擎(如RapidDoc)识别文字和表格结构,最终输出结构清晰的文本和Markdown格式的表格内容。

介绍

PDF OCR Skill 是一款专为处理影印版PDF和图片文件设计的文字提取工具。它解决了用户从扫描件、截图等非可编辑格式中获取结构化文本内容的痛点,尤其适合处理历史文档、纸质材料电子化等场景。

使用方式非常灵活,既可以通过Python API集成到自动化流程中,也可以直接通过命令行快速处理单个文件。用户只需安装依赖并配置环境变量(如需使用云端引擎),即可调用其强大的OCR能力。

该技能非常适合内容创作者、学术研究者、数据分析师以及需要处理大量纸质文档的办公人员。无论是将扫描版论文转为可搜索的文本进行研究,还是将产品手册图片中的信息提取出来进行分析,它都能高效完成。

建议用户优先尝试免费的本地RapidOCR引擎,对于复杂版式或高精度要求的文档,再考虑使用增强版RapidDoc或云端硅基流动API。注意,使用云端API会产生费用,且需要网络连接。

核心特点

核心区别在于提供了‘三引擎’架构:默认的免费本地引擎(RapidOCR)、支持版面分析的增强本地引擎(RapidDoc)以及基于大模型的云端高精度引擎(硅基流动API),用户可根据识别难度、成本预算和隐私要求灵活切换,无需更换工具。

注意事项

对于手写体、极度模糊或排版异常复杂的文档,识别准确率可能下降,且云端API依赖网络并可能产生费用。

常见问题

如何选择OCR引擎?

追求免费和速度选RapidOCR(默认);需要识别表格、公式等复杂版式选RapidDoc;追求最高识别精度且不介意费用选硅基流动API。

能识别手写文字吗?

主要针对印刷体文字优化,手写体识别不是其强项,准确率可能较低。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/pdf-ocr-skill/raw/index.md 读取 pdf-ocr-skill 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。