opencode-skills-paddle-ocr

为纯文本LLM提供本地OCR能力,从图像和PDF中提取文字。

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:opencode-skills-paddle-ocr。
它的用途是:为纯文本LLM提供本地OCR能力,从图像和PDF中提取文字。
完整的 Skill 内容见:https://321skill.com/skills/opencode-skills-paddle-ocr/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

“请帮我读取这张截图里的所有文字内容。”,AI会调用此Skill,运行OCR脚本处理你指定的图片文件,并将识别出的纯文本结果返回给你,方便你直接复制或进一步编辑。

介绍

这个Skill解决了纯文本大语言模型(LLM)无法直接“看见”和读取图片、PDF等文件中文字内容的核心痛点。它通过集成PaddleOCR和DeepSeek-OCR等引擎,让AI能够像人类一样,从截图、照片、扫描文档中提取文本信息,从而扩展了AI的应用边界。

使用方式非常直接,用户只需通过简单的命令行指令,指定图片或PDF文件的路径,即可调用该Skill进行文字识别。它还支持通过--prompt参数进行自定义指令(如“将表格提取为Markdown格式”),通过--fast参数切换至更快的PaddleOCR引擎,或通过--json参数获取结构化输出,灵活应对不同需求。

它非常适合需要处理大量图像文档的研究人员、整理电子笔记的学生、从扫描版资料中提取信息的文字工作者,以及任何希望其AI助手(如Claude、Cursor等)具备“视觉”读取能力的开发者或普通用户。

与许多依赖云端API的在线OCR服务不同,这是一个本地运行的Skill,能更好地保护数据隐私,且无需网络连接。同时,它提供了在速度(PaddleOCR)与精度(DeepSeek-OCR)之间的选择,并原生支持包括中文、英文在内的上百种语言,在处理多语言混合文档时更具优势。

核心特点

核心区别在于提供本地化、离线的OCR能力,保障数据隐私;同时集成PaddleOCR(快)和DeepSeek-OCR(准)双引擎,用户可根据场景在速度与精度间灵活切换。

注意事项

对于极度模糊、低分辨率或艺术字体密集的图片,识别准确率可能下降;复杂版式(如多栏、图文混排紧密)的还原效果可能不如专业文档处理软件。

常见问题

支持识别PDF文件吗?

支持,直接传入PDF文件路径即可,Skill会自动处理其中的每一页。

能提取图片中的表格并转为Excel吗?

可通过`--prompt`指令尝试提取为Markdown表格,但暂不支持直接输出Excel格式。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/opencode-skills-paddle-ocr/raw/index.md 读取 opencode-skills-paddle-ocr 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。