opencode-skills-paddle-ocr
为纯文本LLM提供本地OCR能力,从图像和PDF中提取文字。
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:opencode-skills-paddle-ocr。 它的用途是:为纯文本LLM提供本地OCR能力,从图像和PDF中提取文字。 完整的 Skill 内容见:https://321skill.com/skills/opencode-skills-paddle-ocr/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
“请帮我读取这张截图里的所有文字内容。”,AI会调用此Skill,运行OCR脚本处理你指定的图片文件,并将识别出的纯文本结果返回给你,方便你直接复制或进一步编辑。
介绍
这个Skill解决了纯文本大语言模型(LLM)无法直接“看见”和读取图片、PDF等文件中文字内容的核心痛点。它通过集成PaddleOCR和DeepSeek-OCR等引擎,让AI能够像人类一样,从截图、照片、扫描文档中提取文本信息,从而扩展了AI的应用边界。
使用方式非常直接,用户只需通过简单的命令行指令,指定图片或PDF文件的路径,即可调用该Skill进行文字识别。它还支持通过--prompt参数进行自定义指令(如“将表格提取为Markdown格式”),通过--fast参数切换至更快的PaddleOCR引擎,或通过--json参数获取结构化输出,灵活应对不同需求。
它非常适合需要处理大量图像文档的研究人员、整理电子笔记的学生、从扫描版资料中提取信息的文字工作者,以及任何希望其AI助手(如Claude、Cursor等)具备“视觉”读取能力的开发者或普通用户。
与许多依赖云端API的在线OCR服务不同,这是一个本地运行的Skill,能更好地保护数据隐私,且无需网络连接。同时,它提供了在速度(PaddleOCR)与精度(DeepSeek-OCR)之间的选择,并原生支持包括中文、英文在内的上百种语言,在处理多语言混合文档时更具优势。
核心特点
核心区别在于提供本地化、离线的OCR能力,保障数据隐私;同时集成PaddleOCR(快)和DeepSeek-OCR(准)双引擎,用户可根据场景在速度与精度间灵活切换。
注意事项
对于极度模糊、低分辨率或艺术字体密集的图片,识别准确率可能下降;复杂版式(如多栏、图文混排紧密)的还原效果可能不如专业文档处理软件。
常见问题
支持识别PDF文件吗?
支持,直接传入PDF文件路径即可,Skill会自动处理其中的每一页。
能提取图片中的表格并转为Excel吗?
可通过`--prompt`指令尝试提取为Markdown表格,但暂不支持直接输出Excel格式。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/opencode-skills-paddle-ocr/raw/index.md 读取 opencode-skills-paddle-ocr 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/opencode-skills-paddle-ocr/raw/index.md(查看排版版本)