PDF和图片文字提取
从图片和PDF中识别并提取文字
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:PDF和图片文字提取。 它的用途是:从图片和PDF中识别并提取文字 完整的 Skill 内容见:https://321skill.com/skills/pdf和图片文字提取/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
'帮我提取这张图片中的文字,图片是会议纪要的截图',AI会识别图片中的印刷体文字并以段落形式输出。或者说:'把这个PDF的正文部分提取出来,去掉页眉页脚',AI会先判断PDF是否有文字层,若无则进行OCR识别,最终返回纯文本内容。
介绍
该技能解决从扫描件、截图、PDF文档等非可编辑文件中提取文字内容的难题。当你拿到一张图片或PDF,需要将其中的文字复制出来用于编辑、翻译或存档时,手动输入既耗时又易出错,本技能利用OCR(光学字符识别)技术自动完成识别,并保留原始排版顺序输出结构化文本。
使用方式非常简单:直接向AI提供图片或PDF文件(支持常见格式如PNG、JPG、JPEG、PDF等),AI会自动判断文件是否包含可提取的文字,然后以段落或列表形式返回识别结果,并尽量保持原文档的换行和缩进逻辑。无需额外配置,一次对话即可完成。
适合学术研究者批量处理论文截图、内容创作者从纸质资料中提取引用、文档工程师将扫描版合同转为可编辑文本、高校学生整理课堂讲义等场景。对于需要快速数字化大量纸质文档或处理非标准格式图片的用户尤为实用。
注意:本技能主要针对印刷体、清晰排版的中英文文字,对手写体、艺术字、极低分辨率或严重倾斜的图片识别准确率有限。建议在良好光照下拍摄,或使用扫描仪获取300dpi以上图片以获得最佳效果。对于多页PDF,当前版本支持逐页处理,但单次请求建议不超过20页。
核心特点
与通用OCR工具相比,本技能自动判断文件是否包含文字层(如PDF中的可复制文本),优先提取矢量文字而非重新OCR,从而保留原始精度;同时按阅读顺序输出结构化段落,而非简单的逐行文本堆叠。
注意事项
不适合识别手写体、复杂表格、艺术字体或图像质量极低(如模糊、倾斜过度)的文档。
常见问题
支持哪些图片格式?
支持PNG、JPG、JPEG、BMP、TIFF等常见图片格式,以及PDF文件(含扫描件和文字层PDF)。
能批量处理多张图片吗?
目前单次对话可处理一个文件(多页PDF视为一个文件),如需批量处理,请分多次发送或通过脚本调用API。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/pdf和图片文字提取/raw/index.md 读取 PDF和图片文字提取 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/pdf和图片文字提取/raw/index.md(查看排版版本)