pi-ocr

零配置多后端OCR,一键提取图片和PDF中的文字、公式与表格。

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:pi-ocr。
它的用途是:零配置多后端OCR,一键提取图片和PDF中的文字、公式与表格。
完整的 Skill 内容见:https://321skill.com/skills/pi-ocr/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

“请帮我识别这张图片里的文字和表格。”,它会自动调用 pi-ocr 扩展,快速解析你发送的图片,并将识别出的文本和表格结构清晰地回复给你,方便你直接复制或编辑。

介绍

pi-ocr 是一个专为 AI 助手 Pi 设计的扩展,它解决了用户需要从图像、截图或 PDF 文件中快速提取结构化信息(包括普通文字、复杂的数学公式和表格)的痛点。传统方式需要手动复制、使用特定软件或在线服务,而 pi-ocr 让这一切在对话中即可完成。

使用极其简单,无需任何配置。你只需在 Pi 的对话中安装此扩展,之后直接将图片或 PDF 文件发送给 Pi,它就会自动调用 OCR 功能识别并返回其中的文本内容。扩展内置了多种后端:默认使用免费的 MinerU 云服务,也支持通过本地 Ollama(利用 GPU 处理 LaTeX 公式)或 Pix2Text(Python 环境)进行识别,满足不同需求。

它非常适合学生、研究人员、办公人员以及任何需要处理文档或图片信息的用户。例如,学生可以快速提取习题图片中的题目和公式进行研究,研究人员可以解析论文截图中的数据和表格,办公人员则能轻松从扫描件或报告中获取文字内容。

使用建议是,对于绝大多数用户,直接使用默认的零配置云服务即可,开箱即用。如果对隐私有较高要求或需要频繁处理包含复杂数学公式的内容,可以考虑配置本地 Ollama 后端以获得更好的公式识别效果和隐私保护。注意,免费云服务可能有使用频率限制,且识别精度可能因图片质量而异。

核心特点

核心区别在于其“零配置、多后端”的设计:默认无需任何设置即可使用免费的云 OCR 服务;同时独家支持通过本地 Ollama 后端精准识别 LaTeX 数学公式,这是许多纯云端 OCR 工具所不具备的能力。

注意事项

不适合对识别精度要求极高(如法律、金融文件的精确转录)或完全离线、无网络环境的场景。

常见问题

支持识别 PDF 文件吗?

支持,可以直接将 PDF 文件发送给 Pi 进行识别。

识别数学公式准确吗?

如果配置了本地 Ollama 后端,对 LaTeX 公式的识别准确率会显著提升。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/pi-ocr/raw/index.md 读取 pi-ocr 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。