scanned-pdf-to-docx

将扫描版PDF(无文字层)转换为结构清晰的Word文档

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:scanned-pdf-to-docx。
它的用途是:将扫描版PDF(无文字层)转换为结构清晰的Word文档
完整的 Skill 内容见:https://321skill.com/skills/scanned-pdf-to-docx/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

当你拿到一本扫描版的《诗经》PDF,需要将其内容转换为可编辑、可分章节的Word文档进行校注时,可以使用此Skill。

对AI说:“我需要将这本扫描PDF转换成Word,书是竖排繁体,没有文字层。” 它会引导你按照工作流指南,先拆分PDF,运行OCR,然后通过标题映射和三层校对,最终输出一个结构清晰、文字准确的.docx文件。

介绍

这个Skill专门解决一个棘手问题:如何将那些没有可复制文字层的扫描版PDF(例如古籍、旧版学术书籍)高效、准确地转换为可编辑、结构清晰的Word文档。它针对的是图片型PDF,而非已有良好文字层的电子版PDF。

其核心流程是一个自动化与人工校对结合的管道:首先将PDF按章节拆分,然后使用MinerU OCR引擎进行高精度文字识别,接着通过自定义标题映射文件恢复文档结构,最后生成初步的Word文档。最关键的一步是后续的“三层校对”工作流,这是保证最终输出质量的核心环节。

它非常适合古籍数字化工作者、学术研究者、图书管理员或任何需要将大量纸质文献(特别是中文古籍或旧版书籍)数字化的用户。这些用户通常面临OCR识别古籍字体、特殊符号和复杂版式的挑战。

与市面上许多简单的PDF转Word工具或在线服务不同,这个Skill不是一键式的“黑盒”转换。它提供了一个完整的、可复现的本地化工作流,特别强调通过“三层校对”流程来保证专业出版级的准确性,并且针对中文古籍和复杂排版(如章节、特殊符号)的恢复做了专门优化。

核心特点

核心区别在于其专为“无文字层扫描PDF”设计的“MinerU OCR + 三层校对”工作流,尤其擅长处理中文古籍和复杂学术排版的精准还原,而非通用PDF转换。它提供了从拆分、识别、结构映射到深度校对的全套本地化脚本和指南。

注意事项

不适合处理本身已有高质量、可复制文字层的PDF文件(对于这类文件,直接提取文字更高效)。

常见问题

这个工具和直接用Word打开PDF有什么区别?

Word打开扫描PDF是将其作为图片嵌入,无法编辑文字。此工具通过OCR将图片中的文字识别并提取出来,生成真正可编辑、带格式的Word文档。

转换古籍准确率高吗?

使用专门的中文大模型(ch_server)识别基础文字准确率较高,但古籍生僻字、特殊符号和复杂版式仍需依赖流程中关键的“三层人工校对”来确保最终质量。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/scanned-pdf-to-docx/raw/index.md 读取 scanned-pdf-to-docx 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。