百度文档解析pipeline-parser

调用百度API解析文档,支持18+格式,提取文本表格

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:百度文档解析pipeline-parser。
它的用途是:调用百度API解析文档,支持18+格式,提取文本表格
完整的 Skill 内容见:https://321skill.com/skills/百度文档解析pipeline-parser/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

'解析这份PDF合同,提取所有表格并保存为CSV文件',它会调用百度文档解析API,将PDF中的表格数据以结构化形式返回,并自动生成CSV文件保存在本地。同时,还可以要求AI对解析后的文本进行摘要,或将分块后的内容存入知识库供后续检索。

介绍

该 Skill 解决的是从多种格式文档中高效提取结构化信息的问题。日常工作中,PDF、Word、Excel、PPT、扫描件等文档往往混杂着文字、表格、图片,人工逐一复制粘贴耗时且易出错。本 Skill 通过调用百度文档解析 API,一键完成全文档解析,将非结构化内容转化为可编辑、可分析的文本、表格和版面数据,并支持 RAG 场景下的文档分块,为后续的知识检索、数据分析和内容生成奠定基础。

使用方式非常简单:只需提供文档路径或 URL,Skill 会自动调用百度云服务,返回解析结果。支持 PDF、Word、Excel、PPT、图片等 18 种以上格式,内置 OCR 识别能力,即使是扫描件或图片中的文字也能准确提取。输出结果包含纯文本、表格结构(可导出为 CSV)、版面坐标(用于布局分析)以及按语义分块后的文本片段,满足不同下游任务的需求。

适合需要频繁处理文档的各类用户:文档工程师批量转格式、数据分析师从报告里提取表格数据、学术研究者解析论文 PDF、高校学生整理课件讲义、内容创作者复用素材等。尤其适合那些需要将文档内容接入 AI 工作流(如 RAG 知识库、智能问答)的场景,可以大幅减少前期数据清洗的繁琐工作。

使用建议:首次使用前需在百度云平台申请并配置 API Key,注意免费额度有限,大批量解析时请关注费用。该 Skill 依赖网络连接,不适用于离线环境。对于包含复杂图表或加密文档,解析效果可能不理想,建议先试用小文件验证效果。另外,请确保文档内容不涉及敏感隐私,避免上传至云端 API 造成数据泄露风险。

核心特点

与同类文档解析工具相比,本 Skill 直接调用百度云文档解析服务,原生支持 18+ 格式且包含 OCR 和版面分析,输出结果同时包含文本、表格、布局坐标和 RAG 分块,一站式满足从扫描件到结构化数据的全流程需求,无需额外集成多个工具。

注意事项

需要联网和百度云 API Key,不适用于离线环境或对数据隐私要求极高的场景(如内部机密文档)。

常见问题

支持哪些文档格式?

支持 PDF、Word、Excel、PPT、图片(JPG、PNG等)等 18 种以上格式,具体请查阅百度文档解析 API 官方文档。

如何获取百度 API Key?

登录百度云控制台,创建应用并开启文档解析服务,即可获得 API Key 和 Secret Key。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/百度文档解析pipeline-parser/raw/index.md 读取 百度文档解析pipeline-parser 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。