百度文档解析pipeline-parser

调用百度文档解析API解析文档,支持18+格式

文档写作 全栈开发文档工程师学术研究者 处理文档和PDFs提取结构化数据转换PDF文档 通用claudetraecursor ★ 753 更新于 2026-08-01

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:百度文档解析pipeline-parser。
它的用途是:调用百度文档解析API解析文档,支持18+格式
完整的 Skill 内容见:https://321skill.com/skills/百度文档解析pipeline-parser-x-5/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

'请解析这份PDF合同,提取所有文本和表格,并输出为Markdown格式。' 技能将会调用百度文档解析API,返回包含文本段落和表格结构的Markdown文件。你也可以说:'批量解析文件夹中所有扫描件,OCR识别后按日期归档。' 技能会自动遍历文件、调用API、整理结果。

介绍

本技能解决文档解析难题:当你需要从PDF、Word、Excel、PPT、图片等18+格式中提取文本、表格、版面信息,或对扫描件进行OCR识别时,直接调用百度文档解析API即可完成。它不仅能提取纯文本,还能保留表格结构、分析版面布局,并自动进行RAG文档分块,为后续的知识检索或数据提取提供高质量输入。

使用方法非常简单:你只需提供文档文件路径或URL,指定解析需求(如提取文本、表格、OCR),技能会返回结构化的结果。支持批量处理,也可与RAG管道无缝集成。适合需要快速从文档中获取结构化信息的场景。

适用人群广泛:全栈开发者需要处理用户上传的文档;文档工程师需要批量转换格式;学术研究者需要从PDF论文中提取表格和文本;数据分析师需要从Excel报告中提取数据;客服人员需要处理扫描件中的文字。

注意:该技能依赖百度文档解析API,需要提前获取API密钥并配置。部分复杂版面(如手写混合、竖排文字)可能解析效果有限。建议先测试小文件,确认效果后再批量处理。

核心特点

相比普通的PDF解析工具,本技能直接调用百度文档解析API,支持18+格式(包括图片、扫描件),并内置OCR识别和RAG文档分块功能,适合需要高质量结构化输出的场景。

注意事项

依赖百度文档解析API,需要网络和API密钥,对离线或私有化部署场景不适用,且不支持超大型文档(如数百页)。

常见问题

支持哪些文档格式?

支持PDF、Word、Excel、PPT、图片等18+格式,包括扫描件和图片中的文字识别。

需要自己申请百度API吗?

是的,需要提前在百度智能云申请文档解析API的密钥,并在配置中填入。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/百度文档解析pipeline-parser-x-5/raw/index.md 读取 百度文档解析pipeline-parser 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。