百度文档解析pipeline-parser
调用百度文档解析API解析文档,支持18+格式
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:百度文档解析pipeline-parser。 它的用途是:调用百度文档解析API解析文档,支持18+格式 完整的 Skill 内容见:https://321skill.com/skills/百度文档解析pipeline-parser-x-5/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
'请解析这份PDF合同,提取所有文本和表格,并输出为Markdown格式。' 技能将会调用百度文档解析API,返回包含文本段落和表格结构的Markdown文件。你也可以说:'批量解析文件夹中所有扫描件,OCR识别后按日期归档。' 技能会自动遍历文件、调用API、整理结果。
介绍
本技能解决文档解析难题:当你需要从PDF、Word、Excel、PPT、图片等18+格式中提取文本、表格、版面信息,或对扫描件进行OCR识别时,直接调用百度文档解析API即可完成。它不仅能提取纯文本,还能保留表格结构、分析版面布局,并自动进行RAG文档分块,为后续的知识检索或数据提取提供高质量输入。
使用方法非常简单:你只需提供文档文件路径或URL,指定解析需求(如提取文本、表格、OCR),技能会返回结构化的结果。支持批量处理,也可与RAG管道无缝集成。适合需要快速从文档中获取结构化信息的场景。
适用人群广泛:全栈开发者需要处理用户上传的文档;文档工程师需要批量转换格式;学术研究者需要从PDF论文中提取表格和文本;数据分析师需要从Excel报告中提取数据;客服人员需要处理扫描件中的文字。
注意:该技能依赖百度文档解析API,需要提前获取API密钥并配置。部分复杂版面(如手写混合、竖排文字)可能解析效果有限。建议先测试小文件,确认效果后再批量处理。
核心特点
相比普通的PDF解析工具,本技能直接调用百度文档解析API,支持18+格式(包括图片、扫描件),并内置OCR识别和RAG文档分块功能,适合需要高质量结构化输出的场景。
注意事项
依赖百度文档解析API,需要网络和API密钥,对离线或私有化部署场景不适用,且不支持超大型文档(如数百页)。
常见问题
支持哪些文档格式?
支持PDF、Word、Excel、PPT、图片等18+格式,包括扫描件和图片中的文字识别。
需要自己申请百度API吗?
是的,需要提前在百度智能云申请文档解析API的密钥,并在配置中填入。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/百度文档解析pipeline-parser-x-5/raw/index.md 读取 百度文档解析pipeline-parser 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/百度文档解析pipeline-parser-x-5/raw/index.md(查看排版版本)