百度文档解析pipeline-parser

百度文档解析API封装,支持18+格式文档解析

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:百度文档解析pipeline-parser。
它的用途是:百度文档解析API封装,支持18+格式文档解析
完整的 Skill 内容见:https://321skill.com/skills/document-parser-api-5/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

'请解析这份PDF合同,提取所有文本和表格,并按段落分块输出。' 它会调用百度文档解析API,返回结构化结果,包括文本、表格(Markdown格式)以及分块后的文档片段,方便后续RAG检索。

介绍

本Skill解决的是多格式文档解析的痛点:PDF、Word、Excel、PPT、图片等18种以上文档的文本提取、表格识别、版面分析、OCR扫描件识别,以及RAG文档分块。用户无需关心底层API调用细节,只需输入文档路径或URL,即可获得结构化输出。

使用方法极其简单:对AI说“解析这份PDF年报”或“提取这张发票的表格”,Skill会自动调用百度文档解析API,返回解析结果,包括文本内容、表格数据、版面结构等,并支持直接输出为适合RAG应用的文档块。

适合人群:数据分析师需从报告中提取表格数据;学术研究者要处理大量PDF论文;文档工程师需要批量分析文档结构;内容创作者处理扫描件或图片中的文字。

使用建议:确保网络通畅并拥有百度文档解析API的密钥;对于超大文档(如上千页PDF),建议分段处理;解析结果中的表格数据可进一步清洗后用于下游分析;注意API调用次数限制和费用。

常见问题

支持哪些文档格式?

支持PDF、Word(doc/docx)、Excel(xls/xlsx)、PPT(ppt/pptx)、图片(jpg/png/bmp等)等18+种常见格式。

是否需要百度API密钥?

是的,需要先申请百度文档解析API的密钥,并在使用前配置好环境变量或直接提供。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/document-parser-api-5/raw/index.md 读取 百度文档解析pipeline-parser 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。