百度文档解析pipeline-parser
百度文档解析API封装,支持18+格式文档解析
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:百度文档解析pipeline-parser。 它的用途是:百度文档解析API封装,支持18+格式文档解析 完整的 Skill 内容见:https://321skill.com/skills/document-parser-api-5/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
'请解析这份PDF合同,提取所有文本和表格,并按段落分块输出。' 它会调用百度文档解析API,返回结构化结果,包括文本、表格(Markdown格式)以及分块后的文档片段,方便后续RAG检索。
介绍
本Skill解决的是多格式文档解析的痛点:PDF、Word、Excel、PPT、图片等18种以上文档的文本提取、表格识别、版面分析、OCR扫描件识别,以及RAG文档分块。用户无需关心底层API调用细节,只需输入文档路径或URL,即可获得结构化输出。
使用方法极其简单:对AI说“解析这份PDF年报”或“提取这张发票的表格”,Skill会自动调用百度文档解析API,返回解析结果,包括文本内容、表格数据、版面结构等,并支持直接输出为适合RAG应用的文档块。
适合人群:数据分析师需从报告中提取表格数据;学术研究者要处理大量PDF论文;文档工程师需要批量分析文档结构;内容创作者处理扫描件或图片中的文字。
使用建议:确保网络通畅并拥有百度文档解析API的密钥;对于超大文档(如上千页PDF),建议分段处理;解析结果中的表格数据可进一步清洗后用于下游分析;注意API调用次数限制和费用。
常见问题
支持哪些文档格式?
支持PDF、Word(doc/docx)、Excel(xls/xlsx)、PPT(ppt/pptx)、图片(jpg/png/bmp等)等18+种常见格式。
是否需要百度API密钥?
是的,需要先申请百度文档解析API的密钥,并在使用前配置好环境变量或直接提供。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/document-parser-api-5/raw/index.md 读取 百度文档解析pipeline-parser 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/document-parser-api-5/raw/index.md(查看排版版本)