kabigon

一个Python库,自动从各类网页和文件中提取纯文本或Markdown内容。

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:kabigon。
它的用途是:一个Python库,自动从各类网页和文件中提取纯文本或Markdown内容。
完整的 Skill 内容见:https://321skill.com/skills/kabigon/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

“帮我用 kabigon 提取这个 YouTube 视频链接的字幕和描述文本。” 它会指导你安装 kabigon 并执行 `kabigon https://www.youtube.com/watch?v=xxx` 命令,快速获得干净的文本内容。或者,在 Python 数据分析脚本中,你可以导入 kabigon 库,异步批量抓取多个社交媒体帖子的文本,用于后续的情感分析或趋势研究。

介绍

kabigon 是一个专为开发者和数据工程师设计的 Python 库和 CLI 工具,它解决了从多样化网络来源(如 YouTube、Twitter/X、Reddit、PDF 等)高效、可靠地提取结构化文本内容的难题。用户无需为每个网站编写特定的抓取逻辑,只需提供一个 URL,kabigon 便能自动选择合适的加载器进行处理。

使用方式极其简单。通过一行 Python 代码 kabigon.load_url_sync(url) 或直接在命令行中执行 kabigon <url>,即可获得目标内容的纯文本或 Markdown 格式。它支持同步和异步调用,方便集成到各种脚本、数据管道或 Jupyter Notebook 中。

该工具非常适合需要批量处理网络内容、构建数据集或进行内容分析的开发者、数据工程师和研究人员。对于需要从社交媒体、新闻网站、文档或代码仓库中提取信息用于分析、归档或训练模型的场景,kabigon 能显著提升效率。

使用前请注意,部分功能依赖 Playwright Chromium 浏览器(用于通用网页抓取)和 FFmpeg(用于音视频转录),需提前安装。此外,使用 Firecrawl 加载器时需要配置相应的 API 密钥环境变量。

核心特点

其核心优势在于“自动选择加载器”和“故障回退链”机制:它能根据 URL 智能匹配最合适的专用加载器(如 YouTube、Twitter 等),如果首选加载器失败,会按顺序尝试其他加载器而不会重复尝试,大大提高了提取成功率和健壮性。

注意事项

不适合需要提取高度动态、JavaScript 渲染复杂或需要登录才能访问的网页的完整交互内容。

常见问题

kabigon 支持提取哪些网站的内容?

支持 YouTube、Twitter/X、Reddit、Instagram Reels、PDF、GitHub、BBC、CNN 等多种常见网站和文件类型,并能自动回退到通用网页抓取。

使用 kabigon 需要会编程吗?

不需要,它提供了 CLI 工具,通过命令行即可使用。对于开发者,也提供了简洁的 Python API。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/kabigon/raw/index.md 读取 kabigon 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。