Smart Scraper

零依赖网页结构化数据提取工具

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:Smart Scraper。
它的用途是:零依赖网页结构化数据提取工具
完整的 Skill 内容见:https://321skill.com/skills/smart-scraper-x-5/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

'提取 https://example.com/prices 中的所有表格数据,返回 JSON 格式。' 它会自动解析 HTML,识别表格结构,输出包含行和列的数组,并缓存结果避免重复请求。

介绍

Smart Scraper 解决的是从杂乱网页中精准提取结构化数据的痛点。无论是表格、列表、价格、文章正文还是元数据,它都能通过 HTML 解析自动识别并输出整洁的 JSON 或 CSV 格式,告别手动复制粘贴的繁琐与错误。

使用方式极简:只需传入目标 URL 和提取规则(如 CSS 选择器或 XPath),即可获得结构化结果。内置缓存机制自动跳过重复请求,避免触发网站反爬限制,同时提升二次查询效率。整个工具零外部依赖,无需安装任何第三方库,开箱即用。

适合后端开发人员快速集成到数据管道、数据分析师批量采集公开数据集、以及需要定期抓取网页内容做竞品调研的团队。对于静态 HTML 页面,它是轻量级且高效的选择。

使用建议:请务必遵守目标网站的 robots.txt 协议和版权规定,避免高频请求导致 IP 被封。本工具不处理 JavaScript 动态渲染内容,若需抓取 SPA 页面,请先使用预渲染服务。

核心特点

与同类工具相比,Smart Scraper 零外部依赖、自带缓存,无需安装任何第三方库即可运行,适合对部署环境有严格限制的轻量级项目。

注意事项

无法处理需要 JavaScript 渲染的动态网页,仅解析静态 HTML 内容。

常见问题

支持哪些输出格式?

默认返回 JSON,也可配置为 CSV 格式。

如何自定义提取规则?

支持 CSS 选择器和 XPath 表达式,在调用时传入规则参数即可。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/smart-scraper-x-5/raw/index.md 读取 Smart Scraper 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。