Smart Scraper
从网页中提取表格、列表、价格等结构化数据
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:Smart Scraper。 它的用途是:从网页中提取表格、列表、价格等结构化数据 完整的 Skill 内容见:https://321skill.com/skills/smart-scraper-x-7/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
'从https://example.com/prices中提取所有商品价格和名称,输出为表格',它会使用Smart Scraper抓取页面,解析HTML中的价格标签和商品列表,返回结构化的JSON数据。若再次请求同一页面,将直接使用缓存结果,避免重复网络请求。
介绍
Smart Scraper 是一个轻量级的网页结构化数据提取工具,专门解决从静态 HTML 页面中自动获取表格、列表、价格、文章正文、元数据等信息的需求。它内置了 HTML 解析引擎和缓存机制,无需任何外部依赖即可运行,安装后即可使用。
使用方式简单直接:只需指定目标网页 URL 和期望提取的数据类型(如表格、列表或特定元素),Smart Scraper 便会自动解析网页结构,将非结构化内容转化为结构化的 JSON 或列表格式。内置缓存能避免重复请求,提升多次扫描同一页面时的效率,适合批量采集场景。
适合数据分析师、内容创作者、后端开发等需要从网页中快速获取数据的人群。数据分析师可用它采集竞品价格或行业表格;内容创作者可抓取文章正文或元数据用于二次创作;后端开发可将其集成到数据管道中,作为轻量级爬虫组件。
使用建议:Smart Scraper 仅适用于静态 HTML 页面,无法处理 JavaScript 动态渲染的内容。若目标网站依赖 Ajax 加载数据或使用 SPA 框架,需配合其他工具(如无头浏览器)先获取完整 HTML。另外,请遵守目标网站的 robots.txt 协议和相关法律法规,合理控制请求频率。
核心特点
零外部依赖,纯 Python 实现 HTML 解析 + 缓存,安装即用,无需安装任何第三方库(如 BeautifulSoup、lxml),适合对部署环境有严格限制或追求极简的场景。
注意事项
无法处理需要 JavaScript 执行的动态网页,仅支持静态 HTML 页面。
常见问题
能提取动态加载的内容吗?
不能,只支持静态 HTML。动态内容需先通过无头浏览器渲染后再使用本工具。
支持哪些数据类型?
支持表格、列表、价格、文章正文、元数据(如标题、描述、关键词)等常见结构化数据。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/smart-scraper-x-7/raw/index.md 读取 Smart Scraper 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/smart-scraper-x-7/raw/index.md(查看排版版本)