Web Scraper — Clean Markdown from Any URL
AI代理网页抓取转Markdown工具
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:Web Scraper — Clean Markdown from Any URL。 它的用途是:AI代理网页抓取转Markdown工具 完整的 Skill 内容见:https://321skill.com/skills/web-scraper-clean-markdown-from-any-url/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
'请帮我抓取https://example.com/article的内容,转换为Markdown格式,并提取标题和字数。' 它会调用web_scrape_to_markdown工具,返回干净的Markdown文本、页面标题、字数统计和页面内链接列表。若需要批量处理多个竞品文章,可以说:'抓取以下10个URL的内容,分别输出Markdown并汇总字数。' 它会使用web_scrape_batch工具一次性完成。
介绍
Web Scraper 是一个专为AI代理设计的网页内容提取工具,解决传统网页抓取返回杂乱HTML、包含导航广告脚本等干扰信息的问题。它通过headless Chromium渲染JavaScript,将任意URL转换为干净、结构化的Markdown内容,同时自动剥离导航栏、广告和脚本,仅保留正文核心信息。
使用方式简单:通过两个工具函数——web_scrape_to_markdown(单次抓取)和web_scrape_batch(批量抓取最多10个URL)。调用后返回包含markdown内容、标题、字数统计和页面链接列表的数据。无需API密钥,采用x402微支付模式,每次调用费用仅0.005美元(基于Base L2链),适合高频低成本的AI工作流。
适合以下用户:构建RAG(检索增强生成)管道的开发者、进行AI研究的学者、需要批量采集网页内容做竞品情报分析或内容分析的数据分析师、以及需要定期抓取网页做知识库构建的团队。特别适合需要高质量文本输入给大语言模型(LLM)的场景。
注意事项:如果需要截取网页截图或生成PDF,请使用capture_screenshot工具;如需进行SEO分析,请使用seo_audit_page。本工具专注于文本提取,不适合需要保留页面视觉布局或执行复杂交互的场景。批量模式每次最多10个URL,超出需分批处理。
核心特点
相比普通网页抓取工具(如requests+BeautifulSoup),Web Scraper内置headless Chromium渲染JavaScript,能处理SPA(单页应用)和动态加载内容;同时自动剥离干扰元素,直接输出干净Markdown,无需额外清洗步骤。微支付模式无需API Key,按调用计费,成本透明且适合自动化流水线。
注意事项
不适合需要保留网页原始样式、截图或PDF的场景,也不支持需要登录认证或复杂表单交互的页面抓取。
常见问题
需要API密钥吗?
不需要,采用x402微支付,每次调用扣除0.005美元,基于Base L2链。
支持抓取动态网站吗?
支持,使用headless Chromium渲染JavaScript,可以处理SPA和动态加载内容。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/web-scraper-clean-markdown-from-any-url/raw/index.md 读取 Web Scraper — Clean Markdown from Any URL 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/web-scraper-clean-markdown-from-any-url/raw/index.md(查看排版版本)