headed-fetcher

用 headed 浏览器抓取反爬网页并转为 Markdown 的 Claude Code 技能。

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:headed-fetcher。
它的用途是:用 headed 浏览器抓取反爬网页并转为 Markdown 的 Claude Code 技能。
完整的 Skill 内容见:https://321skill.com/skills/headed-fetcher/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

“帮我抓取 https://example.com/protected-article 这篇文章的正文内容,保存为Markdown。” 它会调用 headed-fetcher 技能,启动一个 headed 浏览器访问该页面,绕过可能的反爬检测,提取文章主体部分,并将其转换为带YAML元数据的Markdown文件输出给你。

介绍

headed-fetcher 是一款专为应对现代网站反爬虫机制(如 Cloudflare)而设计的网页抓取工具。它通过 Playwright 启动真实的 headed(带界面)浏览器来模拟人类访问,有效绕过常见的 JavaScript 挑战和机器人检测,从而获取那些普通爬虫工具无法访问的页面内容。

使用方式非常灵活,既可以通过简单的命令行直接抓取 URL,也可以集成到 Claude Code 等 AI 开发环境中作为工具调用。用户只需提供目标网址,即可选择以 headed 或 headless 模式运行,并可指定 CSS 选择器来精确提取页面中的特定区域(如文章正文),最后将结果转换为结构清晰的 Markdown 格式并输出。

该技能特别适合需要从受保护的网站(如技术文档站、新闻门户、电商平台)中稳定获取内容的前后端开发者、内容创作者和数据分析师。对于学术研究者,它也是收集网络文献资料的高效工具。

需要注意的是,虽然 headed 模式能有效应对反爬,但执行速度会比纯 headless 模式慢,且对运行环境有图形界面的要求。建议仅在遇到访问限制时使用 —headed 选项,并合理设置超时时间。同时,请务必遵守目标网站的 robots.txt 协议和相关法律法规,仅用于合法的数据收集目的。

核心特点

核心在于使用 Playwright 的 headed 浏览器模式来模拟真人操作,专门攻克 Cloudflare 等反机器人验证,这是普通无头浏览器或 requests 库无法做到的;同时,它原生集成到 Claude Code 技能生态,提供开箱即用的 Markdown 转换和资源过滤优化。

注意事项

不适合需要极高抓取速度的大规模、并发爬虫场景,且 headed 模式需要图形界面环境支持。

常见问题

和普通的爬虫工具有什么区别?

主要区别是能用带界面的真实浏览器(headed模式)绕过复杂的反爬机制(如Cloudflare挑战),普通工具遇到这类网站通常会返回403错误或验证页面。

抓取速度慢怎么办?

可以启用 --no-block-images 等选项允许加载必要资源,或在不需反爬时使用默认的headless模式,并确保网络通畅。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/headed-fetcher/raw/index.md 读取 headed-fetcher 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。