pi-smart-fetch

智能网页抓取工具,模拟浏览器并提取内容。

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:pi-smart-fetch。
它的用途是:智能网页抓取工具,模拟浏览器并提取内容。
完整的 Skill 内容见:https://321skill.com/skills/pi-smart-fetch/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

‘用 pi-smart-fetch 帮我抓取 example.com 的产品价格列表。’,它会调用该工具发起请求,模拟真实浏览器访问,并自动解析页面上可能被混淆的价格信息,最后将结构化的数据返回给你。

介绍

在开发或数据采集过程中,直接使用传统 HTTP 客户端抓取网页常会遇到两大难题:一是网站采用复杂的反爬虫机制(如 TLS 指纹识别、JavaScript 混淆)导致请求被拒绝;二是返回的页面内容经过混淆或动态加载,难以提取有效信息。pi-smart-fetch 正是为解决这些问题而生,它通过模拟桌面浏览器的 TLS 指纹来绕过基础的反爬检测,并结合“defuddle”(反混淆/解扰)功能来提取被混淆或隐藏的真实内容。

使用 pi-smart-fetch 非常简单。它是一个 Node.js 包,可以通过 npm 安装。在代码中引入后,你可以像使用常规 fetch 或 axios 一样发起请求,但底层会自动处理 TLS 伪装和内容解扰。开发者无需深入了解 TLS 或混淆技术的细节,即可获取到更接近真实浏览器访问的响应结果。

这个工具非常适合前端开发者、数据分析师、爬虫工程师以及任何需要从现代复杂网站中可靠获取数据的开发者。特别是当目标网站使用了 Cloudflare 等服务的反爬措施,或者页面内容被 JavaScript 动态混淆时,pi-smart-fetch 能显著提高数据获取的成功率。

需要注意的是,虽然它能绕过一些基础防护,但并非万能。对于极其严格或不断升级的反爬系统,可能仍需结合其他策略。使用时请务必遵守目标网站的 robots.txt 协议和服务条款,尊重数据所有权,避免对目标服务器造成过大负载。建议在合法合规的范围内,如市场调研、公开数据监控或测试自身网站等场景下使用。

核心特点

其核心在于集成了“桌面浏览器 TLS 模拟”与“defuddle 内容提取”于一体,不仅能伪装成合法浏览器绕过基础 TLS 指纹验证,还能自动解析并提取被 JavaScript 混淆或动态扰乱的页面核心内容,而同类工具通常只侧重其中一方面。

注意事项

不适合用于对抗具有极其复杂、实时更新且行为验证严格(如高强度验证码、鼠标轨迹分析)的顶级反爬系统的场景。

常见问题

pi-smart-fetch 能绕过 Cloudflare 吗?

可以应对 Cloudflare 的部分基础反爬挑战(如 TLS 指纹和简单 JS 挑战),但对于其高级防护(如 5秒盾、行为验证)可能力不从心。

defuddle 提取是什么意思?

指自动识别并解析网页中经过混淆(如代码压缩、变量名替换)或动态扰乱的 HTML/文本内容,将其还原为可读、可解析的清晰数据。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/pi-smart-fetch/raw/index.md 读取 pi-smart-fetch 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。