SteadyFetch

可靠网页抓取MCP服务器,内置重试与反爬

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:SteadyFetch。
它的用途是:可靠网页抓取MCP服务器,内置重试与反爬
详细介绍见:https://321skill.com/skills/steadyfetch/
请根据该页面的说明完成安装。

使用示例

'用SteadyFetch抓取https://example.com/today-news并返回Markdown格式',它会自动处理重试和反爬,返回干净的新闻正文。你还可以说:'检查example.com的域名健康状态,并清除缓存',它会执行健康检查并清空缓存,确保下次请求获取最新数据。

介绍

SteadyFetch 解决的是 AI 应用在获取网页内容时常见的“请求失败”“被反爬拦截”“返回杂乱 HTML”等问题。它内置了重试逻辑、熔断模式、缓存机制和反爬绕过策略,能够稳定地从目标 URL 获取原始 HTML 或干净的 Markdown 文本,特别适合大语言模型消费。

使用方式很简单:通过 MCP 协议调用工具,传入目标 URL 即可。服务器会自动处理失败重试、缓存命中、域名健康检查,并返回你指定的格式(raw HTML 或 clean markdown)。同时提供了缓存管理工具,可以手动清除或查看缓存状态。

适合后端开发者、数据分析师、内容创作者,以及任何需要从网页批量获取数据喂给 AI 模型的用户。如果你正在搭建知识库、做竞品分析、抓取行业报告,或者需要为 LLM 提供干净的上下文,这个工具都能大幅提升稳定性。

建议注意:SteadyFetch 主要针对静态 HTML 页面,不支持 JavaScript 渲染的 SPA 站点。对于需要登录或复杂交互的页面,需要额外处理。此外,频繁抓取同一域名时请合理设置缓存策略,避免触发对方服务器限流。

核心特点

同类工具通常只做简单请求转发,而 SteadyFetch 内置了重试、熔断、缓存和反爬绕过四重保障,并且能直接输出 LLM 友好的 Markdown 格式,无需二次清洗。

注意事项

不支持 JavaScript 渲染的动态页面,无法处理需要登录或复杂交互的网页。

常见问题

如何配置缓存过期时间?

SteadyFetch 默认使用 LRU 缓存,可通过 MCP 工具的 cache_ttl 参数自定义过期时间(单位秒)。

支持哪些反爬绕过方式?

内置了常见的 User-Agent 随机切换、请求头伪装、请求间隔控制等策略,降低被识别为爬虫的概率。