SteadyFetch
可靠网页抓取MCP服务器,内置重试与反爬
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:SteadyFetch。 它的用途是:可靠网页抓取MCP服务器,内置重试与反爬 详细介绍见:https://321skill.com/skills/steadyfetch/ 请根据该页面的说明完成安装。
使用示例
'用SteadyFetch抓取https://example.com/today-news并返回Markdown格式',它会自动处理重试和反爬,返回干净的新闻正文。你还可以说:'检查example.com的域名健康状态,并清除缓存',它会执行健康检查并清空缓存,确保下次请求获取最新数据。
介绍
SteadyFetch 解决的是 AI 应用在获取网页内容时常见的“请求失败”“被反爬拦截”“返回杂乱 HTML”等问题。它内置了重试逻辑、熔断模式、缓存机制和反爬绕过策略,能够稳定地从目标 URL 获取原始 HTML 或干净的 Markdown 文本,特别适合大语言模型消费。
使用方式很简单:通过 MCP 协议调用工具,传入目标 URL 即可。服务器会自动处理失败重试、缓存命中、域名健康检查,并返回你指定的格式(raw HTML 或 clean markdown)。同时提供了缓存管理工具,可以手动清除或查看缓存状态。
适合后端开发者、数据分析师、内容创作者,以及任何需要从网页批量获取数据喂给 AI 模型的用户。如果你正在搭建知识库、做竞品分析、抓取行业报告,或者需要为 LLM 提供干净的上下文,这个工具都能大幅提升稳定性。
建议注意:SteadyFetch 主要针对静态 HTML 页面,不支持 JavaScript 渲染的 SPA 站点。对于需要登录或复杂交互的页面,需要额外处理。此外,频繁抓取同一域名时请合理设置缓存策略,避免触发对方服务器限流。
核心特点
同类工具通常只做简单请求转发,而 SteadyFetch 内置了重试、熔断、缓存和反爬绕过四重保障,并且能直接输出 LLM 友好的 Markdown 格式,无需二次清洗。
注意事项
不支持 JavaScript 渲染的动态页面,无法处理需要登录或复杂交互的网页。
常见问题
如何配置缓存过期时间?
SteadyFetch 默认使用 LRU 缓存,可通过 MCP 工具的 cache_ttl 参数自定义过期时间(单位秒)。
支持哪些反爬绕过方式?
内置了常见的 User-Agent 随机切换、请求头伪装、请求间隔控制等策略,降低被识别为爬虫的概率。