Markdown Web Crawl MCP服务器
多线程批量抓取网站内容并保存为Markdown文件
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:Markdown Web Crawl MCP服务器。 它的用途是:多线程批量抓取网站内容并保存为Markdown文件 完整的 Skill 内容见:https://321skill.com/skills/markdown-web-crawl-mcp服务器/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
“帮我抓取这三个科技博客首页的最新文章内容,保存为Markdown到我的‘资料收集’文件夹。”,它会启动多线程任务,快速访问这些网址,提取文章标题和正文,并生成结构清晰的.md文件。或者,你可以说:“批量下载这个文档网站所有子页面的内容”,它会自动遍历链接并完成抓取。
介绍
该Skill旨在高效解决从多个网页批量获取并结构化内容的需求。用户只需提供目标网址列表,它便能利用多线程技术并发抓取,自动解析网页正文、标题等关键信息,并转换为格式清晰的Markdown文件,极大节省手动复制粘贴和整理的时间。
使用方式非常直接:在支持MCP(Model Context Protocol)的AI平台(如Claude Desktop)中配置并启用此服务器后,用户即可通过自然语言指令或编程接口提交抓取任务。系统会处理网络请求、内容解析和文件保存等所有复杂步骤。
它特别适合需要定期从固定网站源收集信息的内容创作者、进行竞品或市场数据分析的研究人员,以及需要将网页资料本地化存档以备查阅或处理的各类专业人士。
建议在使用前确认目标网站允许爬取,并合理设置请求间隔以避免对目标服务器造成过大压力。对于需要登录或具有复杂交互(如大量JavaScript渲染)的网页,其抓取效果可能受限,更适合处理以静态内容为主的新闻、博客、文档类网站。
核心特点
核心优势在于其多线程批量处理能力,能显著提升大量网页的抓取效率;同时,它专注于输出标准化的Markdown格式,便于后续的编辑、归档或导入到其他笔记、文档系统中,而不仅仅是简单的HTML保存。
注意事项
不适合抓取需要复杂交互(如登录、点击)或严重依赖JavaScript动态渲染内容的网页。
常见问题
支持抓取需要登录的网站吗?
不支持,目前主要针对公开可访问的静态内容网页。
抓取下来的Markdown文件包含图片吗?
通常只保存文本和结构,图片一般以链接形式保留,不会下载到本地。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/markdown-web-crawl-mcp服务器/raw/index.md 读取 Markdown Web Crawl MCP服务器 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/markdown-web-crawl-mcp服务器/raw/index.md(查看排版版本)