mcp
基于MCP协议的网页文档爬取与Markdown转换服务器。
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:mcp。 它的用途是:基于MCP协议的网页文档爬取与Markdown转换服务器。 详细介绍见:https://321skill.com/skills/mcp-mcp-doc-scraper/ 请根据该页面的说明完成安装。
使用示例
“帮我把 https://example.com/docs 这篇官方API文档抓取下来,转换成结构清晰的Markdown格式,并总结一下核心端点。” 它会调用 doc-scraper 获取网页内容,将其转换为易于编辑和阅读的Markdown文本,并基于此内容为你生成摘要。
介绍
doc-scraper 是一个基于 Model Context Protocol (MCP) 的服务器,专门用于将网页内容抓取并转换为清晰易读的 Markdown 格式。它解决了从网页中高效提取和整理结构化信息的难题,尤其适合处理文档类网页。
使用方式非常简单,你只需要在支持 MCP 协议的 AI 开发工具(如 Claude Desktop)中配置此服务器地址,即可通过 AI 直接调用其功能。例如,你可以让 AI 助手帮你抓取某个技术文档的网页并转换成 Markdown,用于本地存档或进一步编辑。
这个工具非常适合需要频繁从网页获取信息并进行二次加工的角色,如内容创作者、文档工程师、学术研究者以及需要整理网络资料的程序员。它能将杂乱的 HTML 内容转化为结构化的纯文本,极大提升信息处理效率。
建议在使用前确认目标网站允许爬取,并注意控制请求频率以避免对目标服务器造成压力。对于需要登录才能访问或含有大量动态交互内容的网页,转换效果可能不佳。
核心特点
专为 MCP 协议生态设计,能够无缝集成到 Claude 等 AI 助手中,通过自然语言指令即可完成网页抓取和格式转换,无需编写爬虫代码。其转换算法针对文档类网页(如技术文档、博客文章)进行了优化,能更好地保留标题层级、代码块、列表等关键格式。
注意事项
不适合抓取需要复杂交互(如登录、大量JavaScript渲染)的网页,或进行大规模、高频的批量爬取任务。
常见问题
这个工具和普通的网页剪藏插件有什么区别?
它基于MCP协议,可与AI深度集成,通过对话指令操作,并能将结果直接用于AI的后续处理或生成任务中,而不仅仅是本地保存。
转换后的Markdown格式准确吗?
对于结构清晰的文档类网页(如官方文档、技术博客)准确率很高,能较好地处理标题、列表和代码块。对于复杂布局或大量广告的页面,可能需要手动调整。