mcp
网站文档下载工具,为RAG索引准备数据
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:mcp。 它的用途是:网站文档下载工具,为RAG索引准备数据 详细介绍见:https://321skill.com/skills/mcp-mcp-windows-website-downloader/ 请根据该页面的说明完成安装。
使用示例
'下载 https://docs.example.com 所有技术文档,准备RAG索引'。工具会自动递归爬取该网站下所有页面,清洗内容,输出为Markdown格式,并附带页面标题、URL、层级关系等元数据,直接存入本地文件夹。
介绍
该工具专门解决从网站批量下载文档并结构化存储的问题,为构建RAG(检索增强生成)知识库提供高质量的数据源。它能够自动抓取目标网站的多层级页面,提取正文内容、标题、元数据,并转换为Markdown或JSON格式,方便后续索引和检索。
使用方式非常简洁:用户只需提供目标网站URL,工具会递归爬取指定深度内的所有页面,过滤广告、导航等无关元素,保留核心文档内容。支持自定义下载规则(如路径匹配、文件类型过滤),输出可直接导入向量数据库或本地文件系统。
适合需要快速搭建领域知识库的文档工程师、数据分析师、后端开发者,以及正在构建RAG应用的AI开发者。尤其适合那些需要从技术文档、帮助中心、Wiki等静态网站提取结构化知识的场景。
建议在下载前先通过robots.txt确认网站允许爬取,并控制并发请求以避免对目标服务器造成压力。对于动态渲染的页面(如SPA),可能需要配合无头浏览器使用。该工具默认只处理静态HTML,不处理JavaScript渲染内容。
核心特点
与通用网站爬虫不同,它专为RAG场景优化,输出格式直接适配向量数据库;且内置了内容去重、文档分割、元数据提取等预处理逻辑,减少后续Token消耗。
注意事项
不适用于需要登录或复杂交互的动态网站,也不支持JavaScript渲染的页面。
常见问题
如何安装这个MCP工具?
通过npm全局安装:npm install -g mcp-website-downloader
下载后的文档能直接用于RAG吗?
可以,输出格式为Markdown和JSON,包含文档元数据,可直接导入向量数据库如Chroma、Pinecone等。