Website

基于wget的网站下载工具,高效抓取网页内容

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:Website。
它的用途是:基于wget的网站下载工具,高效抓取网页内容
详细介绍见:https://321skill.com/skills/website/
请根据该页面的说明完成安装。

使用示例

“帮我下载维基百科上关于人工智能的页面,包括所有链接的图片,保存到本地‘AI_Wiki’文件夹。”,它会通过downloader MCP服务器调用wget,自动递归抓取该页面及其子链接中的指定资源,并保持原始目录结构。或者,您可以说:“备份我的个人博客站点。”,它便会启动对整个站点的镜像下载任务。

介绍

downloader MCP服务器解决了需要快速、批量获取网站内容或进行离线存档的问题。它通过集成经典的wget工具,将复杂的命令行操作封装为AI Agent可直接调用的标准化接口,简化了网页抓取流程。

使用时,您只需在支持MCP协议的AI工具中配置此服务器,即可通过自然语言指令(如“下载这个网站”)来触发下载任务。它会自动处理递归抓取、文件类型过滤等细节,并将结果保存到指定目录。

这个Skill特别适合需要定期采集网页数据、备份网站内容或为本地分析准备素材的用户。它降低了使用wget的技术门槛,让非专业开发人员也能轻松实现网站下载。

建议在遵守目标网站robots.txt协议和版权法规的前提下使用。对于需要处理JavaScript动态渲染内容的现代网页,此工具可能无法获取完整数据,建议结合无头浏览器工具使用。

核心特点

核心区别在于它并非重新造轮子,而是将久经考验、功能强大的wget工具封装为MCP标准接口,确保了下载的稳定性和丰富的原有功能(如限速、重试、镜像等)得以保留,同时实现了与AI工作流的无缝集成。

注意事项

不适合需要抓取大量依赖JavaScript动态加载内容的现代单页应用(SPA)网站。

常见问题

它能下载需要登录的网站吗?

支持,可以通过配置wget的cookie或认证参数来实现。

下载的文件保存在哪里?

文件默认保存在服务器指定的目录中,具体路径可在配置或指令中设定。