web2md

将网页内容转换为适合AI处理的纯净Markdown文档。

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:web2md。
它的用途是:将网页内容转换为适合AI处理的纯净Markdown文档。
完整的 Skill 内容见:https://321skill.com/skills/web2md/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

“帮我把这个React官方教程网页的内容抓取下来,保存为Markdown文件,方便我离线学习。”,它会调用web2md,使用Puppeteer完整渲染页面,智能提取教程正文,去除导航和广告等噪音,生成一个结构清晰、带有代码高亮的Markdown文件。或者,你可以说:“我需要分析这几篇行业报告,请先把它们从网页转换成干净的文本。”,它会批量处理URL,输出标准化的Markdown,便于你后续进行文本分析和信息提取。

介绍

web2md 是一个专为AI和LLM设计的工具,旨在解决从网页中高效、准确地提取和格式化内容的问题。它能够将复杂的网页(包括JavaScript渲染的单页应用)转换为干净、结构化的Markdown文本,便于后续的分析、存档或输入到大型语言模型中。

使用方式非常灵活,可以通过简单的命令行直接运行,无需安装。用户只需提供目标URL,即可通过多种选项控制输出格式、浏览器行为(如等待页面加载、处理登录验证)以及导航细节。工具会自动提取文章主体内容,并生成包含元数据的YAML Frontmatter。

这个工具非常适合需要批量处理网页内容、构建知识库或为AI助手准备输入材料的各类专业人士。例如,内容创作者可以快速存档文章,开发者可以将技术文档转换为AI友好的格式,研究人员可以收集和分析网络信息。

在使用时,建议根据目标网站的特性调整等待时间和选择器。对于动态加载内容较多的网站,可以启用交互模式或设置更长的等待时间以确保内容完整抓取。同时,请注意遵守目标网站的Robots协议和版权规定。

核心特点

与简单HTTP请求抓取工具不同,web2md使用真实的Puppeteer浏览器渲染页面,能完美处理JavaScript动态内容;同时,它集成了Mozilla的Readability库进行智能内容提取,并专门针对AI/LLM的输入需求优化了Markdown输出格式。

注意事项

不适合需要绕过付费墙、登录后或需要复杂交互(如多步表单提交)才能访问的网页内容抓取。

常见问题

web2md支持抓取需要登录的网站吗?

支持,可以使用 --interactive 模式暂停浏览器手动登录,或使用 --user-data-dir 指定已登录的Chrome用户数据目录。

转换后的Markdown包含图片吗?

包含,工具会提取图片并保留其Markdown引用链接,但不会下载图片到本地。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/web2md/raw/index.md 读取 web2md 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。