web2md
将网页内容转换为适合AI处理的纯净Markdown文档。
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:web2md。 它的用途是:将网页内容转换为适合AI处理的纯净Markdown文档。 完整的 Skill 内容见:https://321skill.com/skills/web2md/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
“帮我把这个React官方教程网页的内容抓取下来,保存为Markdown文件,方便我离线学习。”,它会调用web2md,使用Puppeteer完整渲染页面,智能提取教程正文,去除导航和广告等噪音,生成一个结构清晰、带有代码高亮的Markdown文件。或者,你可以说:“我需要分析这几篇行业报告,请先把它们从网页转换成干净的文本。”,它会批量处理URL,输出标准化的Markdown,便于你后续进行文本分析和信息提取。
介绍
web2md 是一个专为AI和LLM设计的工具,旨在解决从网页中高效、准确地提取和格式化内容的问题。它能够将复杂的网页(包括JavaScript渲染的单页应用)转换为干净、结构化的Markdown文本,便于后续的分析、存档或输入到大型语言模型中。
使用方式非常灵活,可以通过简单的命令行直接运行,无需安装。用户只需提供目标URL,即可通过多种选项控制输出格式、浏览器行为(如等待页面加载、处理登录验证)以及导航细节。工具会自动提取文章主体内容,并生成包含元数据的YAML Frontmatter。
这个工具非常适合需要批量处理网页内容、构建知识库或为AI助手准备输入材料的各类专业人士。例如,内容创作者可以快速存档文章,开发者可以将技术文档转换为AI友好的格式,研究人员可以收集和分析网络信息。
在使用时,建议根据目标网站的特性调整等待时间和选择器。对于动态加载内容较多的网站,可以启用交互模式或设置更长的等待时间以确保内容完整抓取。同时,请注意遵守目标网站的Robots协议和版权规定。
核心特点
与简单HTTP请求抓取工具不同,web2md使用真实的Puppeteer浏览器渲染页面,能完美处理JavaScript动态内容;同时,它集成了Mozilla的Readability库进行智能内容提取,并专门针对AI/LLM的输入需求优化了Markdown输出格式。
注意事项
不适合需要绕过付费墙、登录后或需要复杂交互(如多步表单提交)才能访问的网页内容抓取。
常见问题
web2md支持抓取需要登录的网站吗?
支持,可以使用 --interactive 模式暂停浏览器手动登录,或使用 --user-data-dir 指定已登录的Chrome用户数据目录。
转换后的Markdown包含图片吗?
包含,工具会提取图片并保留其Markdown引用链接,但不会下载图片到本地。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/web2md/raw/index.md 读取 web2md 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/web2md/raw/index.md(查看排版版本)