Readability (Fetch & Parse) MCP服务器
Python实现的网页内容提取工具,可转为Markdown格式。
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:Readability (Fetch & Parse) MCP服务器。 它的用途是:Python实现的网页内容提取工具,可转为Markdown格式。 完整的 Skill 内容见:https://321skill.com/skills/readability-fetch-amp-parse-mcp服务器/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
“帮我把这篇技术博客文章《https://example.com/tech-article》的核心内容提取出来,转换成Markdown格式。”,它会调用该Skill抓取指定URL,运用算法剥离广告和侧边栏,将文章的标题、正文、代码块和列表等内容清晰地转换为结构化的Markdown文本,方便你直接粘贴到笔记软件中。
介绍
这个Skill旨在解决从网页中高效、准确地提取核心文本内容并转换为结构化Markdown格式的难题。许多网页充斥着广告、导航栏等无关信息,直接复制粘贴会包含大量噪音,而本工具能智能识别并剥离这些干扰元素,只保留文章主体内容,极大地方便了内容的二次整理和利用。
使用时,您只需提供目标网页的URL,该Skill便会自动抓取页面,并运用Mozilla的Readability算法解析HTML结构,识别出正文、标题、列表等关键元素,最终输出一份干净、格式化的Markdown文档。整个过程自动化完成,无需手动清理和调整格式。
它非常适合需要大量阅读、整理网络资料的内容创作者、学术研究者、数据分析师以及任何需要将网页信息存档或纳入知识管理系统的用户。无论是撰写报告引用网络资料,还是构建个人知识库,都能显著提升效率。
建议在需要获取网页核心内容而非完整页面快照时使用。请注意,该工具主要针对新闻文章、博客帖子等以文本为主的页面优化,对于高度依赖JavaScript动态渲染或结构极其特殊的网页,提取效果可能不佳,此时可能需要结合其他工具或手动调整。
核心特点
核心在于采用了经过广泛验证的Mozilla Readability算法,该算法源自Firefox浏览器的阅读模式,在识别网页正文、过滤无关元素方面更加成熟和准确,相比一些简单的HTML解析器,能更好地处理复杂多变的网页布局。
注意事项
对于严重依赖JavaScript渲染的现代单页应用(SPA)或结构非标准的网页,内容提取可能不完整或失败。
常见问题
它能提取图片吗?
主要专注于文本和结构提取,图片链接可能会被保留在Markdown中,但不会下载图片本身。
支持需要登录才能访问的页面吗?
通常不支持,因为它是一个无状态的抓取工具,无法处理登录会话或Cookie。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/readability-fetch-amp-parse-mcp服务器/raw/index.md 读取 Readability (Fetch & Parse) MCP服务器 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/readability-fetch-amp-parse-mcp服务器/raw/index.md(查看排版版本)