WebforAI Text Extractor MCP服务器
基于Cloudflare Workers的网页文本提取MCP服务器
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:WebforAI Text Extractor MCP服务器。 它的用途是:基于Cloudflare Workers的网页文本提取MCP服务器 完整的 Skill 内容见:https://321skill.com/skills/webforai-text-extractor-mcp服务器/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
“帮我提取这个技术博客文章链接的正文内容。”,它会调用此Skill,从指定的URL中智能识别并剥离无关元素,返回纯净的文章文本。或者
对AI说:“分析这几个竞品官网的文案特点。”,它可以先批量提取这些网站的文本内容,为你后续的分析提供干净的数据源。
介绍
这个Skill解决了从网页中高效、结构化地提取纯文本内容的需求。许多AI应用需要处理网页信息,但直接处理原始HTML会包含大量无关的样式、脚本代码和广告,影响分析质量和Token消耗。
它通过集成WebforAI库,在Cloudflare Workers边缘计算环境中运行,能够智能地剥离HTML标签、导航栏、广告等非核心内容,仅保留文章主体、标题等关键文本信息,输出干净、结构化的文本。
它非常适合需要批量处理网页内容或将其作为AI应用数据输入管道的开发者、数据分析师和内容创作者。例如,构建知识库时需要抓取大量技术文档,或者进行市场调研时需要分析竞品网站内容。
使用建议:由于运行在Cloudflare Workers上,请确保目标网页允许爬取,并注意Worker的免费额度限制。对于需要JavaScript渲染的动态网页,此工具可能无法提取完整内容,建议结合其他工具使用。
核心特点
核心区别在于部署在Cloudflare Workers边缘网络,提供低延迟、高并发的文本提取服务,并且专门集成了WebforAI库进行智能内容清洗,相比通用爬虫能更精准地提取文章主体,减少噪音。
注意事项
不适合需要提取JavaScript动态渲染内容或处理需要登录才能访问的网页。
常见问题
它能提取需要登录才能查看的网页内容吗?
不能,它只能提取公开可访问的网页内容。
提取的文本包含图片描述吗?
不包含,它主要提取HTML中的文本节点,通常无法获取图片的alt文本等属性。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/webforai-text-extractor-mcp服务器/raw/index.md 读取 WebforAI Text Extractor MCP服务器 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/webforai-text-extractor-mcp服务器/raw/index.md(查看排版版本)