WebforAI Text Extractor MCP服务器

基于Cloudflare Workers的网页文本提取MCP服务器

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:WebforAI Text Extractor MCP服务器。
它的用途是:基于Cloudflare Workers的网页文本提取MCP服务器
完整的 Skill 内容见:https://321skill.com/skills/webforai-text-extractor-mcp服务器/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

“帮我提取这个技术博客文章链接的正文内容。”,它会调用此Skill,从指定的URL中智能识别并剥离无关元素,返回纯净的文章文本。或者

对AI说:“分析这几个竞品官网的文案特点。”,它可以先批量提取这些网站的文本内容,为你后续的分析提供干净的数据源。

介绍

这个Skill解决了从网页中高效、结构化地提取纯文本内容的需求。许多AI应用需要处理网页信息,但直接处理原始HTML会包含大量无关的样式、脚本代码和广告,影响分析质量和Token消耗。

它通过集成WebforAI库,在Cloudflare Workers边缘计算环境中运行,能够智能地剥离HTML标签、导航栏、广告等非核心内容,仅保留文章主体、标题等关键文本信息,输出干净、结构化的文本。

它非常适合需要批量处理网页内容或将其作为AI应用数据输入管道的开发者、数据分析师和内容创作者。例如,构建知识库时需要抓取大量技术文档,或者进行市场调研时需要分析竞品网站内容。

使用建议:由于运行在Cloudflare Workers上,请确保目标网页允许爬取,并注意Worker的免费额度限制。对于需要JavaScript渲染的动态网页,此工具可能无法提取完整内容,建议结合其他工具使用。

核心特点

核心区别在于部署在Cloudflare Workers边缘网络,提供低延迟、高并发的文本提取服务,并且专门集成了WebforAI库进行智能内容清洗,相比通用爬虫能更精准地提取文章主体,减少噪音。

注意事项

不适合需要提取JavaScript动态渲染内容或处理需要登录才能访问的网页。

常见问题

它能提取需要登录才能查看的网页内容吗?

不能,它只能提取公开可访问的网页内容。

提取的文本包含图片描述吗?

不包含,它主要提取HTML中的文本节点,通常无法获取图片的alt文本等属性。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/webforai-text-extractor-mcp服务器/raw/index.md 读取 WebforAI Text Extractor MCP服务器 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。