Playwright Scraper MCP服务
基于Playwright将网页内容抓取并转换为Markdown格式的工具。
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:Playwright Scraper MCP服务。 它的用途是:基于Playwright将网页内容抓取并转换为Markdown格式的工具。 完整的 Skill 内容见:https://321skill.com/skills/playwright-scraper-mcp服务/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
“帮我抓取并总结https://example.com/blog/ai-trends 这篇文章的核心观点。”,它会启动Playwright访问该页面,将文章正文转换为Markdown格式,并提取关键信息进行总结。或者
对AI说:“将这几个竞品官网的功能介绍页抓取下来,保存为Markdown文件方便对比。”,它会依次访问你提供的URL,分别生成对应的Markdown文档。
介绍
该Skill解决了从网页高效提取结构化信息的难题。传统复制粘贴或简单的HTML解析难以处理动态加载内容、复杂布局或需要保留格式的场景,导致信息收集效率低下且格式混乱。
它通过集成Playwright无头浏览器,能够模拟真实用户访问,完整渲染JavaScript动态生成的内容,并将抓取到的网页HTML智能地转换为干净、易读的Markdown格式,便于后续编辑、存档或导入到其他文档工具中。
它非常适合需要从大量网页中收集资料的内容创作者、学术研究者、数据分析师以及需要进行竞品分析或市场调研的产品经理和运营人员。对于开发者和技术写作者,它也是快速获取技术文档或代码示例原文的得力助手。
使用建议:在处理需要登录后才能访问的页面或对抗爬虫机制较强的网站时,可能需要配合额外的配置(如设置Cookies、使用代理、调整等待时间)。注意遵守目标网站的Robots协议和服务条款,合理控制请求频率,避免对对方服务器造成过大压力。
核心特点
与仅能处理静态HTML的简单爬虫工具不同,它利用Playwright确保能抓取到JavaScript渲染后的完整页面内容;与直接输出HTML或纯文本的工具相比,其核心价值在于将内容智能转换为结构清晰的Markdown,极大提升了内容的可复用性和可读性。
注意事项
不适合需要绕过复杂验证码或严格反爬机制的商业级数据采集场景,也不适用于抓取需要实时交互(如频繁点击、拖拽)才能获取的内容。
常见问题
它能抓取需要登录的页面吗?
可以,但需要预先配置好认证信息(如Cookies、Token)到Playwright上下文中。
转换的Markdown格式准确吗?
对于大多数结构良好的文章、博客、文档页面转换效果很好,但对于复杂表格或特殊排版可能需手动调整。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/playwright-scraper-mcp服务/raw/index.md 读取 Playwright Scraper MCP服务 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/playwright-scraper-mcp服务/raw/index.md(查看排版版本)