newscrawler

让AI智能体高效提取12个主流新闻平台的结构化内容

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:newscrawler。
它的用途是:让AI智能体高效提取12个主流新闻平台的结构化内容
完整的 Skill 内容见:https://321skill.com/skills/newscrawler/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

当你需要分析一篇热点新闻时,可以直接

对AI说:“使用news-extractor技能,提取并总结这篇BBC新闻的核心观点:https://bbc.com/news/articles/...”。AI会调用该Skill,先获取到纯净的结构化内容(标题、分段正文、图片),然后基于这些高质量信息进行精准的总结和分析,避免了被页面广告和无关内容干扰。

介绍

NewsCrawler 的核心是一个名为 news-extractor 的 Agent Skill,它解决了AI智能体在获取网页新闻内容时面临的核心痛点:效率低下和上下文污染。当AI需要分析一篇新闻时,传统方法往往需要启动浏览器、加载整个DOM(文档对象模型),再将包含大量广告、导航、脚本等噪声的页面内容塞入有限的模型上下文窗口,这不仅耗时,更浪费了宝贵的Token资源。

这个Skill将针对12个主流新闻平台(如微信公众号、今日头条、BBC、CNN等)的精准抓取逻辑打包成一个自包含的代码模块。AI只需调用该Skill并传入新闻URL,它就能在本地直接运行对应平台的提取代码,跳过浏览器渲染步骤,高效地返回一个结构化的NewsItem对象,其中包含纯净的标题、正文、图片和元数据。

它非常适合需要频繁处理和分析网络新闻内容的AI Agent开发者、研究人员以及任何希望构建自动化新闻摘要、舆情监控或内容分析工作流的用户。对于AI本身而言,这意味着它能将更多计算资源用于核心的推理、总结和判断任务,而非消耗在网页解析和噪声过滤上。

与同类工具相比,NewsCrawler并非一个通用的网页爬虫或内容提取器。它的独特之处在于深度定制了每个支持平台的解析规则(Adapter),专门针对新闻类站点的文章页面结构进行优化,从而在提取准确率和内容纯净度上表现更佳,并且将提取过程封装为AI可直接调用的标准化Skill。

核心特点

本Skill的核心区别在于:它并非通用网页解析器,而是深度定制了12个特定新闻平台的提取规则(Adapter),能绕过浏览器直接返回高度结构化、去噪后的纯净内容(JSON/Markdown),实测可将输入模型的Token数量减少97%以上,极大提升了AI处理新闻的效率。

注意事项

由于依赖针对特定网站结构的定制规则,当网站改版或遇到未支持的平台时,提取可能失败,需要更新对应的Adapter。

常见问题

NewsCrawler支持哪些新闻网站?

目前支持12个平台,包括微信公众号、今日头条、网易、搜狐、腾讯新闻、Lenny's Newsletter、Naver Blog、Detik News、Quora、BBC News、CNN和Twitter/X。

使用这个Skill能节省多少AI上下文?

根据实测,相比加载完整浏览器DOM,使用Skill提取的结构化JSON能减少约97%的Token消耗,若仅需正文的Markdown格式,则可节省近99%的Token。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/newscrawler/raw/index.md 读取 newscrawler 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。