newscrawler
让AI智能体高效提取12个主流新闻平台的结构化内容
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:newscrawler。 它的用途是:让AI智能体高效提取12个主流新闻平台的结构化内容 完整的 Skill 内容见:https://321skill.com/skills/newscrawler/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
当你需要分析一篇热点新闻时,可以直接
对AI说:“使用news-extractor技能,提取并总结这篇BBC新闻的核心观点:https://bbc.com/news/articles/...”。AI会调用该Skill,先获取到纯净的结构化内容(标题、分段正文、图片),然后基于这些高质量信息进行精准的总结和分析,避免了被页面广告和无关内容干扰。
介绍
NewsCrawler 的核心是一个名为 news-extractor 的 Agent Skill,它解决了AI智能体在获取网页新闻内容时面临的核心痛点:效率低下和上下文污染。当AI需要分析一篇新闻时,传统方法往往需要启动浏览器、加载整个DOM(文档对象模型),再将包含大量广告、导航、脚本等噪声的页面内容塞入有限的模型上下文窗口,这不仅耗时,更浪费了宝贵的Token资源。
这个Skill将针对12个主流新闻平台(如微信公众号、今日头条、BBC、CNN等)的精准抓取逻辑打包成一个自包含的代码模块。AI只需调用该Skill并传入新闻URL,它就能在本地直接运行对应平台的提取代码,跳过浏览器渲染步骤,高效地返回一个结构化的NewsItem对象,其中包含纯净的标题、正文、图片和元数据。
它非常适合需要频繁处理和分析网络新闻内容的AI Agent开发者、研究人员以及任何希望构建自动化新闻摘要、舆情监控或内容分析工作流的用户。对于AI本身而言,这意味着它能将更多计算资源用于核心的推理、总结和判断任务,而非消耗在网页解析和噪声过滤上。
与同类工具相比,NewsCrawler并非一个通用的网页爬虫或内容提取器。它的独特之处在于深度定制了每个支持平台的解析规则(Adapter),专门针对新闻类站点的文章页面结构进行优化,从而在提取准确率和内容纯净度上表现更佳,并且将提取过程封装为AI可直接调用的标准化Skill。
核心特点
本Skill的核心区别在于:它并非通用网页解析器,而是深度定制了12个特定新闻平台的提取规则(Adapter),能绕过浏览器直接返回高度结构化、去噪后的纯净内容(JSON/Markdown),实测可将输入模型的Token数量减少97%以上,极大提升了AI处理新闻的效率。
注意事项
由于依赖针对特定网站结构的定制规则,当网站改版或遇到未支持的平台时,提取可能失败,需要更新对应的Adapter。
常见问题
NewsCrawler支持哪些新闻网站?
目前支持12个平台,包括微信公众号、今日头条、网易、搜狐、腾讯新闻、Lenny's Newsletter、Naver Blog、Detik News、Quora、BBC News、CNN和Twitter/X。
使用这个Skill能节省多少AI上下文?
根据实测,相比加载完整浏览器DOM,使用Skill提取的结构化JSON能减少约97%的Token消耗,若仅需正文的Markdown格式,则可节省近99%的Token。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/newscrawler/raw/index.md 读取 newscrawler 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/newscrawler/raw/index.md(查看排版版本)