@bytesbrains/pi-textbrowser

为Pi设计的无头浏览器,通过DOM与OCR文本地图浏览网页。

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:@bytesbrains/pi-textbrowser。
它的用途是:为Pi设计的无头浏览器,通过DOM与OCR文本地图浏览网页。
完整的 Skill 内容见:https://321skill.com/skills/bytesbrains-pi-textbrowser/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

“使用pi-textbrowser打开知乎首页,并提取今日热榜的前三个标题。”,它会启动无头浏览器访问页面,通过DOM和OCR技术定位热榜区域,并以结构化文本形式返回标题列表,整个过程不消耗图像token。

介绍

该Skill旨在解决在Pi等AI Agent环境中浏览网页时,因依赖截图识别而产生的图像token消耗过高、成本昂贵的问题。它通过结合DOM解析与OCR技术,生成网页的文本地图,使AI能够理解网页结构和内容,而无需处理完整的图像数据。

使用时,开发者或AI系统可以调用该Skill来导航、解析和提取网页中的文本信息。它提供了一个轻量级的浏览器环境,能够执行基本的页面交互,并将网页内容以结构化的文本形式返回,便于后续处理。

它非常适合需要集成网页浏览功能、且对成本敏感的AI Agent开发者、自动化脚本编写者以及希望构建低成本信息检索工具的技术团队。

建议在需要大量、频繁抓取网页文本内容,但对页面复杂视觉渲染要求不高的场景下使用。注意,由于不加载完整图像,对于严重依赖视觉布局或动态Canvas渲染的内容,其解析效果可能有限。

核心特点

核心区别在于采用“DOM+OCR文本地图”而非传统截图,避免了昂贵的图像token消耗,据称可将浏览成本降低10-50倍。

注意事项

不适合需要精确识别复杂视觉布局、动态图形或高度依赖CSS样式渲染的网页内容。

常见问题

这个浏览器能处理JavaScript渲染的页面吗?

作为无头浏览器,它能处理部分JS,但复杂动态内容可能受限。

和普通无头浏览器(如Puppeteer)有什么区别?

核心区别是输出为优化的OCR文本地图,专为降低AI处理成本设计,而非完整HTML或截图。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/bytesbrains-pi-textbrowser/raw/index.md 读取 @bytesbrains/pi-textbrowser 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。