@bytesbrains/pi-textbrowser
为Pi设计的无头浏览器,通过DOM与OCR文本地图浏览网页。
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:@bytesbrains/pi-textbrowser。 它的用途是:为Pi设计的无头浏览器,通过DOM与OCR文本地图浏览网页。 完整的 Skill 内容见:https://321skill.com/skills/bytesbrains-pi-textbrowser/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
“使用pi-textbrowser打开知乎首页,并提取今日热榜的前三个标题。”,它会启动无头浏览器访问页面,通过DOM和OCR技术定位热榜区域,并以结构化文本形式返回标题列表,整个过程不消耗图像token。
介绍
该Skill旨在解决在Pi等AI Agent环境中浏览网页时,因依赖截图识别而产生的图像token消耗过高、成本昂贵的问题。它通过结合DOM解析与OCR技术,生成网页的文本地图,使AI能够理解网页结构和内容,而无需处理完整的图像数据。
使用时,开发者或AI系统可以调用该Skill来导航、解析和提取网页中的文本信息。它提供了一个轻量级的浏览器环境,能够执行基本的页面交互,并将网页内容以结构化的文本形式返回,便于后续处理。
它非常适合需要集成网页浏览功能、且对成本敏感的AI Agent开发者、自动化脚本编写者以及希望构建低成本信息检索工具的技术团队。
建议在需要大量、频繁抓取网页文本内容,但对页面复杂视觉渲染要求不高的场景下使用。注意,由于不加载完整图像,对于严重依赖视觉布局或动态Canvas渲染的内容,其解析效果可能有限。
核心特点
核心区别在于采用“DOM+OCR文本地图”而非传统截图,避免了昂贵的图像token消耗,据称可将浏览成本降低10-50倍。
注意事项
不适合需要精确识别复杂视觉布局、动态图形或高度依赖CSS样式渲染的网页内容。
常见问题
这个浏览器能处理JavaScript渲染的页面吗?
作为无头浏览器,它能处理部分JS,但复杂动态内容可能受限。
和普通无头浏览器(如Puppeteer)有什么区别?
核心区别是输出为优化的OCR文本地图,专为降低AI处理成本设计,而非完整HTML或截图。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/bytesbrains-pi-textbrowser/raw/index.md 读取 @bytesbrains/pi-textbrowser 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/bytesbrains-pi-textbrowser/raw/index.md(查看排版版本)