pi-agent-browser
为pi提供浏览器自动化工具,支持交互式浏览与截图分析。
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:pi-agent-browser。 它的用途是:为pi提供浏览器自动化工具,支持交互式浏览与截图分析。 完整的 Skill 内容见:https://321skill.com/skills/pi-agent-browser/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
‘请用pi-agent-browser打开GitHub趋势页面并截图分析今日热门仓库。’,它会自动启动浏览器,导航到指定页面,截图并利用内联视觉功能识别出仓库名称和描述,将结构化结果返回给你。
介绍
pi-agent-browser 是一款专为pi设计的浏览器自动化工具,它解决了在AI Agent工作流中需要手动操作浏览器或难以获取网页视觉信息的痛点。通过集成浏览器控制、截图与内联视觉分析功能,它能让AI直接与网页进行交互并“看到”页面内容。
使用方式非常直接,主要通过 agent-browser 命令行工具进行调用。你可以启动一个交互式浏览会话,让AI控制浏览器导航、点击或填写表单;也可以直接对指定URL进行截图,并将截图内容连同视觉分析结果一并返回给AI,无需人工介入截图和描述过程。
这个工具非常适合需要在AI辅助下进行网页研究、数据抓取、自动化测试或内容审核的开发者、研究员和自动化脚本编写者。它特别适合那些希望将网页信息(尤其是视觉布局和动态内容)无缝整合到AI对话或自动化流程中的场景。
使用建议是,在处理需要登录或包含复杂JavaScript交互的网站时,注意会话状态的管理。由于工具可能涉及浏览器资源,使用完毕后建议通过CLI命令及时清理会话,避免占用过多系统内存。对于纯数据API调用,可能仍有更轻量级的替代方案。
核心特点
核心区别在于深度集成“内联视觉”分析,截图后AI能直接解读页面视觉元素和布局,而非仅仅获取图片文件;同时提供专用的 agent-browser CLI 进行会话管理,与pi生态结合更紧密。
注意事项
不适合对浏览器性能或实时性要求极高的自动化测试场景。
常见问题
如何清理浏览器会话?
使用 agent-browser CLI 提供的会话清理命令。
支持无头模式吗?
支持,可以在命令中配置无头模式运行。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/pi-agent-browser/raw/index.md 读取 pi-agent-browser 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/pi-agent-browser/raw/index.md(查看排版版本)