eval-view
AI Agent的快照测试工具,自动检测行为回归。
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:eval-view。 它的用途是:AI Agent的快照测试工具,自动检测行为回归。 完整的 Skill 内容见:https://321skill.com/skills/eval-view/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
“帮我检查一下更新提示词后,客服机器人的处理流程有没有变化。” 它会引导你运行 `evalview check` 命令,对比工具调用序列,并清晰指出是调用了新工具、顺序改变,还是输出评分下降了。
介绍
EvalView 解决了AI Agent在模型更新、提示词修改或服务商变更后,行为发生难以察觉的“静默变化”问题。这些变化(如调用错误工具、跳过关键步骤、输出质量下降)往往逃过传统测试,却直接影响用户体验。
使用方式极其简单:通过 evalview snapshot 命令记录Agent当前的行为轨迹(包括工具调用顺序、参数和输出)作为“黄金基线”。之后任何代码或配置变更后,运行 evalview check 即可与基线对比,自动识别工具调用差异或输出质量回归。
它非常适合需要确保AI Agent行为稳定性的开发者,特别是智能体开发、全栈开发和测试工程师。在频繁迭代Agent逻辑、切换底层模型或进行A/B测试时,它能作为关键的回归防护网。
建议将其集成到CI/CD流程中,作为代码合并前的质量门禁。对于非确定性较强的场景,可以配置多路径基线。注意,它主要聚焦于行为轨迹对比,深度输出质量评估需结合LLM法官或其他评估工具。
核心特点
与需要预先编写大量断言的传统评估工具不同,EvalView采用“快照测试”理念,只需记录当前正常行为作为基线,即可自动捕捉任何未预期的行为偏离。其核心在于对比完整的工具调用轨迹,而不仅仅是最终输出字符串,能更精准地定位问题根源。
注意事项
不适合用于评估Agent行为的绝对正确性,或作为功能完备性的唯一测试方案。
常见问题
EvalView和LangSmith/PromptFoo有什么区别?
EvalView是回归测试工具,核心是检测行为变化;LangSmith等是开发/观测平台,功能更全面。两者可互补使用。
需要API密钥吗?
基础的工具调用轨迹对比完全离线运行,无需API密钥;仅在需要LLM评估输出质量时才需配置。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/eval-view/raw/index.md 读取 eval-view 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/eval-view/raw/index.md(查看排版版本)