eval-view

AI Agent的快照测试工具,自动检测行为回归。

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:eval-view。
它的用途是:AI Agent的快照测试工具,自动检测行为回归。
完整的 Skill 内容见:https://321skill.com/skills/eval-view/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

“帮我检查一下更新提示词后,客服机器人的处理流程有没有变化。” 它会引导你运行 `evalview check` 命令,对比工具调用序列,并清晰指出是调用了新工具、顺序改变,还是输出评分下降了。

介绍

EvalView 解决了AI Agent在模型更新、提示词修改或服务商变更后,行为发生难以察觉的“静默变化”问题。这些变化(如调用错误工具、跳过关键步骤、输出质量下降)往往逃过传统测试,却直接影响用户体验。

使用方式极其简单:通过 evalview snapshot 命令记录Agent当前的行为轨迹(包括工具调用顺序、参数和输出)作为“黄金基线”。之后任何代码或配置变更后,运行 evalview check 即可与基线对比,自动识别工具调用差异或输出质量回归。

它非常适合需要确保AI Agent行为稳定性的开发者,特别是智能体开发、全栈开发和测试工程师。在频繁迭代Agent逻辑、切换底层模型或进行A/B测试时,它能作为关键的回归防护网。

建议将其集成到CI/CD流程中,作为代码合并前的质量门禁。对于非确定性较强的场景,可以配置多路径基线。注意,它主要聚焦于行为轨迹对比,深度输出质量评估需结合LLM法官或其他评估工具。

核心特点

与需要预先编写大量断言的传统评估工具不同,EvalView采用“快照测试”理念,只需记录当前正常行为作为基线,即可自动捕捉任何未预期的行为偏离。其核心在于对比完整的工具调用轨迹,而不仅仅是最终输出字符串,能更精准地定位问题根源。

注意事项

不适合用于评估Agent行为的绝对正确性,或作为功能完备性的唯一测试方案。

常见问题

EvalView和LangSmith/PromptFoo有什么区别?

EvalView是回归测试工具,核心是检测行为变化;LangSmith等是开发/观测平台,功能更全面。两者可互补使用。

需要API密钥吗?

基础的工具调用轨迹对比完全离线运行,无需API密钥;仅在需要LLM评估输出质量时才需配置。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/eval-view/raw/index.md 读取 eval-view 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。