evals
在智能体内部创建和运行可复现的评估流程。
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:evals。 它的用途是:在智能体内部创建和运行可复现的评估流程。 完整的 Skill 内容见:https://321skill.com/skills/evals/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
‘我们刚刚配置好了CI/CD流程,创建一个评估来验证整个部署链路是否正常工作。’ 它会将你刚才配置环境、执行构建、部署服务的所有步骤和成功状态,总结成一个 `.eval.md` 文件。之后,你可以随时运行这个评估,它会启动一个新的智能体从头执行一遍整个流程,并告诉你是否成功。
介绍
Evals Skill 解决了在智能体开发流程中,对复杂、多步骤操作进行自动化测试和验证的难题。传统测试框架需要搭建外部环境、编写特定代码,而 Evals 让你可以直接在智能体对话中,将任何刚刚完成的复杂流程(如配置服务器、实现登录功能)一键捕获为可重复运行的评估脚本。
使用时,只需在智能体完成一系列操作后,告诉它“创建评估”,它就会自动将刚才的步骤和预期结果总结成一个 Markdown 文件。之后,你可以通过 /evals run 命令在任何时候重新运行这个评估,它会启动一个全新的子智能体来执行,确保流程的可复现性。
这个技能非常适合需要频繁验证工作流程正确性的开发者、测试工程师和运维人员。无论是检查一个刚上线的功能,还是确保一个多日的部署流程无误,都可以用它来固化标准操作并快速验证。
建议将 Evals 用于验证那些涉及多个工具、跨越多个会话的确定性流程。由于它依赖 LLM 作为判断者,对于需要精确数值比对或复杂逻辑断言的场景,可能需要结合更传统的断言方法。
核心特点
与传统需要独立环境、测试框架和 DSL 的评估工具不同,Evals 完全内置于智能体工作流中,利用智能体自身能力执行和判断,实现了“零配置、零切换”的流程固化与验证。
注意事项
不适合需要精确数值断言或复杂逻辑判断的单元测试场景。
常见问题
Evals 和单元测试有什么区别?
Evals 用于捕获和验证由智能体执行的、涉及多工具和多步骤的端到端流程或工作流,而非针对单一函数或模块的细粒度测试。
运行评估时会使用原来的对话记忆吗?
不会,每次运行评估都会生成一个全新的子智能体,拥有干净的上下文,以确保评估的可复现性和独立性。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/evals/raw/index.md 读取 evals 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/evals/raw/index.md(查看排版版本)