agent-skills-eval

Agent Skills 的测试运行器,量化评估技能效果。

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:agent-skills-eval。
它的用途是:Agent Skills 的测试运行器,量化评估技能效果。
完整的 Skill 内容见:https://321skill.com/skills/agent-skills-eval/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

“我想评估我刚写的‘数据可视化’技能是否有效。” 它会引导你运行 `npx agent-skills-eval ./my-skill --target gpt-4o --judge gpt-4o`。命令执行后,生成详细的HTML报告,清晰展示技能在测试用例上的通过率提升,以及法官模型对每次输出的具体评分和评语。

介绍

在 Agent Skills 生态中,为技能编写 SKILL.md 文件后,如何证明它确实提升了模型在特定任务上的表现?agent-skills-eval 解决了这个核心痛点。它是一个独立的测试框架,专门用于评估 Agent Skills 的实际效果。

使用方式非常直接。通过 CLI 命令,指定包含技能的文件夹、一个用于测试的目标模型和一个用于评分的法官模型,它就会自动运行评估。核心流程是:对同一组测试提示词,分别运行“加载技能”和“不加载技能”的两次测试,然后由法官模型对两次输出进行评分和对比。

这个工具非常适合所有创建和使用 Agent Skills 的开发者、产品经理和研究人员。无论是智能体开发者希望验证自研技能的有效性,还是团队负责人需要评估第三方技能的质量,都可以通过它获得数据驱动的决策依据。

建议在技能开发的早期就引入此工具,建立基准测试。注意,评估结果的客观性很大程度上依赖于法官模型的选择和测试用例(evals)的设计质量,因此需要精心设计测试集并选择合适的法官模型。

核心特点

与单纯的功能测试工具不同,它通过“有技能”与“无技能”的A/B对比测试,直接量化技能带来的性能提升,并提供由法官模型评分的客观报告,而非依赖主观感受。

注意事项

评估结果的准确性依赖于法官模型的判断能力和测试用例的设计质量,不适用于评估技能在未经测试的新领域或极端情况下的表现。

常见问题

agent-skills-eval 能测试哪些类型的技能?

只要是符合 Agent Skills 开放标准(agentskills.io)编写的技能,都可以用它来评估效果。

必须使用 OpenAI 的模型吗?

不是。它默认兼容 OpenAI API,但通过适配层,也支持 Anthropic、Groq、本地模型等任何兼容 OpenAI 聊天接口的服务。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/agent-skills-eval/raw/index.md 读取 agent-skills-eval 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。