skill-eval-harness
测量Agent Skill因果提升的评估工具
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:skill-eval-harness。 它的用途是:测量Agent Skill因果提升的评估工具 完整的 Skill 内容见:https://321skill.com/skills/skill-eval-harness/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
'请使用 skill-eval-harness 评估我的新技能 skill-v2,与旧版本 skill-v1 进行对比,运行 10 次重复实验,输出包含显著性和提升幅度的报告。' 它会根据 `evals/shared-benchmark.json` 中的配置准备配对任务,调用模型执行,然后本地评分并生成详细的 benchmark 报告,标注哪些案例有显著提升、哪些无变化、哪些回退。
介绍
Skill Eval Harness 是一个专注于评估 AI Agent 技能(Skill)因果提升效果的 Python CLI 工具。它解决的核心问题是:如何科学、可信地判断一个技能是否真的带来了模型输出的改进,而不仅仅是“看起来不错”。通过配对实验设计(有/无技能、新旧技能对比),它确保每次评估都在相同的案例、模型和重复次数下进行,从而分离出技能本身的真实贡献。
使用方式非常简洁:首先在 evals/shared-benchmark.json 中描述测试案例,包括提示词、分裂策略、断言规则等;然后运行 skill-benchmark prepare 生成任务行,用任何支持输出格式的模型运行器(如 Claude、Codex 等)执行;最后通过 skill-benchmark benchmark 命令进行本地确定性评分,无需额外模型调用,生成包含通过率、提升幅度、显著性、泄漏检测等详细报告。
这款工具尤其适合智能体开发者、AI 应用测试工程师和平台质量团队。如果你正在迭代 Agent Skill(如提示词优化、指令模板、外部工具调用),需要确认每次改动是否真的有效,或者想对比不同模型下同一技能的表现,Skill Eval Harness 能提供严谨的定量依据。
使用建议:先从小规模案例开始,逐步扩展到完整 benchmark;注意维护 tune/holdout/holdback 分裂,避免数据泄漏;定期运行 validate --strict-leakage 检查答案泄漏,确保评估结果可信。该工具不适用于非配对对比的通用评估场景,也不适合需要在线模型评分或主观判断的维度。
核心特点
与 openai/evals、vitest-evals 等通用评估框架不同,Skill Eval Harness 专门设计用于测量技能带来的因果提升,通过精确的配对实验(有/无技能、旧/新技能)和分裂纪律(tune/holdout/holdback),确保每个数值差异都能归因于技能本身,而非随机波动或评估方法偏差。
注意事项
不适合单独评分一个输出(无配对对比)的场景,也不适合需要主观人类判断或大量在线模型调用的评估任务。
常见问题
如何安装 skill-eval-harness?
推荐使用 pip 安装:`pip install skill-eval-harness`。或者从 GitHub 克隆仓库后本地安装:`git clone https://github.com/adewale/skill-eval-harness.git && cd skill-eval-harness && pip install -e .`
如何运行第一个评估?
首先在项目目录下创建 `evals/shared-benchmark.json` 文件,定义测试案例。然后运行 `skill-benchmark prepare` 生成任务,用你的模型运行器执行输出,最后运行 `skill-benchmark benchmark` 查看报告。详细步骤请参考 README 中的“Core loop”部分。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/skill-eval-harness/raw/index.md 读取 skill-eval-harness 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/skill-eval-harness/raw/index.md(查看排版版本)