agent-eval-harness

用于评估和测试命令行智能体性能的通用框架。

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:agent-eval-harness。
它的用途是:用于评估和测试命令行智能体性能的通用框架。
完整的 Skill 内容见:https://321skill.com/skills/agent-eval-harness/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

‘我需要评估新开发的客服智能体在处理工单分类任务上的准确率。’ 它会引导你使用 `skills/trial-adapters` 生成适配器,然后通过 `agent-eval-harness eval` 命令运行包含历史工单的测试集,最终生成一份详细的评分和对比报告,帮助你量化智能体的改进效果。

介绍

agent-eval-harness 是一个专为命令行智能体设计的通用评估框架。它解决了开发者在衡量和比较不同智能体或不同配置下的智能体性能时,缺乏标准化、自动化评估流程的痛点。

该工具通过一个统一的入口命令,支持运行(run)、评分(grade)、比较(compare)和校准(calibrate)四种核心模式。用户只需通过 JSON 配置指定评估模式和相关参数,即可驱动整个评估流程,从原始任务执行到最终结果对比,生成结构化的评估报告。

它非常适合智能体开发者、测试工程师以及需要进行智能体性能基准测试的研究人员。无论是开发新的智能体技能,还是优化现有智能体的提示词或逻辑,都可以借助此工具进行客观、可复现的评估。

使用建议是,遵循其倡导的规范工作流,即利用配套的 Skill(如 trial-runner, trial-adapters)来生成评估套件和适配器,避免手动编写评估编排代码,以确保评估的一致性和可维护性。

核心特点

与零散的评估脚本相比,它提供了标准化的 CLI 接口和完整的数据流管道(运行->评分->比较),并强制通过 Skill 生成评估逻辑,确保了评估过程的可复现性和一致性。

注意事项

不适合需要复杂图形界面交互或非命令行环境的智能体评估。

常见问题

如何查看评估结果的详细对比报告?

使用 `compare` 模式,它会对比两份已评分的 JSONL 文件,并生成包含 exactPassAtK 等指标的 JSON 报告。

评估过程中某个任务失败了怎么办?

失败信息会被编码在对应的 `trial_result` 行中,不会导致整个 CLI 进程失败,评估流程可以继续。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/agent-eval-harness/raw/index.md 读取 agent-eval-harness 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。