harbor
一个用于评估和优化AI智能体与语言模型的框架。
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:harbor。 它的用途是:一个用于评估和优化AI智能体与语言模型的框架。 完整的 Skill 内容见:https://321skill.com/skills/harbor/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
“我想评估一下 Claude Code 在终端任务上的表现。” 它会引导你使用 Harbor 框架,通过 `harbor run --dataset terminal-bench@2.0 --agent claude-code --model anthropic/claude-opus-4-1` 命令启动评估,并在本地或云端生成详细的性能报告。
介绍
Harbor 是一个由 Terminal-Bench 团队创建的框架,旨在解决AI智能体和语言模型在真实、复杂环境(如终端、代码库)中难以评估和优化的痛点。它允许开发者和研究者对各类智能体(如 Claude Code, OpenHands 等)进行系统性的基准测试。
使用 Harbor,你可以通过简单的命令行接口,在本地或云端并行运行数千个环境任务,从而高效地评估智能体在特定数据集(如终端任务、代码修复)上的表现。它支持多种云服务提供商,便于进行大规模实验。
这个框架非常适合智能体开发者、AI研究人员以及任何需要对AI模型或自动化代理进行性能评估和迭代优化的团队。通过 Harbor,他们可以构建、共享基准测试,并利用生成的轨迹数据进行强化学习优化。
建议用户在使用前熟悉 Docker 环境,并根据实验规模选择合适的云服务提供商(如 Daytona)以提升效率。注意,运行某些基准测试需要相应的 API 密钥和云服务账户。
核心特点
Harbor 是 Terminal-Bench 的官方评估工具,专注于在容器化环境中对智能体进行大规模、可复现的基准测试,并原生支持通过 Daytona 等云服务进行并行实验,这在同类评估工具中较为独特。
注意事项
该框架主要面向开发和评估阶段,不适合直接用于生产环境部署或作为最终用户的应用。
常见问题
Harbor 能测试哪些智能体?
支持 Claude Code、OpenHands、Codex CLI 等多种智能体,具体可通过 `harbor run --help` 查看。
如何运行一个公开的基准测试?
使用 `harbor run -d "<数据集名@版本>" -m "<模型>" -a "<智能体>"` 命令,例如运行 Terminal-Bench-2.0。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/harbor/raw/index.md 读取 harbor 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/harbor/raw/index.md(查看排版版本)