alibabacloud-agentloop-evaluation

阿里云AgentLoop评估工作流编排工具

开发流程 评估模型效果分析AI响应 通用 ★ 194 更新于 2026-08-02

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:alibabacloud-agentloop-evaluation。
它的用途是:阿里云AgentLoop评估工作流编排工具
完整的 Skill 内容见:https://321skill.com/skills/alibabacloud-agentloop-evaluation/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

'帮我创建一个新的评估器,评估我的客服机器人的回复质量,使用traces数据集进行批量运行。' 它会先通过Aliyun CLI dry-run预览要创建的评估器配置和API调用序列,确认后执行创建,并自动启动批量运行,最后返回评估结果和低分案例摘要。

介绍

这个Skill解决了在阿里云上编排AgentLoop评估工作流时流程繁琐、容易出错的问题。开发者需要频繁创建或更新评估器、启动评估任务、监控运行状态并分析结果,手动调用AgentLoop API不仅效率低,还容易遗漏步骤。该Skill将多个API调用封装为一条自然语言指令,大幅降低操作门槛。

使用方式很简单,你只需要配置好Aliyun CLI(>=3.3.3)并安装aliyun-cli-agentloop插件,同时安装SLS插件用于结果分析。之后就可以通过自然语言指令来创建、更新评估器,运行一次性样本测试或批量数据集评估,支持dry-run安全预览,确认无误后通过--execute执行。评估完成后,还可以自动从SLS拉取低分案例进行分析。

它非常适合需要频繁评估AI Agent性能的团队或个人,尤其是那些已经使用阿里云AgentLoop服务进行智能体开发、迭代的开发者。测试工程师和运维工程师也可以用它来批量执行回归评估,并快速定位质量问题。

建议在已有Aliyun CLI环境且版本符合要求时统一使用此工具。需要注意的是,它主要依赖阿里云CLI及插件,首次使用需完成认证配置,且不要直接在会话中暴露AK/SK。该Skill的Python脚本仅依赖Python 3.8+标准库,无需额外安装第三方包。

常见问题

如何安装这个Skill?

确保Aliyun CLI >= 3.3.3,然后运行 `aliyun plugin install --name aliyun-cli-agentloop` 安装AgentLoop插件,再安装SLS插件 `aliyun plugin install --name aliyun-cli-sls`。最后通过ClawHub安装此Skill:`claw install alibabacloud-agentloop-evaluation`。

如何查看评估结果?

评估完成后,Skill会自动从SLS的evaluation_detail Logstore拉取结果,包括低分案例。你可以通过自然语言询问“显示上次评估的低分案例”来获取详细分析。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/alibabacloud-agentloop-evaluation/raw/index.md 读取 alibabacloud-agentloop-evaluation 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。