@sreetej510/pi-shipd-checks

对AI基准任务进行严格的多智能体公平性审查与测试分析

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:@sreetej510/pi-shipd-checks。
它的用途是:对AI基准任务进行严格的多智能体公平性审查与测试分析
完整的 Skill 内容见:https://321skill.com/skills/sreetej510-pi-shipd-checks/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

“请对`my_benchmark_task`这个文件夹运行`/checks`命令。” 它会自动解析该文件夹下的任务定义文件,启动多智能体审查流程,并生成一份详细的公平性与测试覆盖分析报告,帮助你发现任务设计中可能存在的偏见或测试盲区。

介绍

该Skill旨在解决AI基准任务开发中可能存在的评估偏差与测试覆盖不全问题。它通过一个名为/checks的命令,对任务的核心文件(如agent_prompt.mdtest.patchsolution.patch)进行自动化、多角度的审查。

使用时,开发者只需在Pi环境中调用/checks命令并指定目标基准任务,该Skill便会启动一个多智能体审查流程,分析任务提示的公平性、测试补丁的完整性以及解决方案补丁的合理性。

它非常适合AI基准测试的创建者、评审员以及致力于提升AI评估体系质量和公平性的研究人员。他们可以利用此工具在任务发布前进行自查,或在评审他人任务时提供客观依据。

建议将此工具作为任务开发流程中的一个强制性检查环节。需要注意的是,其审查结果基于预设的规则和多智能体模拟,虽然能发现许多潜在问题,但最终仍需结合人类专家的判断来做出决策。

核心特点

该Skill的核心在于其“多智能体公平性审查”机制,它并非单一规则检查,而是模拟多个不同角色的AI代理对任务进行交叉审视,能更全面地发现潜在偏见。同时,它独有的“行为测试差距分析”功能,能识别出测试用例未覆盖到的关键行为场景。

注意事项

该Skill主要针对结构化的基准任务文件进行审查,对于高度抽象、非标准格式或实时交互式的任务评估场景可能不适用。

常见问题

这个检查工具能检查哪些类型的文件?

主要检查基准任务的agent_prompt.md(代理提示)、test.patch(测试补丁)和solution.patch(解决方案补丁)三个核心文件。

/checks命令的运行结果包含什么?

结果会包含公平性审查报告、测试覆盖度分析以及潜在的行为测试差距提示,以结构化摘要形式呈现。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/sreetej510-pi-shipd-checks/raw/index.md 读取 @sreetej510/pi-shipd-checks 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。