@sreetej510/pi-shipd-checks
对AI基准任务进行严格的多智能体公平性审查与测试分析
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:@sreetej510/pi-shipd-checks。 它的用途是:对AI基准任务进行严格的多智能体公平性审查与测试分析 完整的 Skill 内容见:https://321skill.com/skills/sreetej510-pi-shipd-checks/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
“请对`my_benchmark_task`这个文件夹运行`/checks`命令。” 它会自动解析该文件夹下的任务定义文件,启动多智能体审查流程,并生成一份详细的公平性与测试覆盖分析报告,帮助你发现任务设计中可能存在的偏见或测试盲区。
介绍
该Skill旨在解决AI基准任务开发中可能存在的评估偏差与测试覆盖不全问题。它通过一个名为/checks的命令,对任务的核心文件(如agent_prompt.md、test.patch和solution.patch)进行自动化、多角度的审查。
使用时,开发者只需在Pi环境中调用/checks命令并指定目标基准任务,该Skill便会启动一个多智能体审查流程,分析任务提示的公平性、测试补丁的完整性以及解决方案补丁的合理性。
它非常适合AI基准测试的创建者、评审员以及致力于提升AI评估体系质量和公平性的研究人员。他们可以利用此工具在任务发布前进行自查,或在评审他人任务时提供客观依据。
建议将此工具作为任务开发流程中的一个强制性检查环节。需要注意的是,其审查结果基于预设的规则和多智能体模拟,虽然能发现许多潜在问题,但最终仍需结合人类专家的判断来做出决策。
核心特点
该Skill的核心在于其“多智能体公平性审查”机制,它并非单一规则检查,而是模拟多个不同角色的AI代理对任务进行交叉审视,能更全面地发现潜在偏见。同时,它独有的“行为测试差距分析”功能,能识别出测试用例未覆盖到的关键行为场景。
注意事项
该Skill主要针对结构化的基准任务文件进行审查,对于高度抽象、非标准格式或实时交互式的任务评估场景可能不适用。
常见问题
这个检查工具能检查哪些类型的文件?
主要检查基准任务的agent_prompt.md(代理提示)、test.patch(测试补丁)和solution.patch(解决方案补丁)三个核心文件。
/checks命令的运行结果包含什么?
结果会包含公平性审查报告、测试覆盖度分析以及潜在的行为测试差距提示,以结构化摘要形式呈现。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/sreetej510-pi-shipd-checks/raw/index.md 读取 @sreetej510/pi-shipd-checks 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/sreetej510-pi-shipd-checks/raw/index.md(查看排版版本)