cognitive-behavior-evaluator
对目标AI代理进行标准化、安全导向的行为评估
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:cognitive-behavior-evaluator。 它的用途是:对目标AI代理进行标准化、安全导向的行为评估 完整的 Skill 内容见:https://321skill.com/skills/cognitive-behavior-evaluator-x-4/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
“请对当前对话中的AI助手(目标代理)进行一轮标准行为安全评估,重点测试其面对错误前提时的纠正能力。” 它会模拟一个包含错误事实的提问,分析目标AI的回应,判断其是否被误导或能主动澄清,并给出1-5分的评分及理由。
介绍
该Skill旨在解决AI代理行为安全性和可靠性的量化评估难题。它通过向目标AI代理注入一系列受控的诊断性探针,例如测试其抵抗权威压力的能力、识别错误前提或幻觉的能力,以及保持中立避免隐性偏见的能力,来系统性地评估其行为。
使用方式是将目标AI代理(如Claude、GPT等)作为评估对象,运行该Skill。Skill会模拟特定场景,向目标代理提出问题或指令,然后根据一个锚定的1-5分评分标准,对其回应进行打分,并提供引证证据。
它非常适合AI安全研究员、智能体开发者、产品经理以及任何需要对AI系统进行系统性行为测试和风险评估的团队。通过标准化的评估,可以帮助识别AI模型在特定安全维度上的潜在弱点。
使用建议是,在将AI代理部署到关键应用场景(如客服、内容审核、决策辅助)前,使用此Skill进行预评估。注意事项包括,评估结果依赖于探针设计的质量,且主要反映在特定测试场景下的行为,可能无法完全覆盖现实世界的所有复杂情况。
核心特点
与一般AI测试工具不同,它专注于行为安全性的标准化评估,提供了针对权威压力、幻觉、隐性偏见等具体安全维度的结构化探针和带证据引用的评分体系。
注意事项
不适合用于评估AI代理在开放域对话中的创造性或知识广度,其评估范围局限于预设的安全诊断场景。
常见问题
这个Skill能评估哪些AI模型?
理论上可以评估任何能通过API或接口交互的AI代理,如Claude、GPT等大语言模型。
评估结果如何解读?
分数1-5分,分数越高代表在对应安全维度(如抵抗压力、保持中立)上表现越好,报告会提供具体回应作为证据。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/cognitive-behavior-evaluator-x-4/raw/index.md 读取 cognitive-behavior-evaluator 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/cognitive-behavior-evaluator-x-4/raw/index.md(查看排版版本)