cognitive-behavior-evaluator
对目标AI智能体进行标准化、安全导向的行为评估
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:cognitive-behavior-evaluator。 它的用途是:对目标AI智能体进行标准化、安全导向的行为评估 完整的 Skill 内容见:https://321skill.com/skills/cognitive-behavior-evaluator-x-7/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
“请使用 cognitive-behavior-evaluator 评估我提供的这个客服AI智能体,重点测试它在面对用户提出基于错误信息的投诉时,能否坚持事实并礼貌纠正。” 它会模拟带有错误前提的客户投诉场景,向目标智能体提问,然后根据其回答在“错误前提接地”维度上给出1-5的评分,并引用回答中的具体语句作为评分证据。
介绍
该Skill旨在解决AI智能体行为安全性与可靠性的评估难题。它通过向目标AI智能体注入一系列受控的诊断探针(如权威压力抵抗、错误前提/幻觉接地、隐性偏见中立性等),来测试其在特定压力或误导性情境下的反应。
使用时,您需要指定一个目标AI智能体(例如您正在开发的另一个智能体),该Skill会模拟特定场景向其提问,并根据其回答进行深度分析。它会依据一个锚定的1-5分评分标准对回答进行打分,并提供详细的证据引用,说明扣分或加分的原因。
该Skill非常适合智能体开发者、AI安全研究员、产品经理以及任何需要对AI助手、客服机器人或决策支持系统的行为安全性和鲁棒性进行系统性评估的团队。通过标准化的评估,可以帮助团队在产品上线前发现潜在的风险行为模式。
建议在智能体开发的关键节点(如版本发布前)或引入新的训练数据/提示词后使用此Skill进行评估。请注意,评估结果依赖于诊断探针的设计质量,且主要针对预设的“安全”维度,可能无法覆盖所有现实世界的复杂交互场景。
核心特点
与通用聊天测试不同,它提供了一套标准化的、聚焦于安全关键行为(如抵抗不当权威、纠正错误前提)的诊断探针和评分体系,使评估结果可量化、可比较。
注意事项
不适合用于评估AI智能体的创意生成、代码编写效率或非安全相关的功能性任务表现。
常见问题
这个评估工具能测试哪些具体的安全风险?
主要测试三大类:抵抗权威压力下的不当指令、对错误前提或幻觉的识别与纠正能力,以及回应中隐含的社会偏见中立性。
评估结果(1-5分)具体代表什么?
1分代表响应存在严重安全缺陷或完全被误导,5分代表响应完全符合安全、中立、事实准确的高标准,每个分数都有对应的行为锚定描述和证据要求。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/cognitive-behavior-evaluator-x-7/raw/index.md 读取 cognitive-behavior-evaluator 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/cognitive-behavior-evaluator-x-7/raw/index.md(查看排版版本)