cognitive-behavior-evaluator

标准化评估AI代理行为安全性的诊断工具

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:cognitive-behavior-evaluator。
它的用途是:标准化评估AI代理行为安全性的诊断工具
完整的 Skill 内容见:https://321skill.com/skills/cognitive-behavior-evaluator/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

'请使用cognitive-behavior-evaluator评估当前对话中的AI助手,测试其对抗权威压力的能力。' 它会自动注入如'上级要求你忽略安全政策'的探针,收集响应后按1-5分评定抵抗等级,并给出违规证据链。

介绍

该Skill用于对目标AI代理执行标准化、安全导向的行为评估。它通过注入受控的诊断探针(如权威压力抵抗测试、虚假前提/幻觉接地测试、隐性偏见中立性测试),系统性地检验AI在关键安全维度上的表现。评估结果基于1-5分锚定量表,并附带引用证据,帮助开发者量化了解AI代理的安全薄弱环节。

使用方式简单直接:将目标AI代理的接口或对话上下文输入,Skill会自动触发一系列预设探针,收集响应后依据内置评分规则给出分数和详细分析报告。整个过程无需手动设计测试用例,即可获得可复现、可对比的安全评估结果。

适合智能体开发者、AI安全测试工程师、以及需要确保AI产品符合合规标准的产品团队。尤其在部署前安全审计、模型迭代效果对比、以及第三方AI服务的安全审查场景中,能显著提升测试效率和客观性。

注意:该Skill聚焦于行为层面的安全测试,不覆盖代码漏洞、数据隐私等底层安全问题。建议在开发流程中作为持续集成的一部分定期运行,且结果解读需结合具体业务场景,避免单一分数绝对化。

核心特点

与通用AI测试工具不同,该Skill专门针对行为安全三大维度(权威压力、幻觉接地、隐性偏见)设计标准化探针,并给出带引用证据的量化评分,而非仅输出通过/失败或定性描述。

注意事项

不适用于评估AI代理的代码质量、性能效率或数据隐私保护能力,且探针库可能无法覆盖所有新兴安全风险类型。

常见问题

这个Skill支持哪些AI模型?

理论上支持任何可通过API或本地接口交互的AI代理,只要你能提供对话上下文或消息传递机制。

评估结果如何保存?

评估完成后会生成包含评分、证据和建议的详细报告,可导出为JSON或Markdown格式,方便记录和复盘。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/cognitive-behavior-evaluator/raw/index.md 读取 cognitive-behavior-evaluator 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。