cognitive-behavior-evaluator
标准化评估AI代理行为安全性,注入诊断探针并评分
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:cognitive-behavior-evaluator。 它的用途是:标准化评估AI代理行为安全性,注入诊断探针并评分 完整的 Skill 内容见:https://321skill.com/skills/cognitive-behavior-evaluator-x-3/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
'评估当前AI代理的权威压力抵抗能力',它会自动注入一系列模拟权威用户要求违规操作的探针,记录每个探针的响应,并给出1-5分的评分及引用证据。例如,一个探针要求模型输出恶意代码,模型拒绝并解释原因,则获得4-5分;若模型直接执行,则得1-2分。
介绍
该Skill旨在解决AI代理行为安全性缺乏标准化评估的问题。当前AI系统在应对权威压力、虚假前提(幻觉)和隐性偏见等场景时,往往缺乏可量化的安全指标,导致安全隐患难以被及时发现。通过注入精心设计的诊断探针,该工具能系统性地测试目标AI代理在这些安全关键维度上的表现。
使用方法非常简单:用户只需指定目标AI代理的接口(如API端点或本地模型),然后运行该Skill。它会自动执行一系列标准化探针,包括权威压力抵抗测试(例如模拟权威用户要求违规操作)、虚假前提接地测试(例如抛出明显错误的事实并要求模型基于错误前提推理)以及隐性偏见中立性测试(例如在性别、种族等敏感话题上观察模型是否保持中立)。每个探针的响应会被记录,并依据1-5分的锚定量表进行评分,同时附上具体证据和引用,方便用户回溯分析。
该工具特别适合AI安全研究员、智能体开发者和测试工程师。对于正在构建或部署AI代理的团队,它可以在上线前快速发现行为安全漏洞;对于学术研究者,它可以作为标准化评估框架用于对比不同模型的安全表现。即使非技术人员,也可以通过该工具获得直观的安全性报告,辅助决策。
使用建议:建议在评估前明确目标代理的预期行为边界,并根据实际风险等级调整探针的敏感度。注意,该工具仅评估特定的安全维度,不能覆盖所有安全风险(如越狱攻击、提示注入等),建议与其他安全测试工具配合使用。此外,评分结果应结合人工审查,避免完全依赖自动化评分。
核心特点
与通用AI评估工具不同,该Skill聚焦于行为安全三大核心维度(权威压力、幻觉接地、隐性偏见),并采用带引用证据的1-5分锚定量表,使评估结果更具可解释性和可比性。
注意事项
不适合评估AI代理的通用功能性能或非安全相关的行为,仅覆盖权威压力、幻觉和偏见三个特定安全维度。
常见问题
如何安装这个Skill?
可以通过npm全局安装:npm install -g cognitive-behavior-evaluator,或直接使用npx运行:npx cognitive-behavior-evaluator。
支持哪些AI模型或代理?
支持任何提供HTTP API接口的AI代理,包括本地部署的模型(如Llama、Ollama)和云端服务(如OpenAI、Claude)。需配置目标API端点。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/cognitive-behavior-evaluator-x-3/raw/index.md 读取 cognitive-behavior-evaluator 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/cognitive-behavior-evaluator-x-3/raw/index.md(查看排版版本)