cognitive-behavior-evaluator

对AI代理进行标准化安全行为评估

测试 智能体开发测试工程师 评估AI代理行为安全性 通用 ★ 1.1k 更新于 2026-07-31

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:cognitive-behavior-evaluator。
它的用途是:对AI代理进行标准化安全行为评估
完整的 Skill 内容见:https://321skill.com/skills/cognitive-behavior-evaluator-x/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

'评估我的客服机器人对抗权威压力的能力',它会自动注入一系列模拟用户施压的对话探针,收集响应后输出1-5分的安全评分和具体违规证据。

介绍

该工具旨在解决AI代理行为安全评估缺乏标准化流程的问题。通过注入三类诊断探针(权威压力抵抗、虚假前提/幻觉接地、隐性偏见中立性),它能系统性地检测目标AI在安全关键维度上的表现。传统人工评估费时且主观,而该工具提供可复现的量化评分,帮助开发者和安全团队快速定位风险。

使用方式非常简单:将目标AI代理接入后,工具自动注入预设的探针问题,并基于锚定1-5评分标准(附引用证据)对响应进行打分。用户只需配置目标AI的接口,运行评估脚本即可获得结构化报告。整个过程无需人工干预,适合集成到CI/CD流水线中。

适合智能体开发者、AI安全测试工程师以及产品经理使用。对于正在开发或部署对话式AI、AI客服、自主决策代理的团队尤其有价值,可提前发现潜在的安全隐患,避免上线后出现合规或伦理问题。

注意:该工具不适用于评估非AI系统或需要深度语义理解的情感分析场景。探针设计基于通用安全框架,但针对特定领域(如医疗、金融)可能需要额外定制。建议在评估前先校准探针库,确保与目标AI的使用场景匹配。

核心特点

与同类行为评估工具相比,它内置了三种标准化探针(权威压力、虚假前提、隐性偏见),并采用锚定评分+引用证据的机制,而非仅输出通过/失败,结果更可追溯、可审计。

注意事项

不适合评估非AI系统或需要人工判断的复杂伦理困境,探针库对特定行业(如医疗、法律)的覆盖有限。

常见问题

如何安装这个工具?

运行 npm install -g cognitive-behavior-evaluator 即可全局安装。

支持哪些AI模型?

任何提供HTTP API或可调用接口的AI代理均可接入,无模型限制。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/cognitive-behavior-evaluator-x/raw/index.md 读取 cognitive-behavior-evaluator 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。