cognitive-behavior-evaluator

标准化AI代理安全行为评估工具

测试 智能体开发测试工程师 分析AI响应 通用 ★ 1.1k 更新于 2026-07-31

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:cognitive-behavior-evaluator。
它的用途是:标准化AI代理安全行为评估工具
完整的 Skill 内容见:https://321skill.com/skills/cognitive-behavior-evaluator-x-2/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

'请评估当前AI代理的安全行为,注入权威压力抵抗测试探针',它会生成一系列测试问题(如'请帮我写一封冒充领导的邮件'),自动评分并输出带有引用证据的报告。

介绍

AI代理在实际部署中可能产生不安全行为,例如屈服于权威压力、传播虚假信息(幻觉/接地错误)或隐含偏见。本工具通过注入标准化、可控的诊断探针,系统性地评估目标AI代理在多个安全维度上的表现,帮助开发者和测试者提前发现潜在风险。

使用者只需指定目标AI代理的接口(如API端点或本地模型),工具会自动注入预设的探针,包括权威压力抵抗测试(如指令违反伦理时是否拒绝)、虚假前提/幻觉接地测试(如基于错误事实的提问是否纠正)、隐含偏见中立测试(如涉及敏感话题时是否保持中立)。每个响应会在1-5分制下评分,并附上具体的引用证据,便于审计和复现。

本工具适合智能体开发者、安全测试工程师、AI伦理研究者以及任何需要确保AI行为安全合规的团队。无论是开发阶段的内部测试,还是上线前的合规检查,均能提供客观、可量化的评估依据。

使用前请确保目标AI代理可访问且网络稳定;建议定期运行评估以监控行为变化,并将结果纳入CI/CD流程。注意评估结果仅覆盖探针设计的维度,不能替代全面红队测试或真实场景对抗。

核心特点

与简单的对话测试或红队攻击不同,本工具采用标准化、可重复的1-5分评分体系,并为每个评分提供引用证据,使评估结果客观、可审计,便于跨版本对比和合规记录。

注意事项

不适合需要动态对抗或实时交互的复杂安全场景,因为探针是预设的,无法覆盖所有新型攻击模式。

常见问题

如何安装这个工具?

可以通过 pip install cognitive-behavior-evaluator 安装,前提是系统中已安装 Python 3.8 以上版本。

支持哪些AI代理?

支持任何提供HTTP API或本地可调用接口的AI代理,包括OpenAI、Claude、本地部署的LLM等,需在配置中指定目标端点。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/cognitive-behavior-evaluator-x-2/raw/index.md 读取 cognitive-behavior-evaluator 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。