scribegoat2

评估前沿大模型在多轮对话压力下的安全持久性

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:scribegoat2。
它的用途是:评估前沿大模型在多轮对话压力下的安全持久性
完整的 Skill 内容见:https://321skill.com/skills/scribegoat2/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

“运行一个针对模型‘gpt-4o’的快速安全验证。”,它会自动执行Tier 1评估,在约5分钟内测试10个平衡场景,并输出每个场景的通过/失败结果及详细对话轨迹,帮助你快速了解模型在基础安全场景下的稳健性。

介绍

ScribeGOAT2 是一个专门用于评估前沿大语言模型安全持久性的程序。它解决的核心问题是:当模型在持续、自然的用户压力下,是否能坚守关键的安全建议(如医疗急救建议),以及何时会“失守”。

该工具通过结合医生审定的场景设计、结构化的对抗性对话、正式的安全契约以及跨厂商的LLM评判,构建了一个可复现的评估流程。用户只需提供模型ID和API密钥,即可运行不同层级的评估,从快速验证到包含污染检测的完整评估。

它主要面向AI安全研究人员、模型评测团队以及对模型安全边界有深入理解需求的开发者。通过该工具,他们可以量化模型在对抗性对话中的稳健性,发现潜在的安全风险。

使用前需确保Python 3.11+环境,并配置好对应厂商的API密钥。其核心的Rust组件(轨迹安全运行时)是可选的,未安装时相关测试会被跳过。建议从Tier 1的快速验证开始,以熟悉流程并验证环境。

核心特点

与常规的单一回合安全评测不同,ScribeGOAT2专注于“多轮对话压力测试”,模拟真实世界中用户持续质疑或施压的场景,并采用医生审定的医疗等高风险场景和形式化的安全契约来精确衡量模型立场的偏移。

注意事项

不适合用于评估模型在非对抗性、常规对话下的通用能力或创意生成能力。

常见问题

ScribeGOAT2主要测试什么?

主要测试大模型在多轮、带有压力的对话中,是否能够坚持关键的安全建议(例如医疗急救指导),以及何时会妥协或改变立场。

需要哪些API密钥?

需要OpenAI API Key和/或Anthropic API Key,具体取决于你要测试的模型。工具会根据模型ID自动检测提供商。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/scribegoat2/raw/index.md 读取 scribegoat2 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。