pi-blindtest

用于Pi平台的盲测模型扩展,隐藏模型信息并聚合评分。

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:pi-blindtest。
它的用途是:用于Pi平台的盲测模型扩展,隐藏模型信息并聚合评分。
完整的 Skill 内容见:https://321skill.com/skills/pi-blindtest/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

“启用盲测模式,开始新一轮对话。” 它会隐藏当前服务模型的任何标识信息。在完成一段关于代码调试的问答后,系统会弹出仅针对回答质量的评分界面。您根据回答的准确性和帮助程度打分,这个分数将匿名汇入本次测试的总体数据报告中。

介绍

pi-blindtest 是一款专为Pi平台设计的扩展工具,旨在解决模型测试中因用户先入为主的品牌或版本偏好而影响评价客观性的问题。它通过在用户界面中隐藏正在交互的模型身份信息,确保用户仅根据回答内容本身的质量进行反馈,从而获得更纯粹、无偏见的评估数据。

使用方式非常直接,开发者通过npm安装此扩展包,并将其集成到自己的Pi平台项目中。当用户与集成了该扩展的Pi应用交互时,他们将看不到当前是哪个模型在响应,所有回答都以匿名形式呈现。用户完成对话后,可以基于内容质量进行评分,这些评分会被工具自动收集并跨会话聚合,形成一份匿名的模型性能评估报告。

该工具非常适合需要进行A/B测试或多模型对比研究的AI产品团队、研究人员以及希望以更科学方式评估和选择后端模型的开发者。它帮助这些用户剥离品牌光环,聚焦于模型的实际能力表现。

在使用时,建议确保测试任务设计得足够多样和全面,以覆盖模型的不同能力维度。同时,需向参与测试的用户明确说明这是盲测,并引导他们关注回答的准确性、有用性和流畅性等核心指标,而非猜测模型身份。

核心特点

与仅提供模型切换或简单评分的工具不同,pi-blindtest 强制实施了“盲测”环境,彻底隐藏模型信息,从源头杜绝偏见;同时,它具备跨会话的评分自动聚合功能,为长期、大规模的模型对比实验提供了数据支撑。

注意事项

不适合需要明确知道对话对象是特定模型(例如,依赖某模型特有功能)的日常生产或调试场景。

常见问题

pi-blindtest 能用于哪些AI模型?

它设计用于Pi平台,理论上可适配接入该平台的各种模型,具体取决于项目集成方式。

评分数据存储在哪里?

评分数据由该扩展工具在本地或指定后端进行聚合,具体存储位置取决于项目配置。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/pi-blindtest/raw/index.md 读取 pi-blindtest 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。