评估AI响应 的 AI Skill
共 15 个,按热度排序。把评估AI响应这件事交给 AI 来做。
ia-qa.com/mcp llm and RAG testing - Dev/QA toolbox
IDE内测试LLM和RAG的MCP工具箱
Judge Human
与人类共同投票,提交对伦理、文化、内容故事的AI评估信号。
HaluCatch / 捕幻
评估AI技能执行结果的可靠性与可信度。
Modelshow V1.2.0
并行匿名对比多个AI模型的输出,进行双盲评测。
cognitive-behavior-evaluator
对目标AI智能体进行标准化、安全导向的行为评估
cognitive-behavior-evaluator
对目标AI智能体进行标准化、安全导向的行为评估
cognitive-behavior-evaluator
对目标AI智能体进行标准化、安全导向的行为评估
cognitive-behavior-evaluator
对目标AI代理进行标准化、安全导向的行为评估
Modelshow V1.2.0
双盲并行对比多个AI模型的回答质量并进行匿名排名。
utility
智能体动作评分器,优化决策质量
Modelshow V1.2.0
双盲对比AI模型回答,匿名排名
Skill Forge
一个用于锻造、审计和重铸WorkBuddy技能的元技能。
rigorous-reasoning
应用反谄媚清单,消除AI同意偏见
rigorous-reasoning
应用反谄媚清单,抑制AI的顺从偏差
OptimizeSpec
通过规范驱动开发,帮助智能体构建评估与优化系统。