评估模型效果 的 AI Skill
共 35 个,按热度排序。把评估模型效果这件事交给 AI 来做。
Agents
AI智能体的设计、调试、评估与加固框架
Skill Forge 技能熔炉
一站式技能锻造、评估与改进平台,支持全流程优化。
HaluCatch / 捕幻
评估AI技能执行结果的可靠性与可信度
HaluCatch / 捕幻
评估AI技能执行结果的可靠性与可信度
Modelshow V1.2.0
双盲并行对比不同AI模型的回答质量
Modelshow V1.2.0
匿名双盲对比多个AI模型回答,客观评估优劣。
escalation-governance
评估模型是否需要进行升级或干预
evaluation-framework
提供加权评分、评估量规和决策阈值模式
escalation-governance
评估模型是否需要升级或更换
escalation-governance
评估模型是否需要升级或上报,辅助决策
escalation-governance
评估模型是否需要升级,辅助决策
evaluation-framework
加权评分、评分标准和决策阈值的评估框架
escalation-governance
评估模型是否需要升级的决策辅助工具
escalation-governance
评估模型是否需要升级的智能体技能
evaluation-framework
加权评分与决策阈值评估框架
escalation-governance
评估模型是否该升级的决策工具
skills-eval
审计Claude技能质量的自动化工具
skills-eval
审计评估Claude技能质量
skills-eval
审计Claude技能质量的自动化工具
AIFight Bridge
在本地部署AIFight平台,让智能体参与隐藏信息策略游戏的Glicko-2排名对战。
AIFight Bridge
在本地部署AIFight平台,让智能体参与隐藏信息策略游戏对战
Steamedclaw
与AI智能体进行策略游戏对战,提升策略思维与编程能力。
Steamedclaw
与其他AI智能体进行策略游戏对战,获取评级并冲击排行榜。
Steamedclaw
一个让AI智能体进行策略游戏对战并参与排名的平台
Steamedclaw
一个让你与其他AI智能体在线对战策略游戏的平台。
Learning Evolution
为技能创建基于证据的学习回顾,分析使用模式并规划演进。
alibabacloud-agentloop-evaluation
通过阿里云CLI插件编排AgentLoop评估工作流,实现安全预览、批量测试与结果分析。
Opik MCP
开源LLM评估框架,支持追踪、评估与监控,助力开发者构建高效AI系统。
root
借助MCP协议集成Root Signals,实现多类型评估的AI开发工具
atla
为LLM提供与Atla SDK交互及评估指标管理的MCP工具
agentic-science-worker
用于计算材料科学领域的自主智能体核心能力与基准测试。
braintrust-claude-plugin
为Claude Code提供LLM评估、日志记录与会话追踪的Braintrust插件市场
harbor
一个用于评估和优化AI智能体与语言模型的框架。
mlflow
开源AI工程平台,用于追踪、评估、监控和优化AI应用。
phoenix
用于LLM应用的可观测性与评估平台