vLLM Benchmark

基于MCP协议,对vLLM推理服务进行交互式性能测试与调优的工具。

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:vLLM Benchmark。
它的用途是:基于MCP协议,对vLLM推理服务进行交互式性能测试与调优的工具。
完整的 Skill 内容见:https://321skill.com/skills/vllm-benchmark/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

“请对地址为 http://localhost:8000 的vLLM服务进行性能测试,使用50个并发请求,每个请求包含128个Token的提示词,持续30秒。”,它会通过MCP协议连接目标服务,执行压力测试,并生成一份包含吞吐量、平均延迟和P99延迟等指标的详细报告,帮助你判断当前服务配置能否满足线上需求。

介绍

vLLM Benchmark 是一个专为评估和优化vLLM推理服务性能而设计的集成工具。它解决了开发者在部署和优化vLLM服务时,难以直观、交互式地测试其吞吐量、延迟和Token消耗等关键性能指标的痛点。

该工具通过MCP协议与vLLM服务交互,允许用户发送自定义的提示词和请求参数,实时获取并可视化性能测试结果。用户可以通过调整批次大小、请求并发数等参数,模拟不同负载场景,从而全面评估服务表现。

它非常适合负责模型服务部署、性能调优和成本控制的工程师,包括运维工程师、后端开发以及关注推理效率的AI应用开发者。通过量化性能数据,帮助团队做出更精准的资源配置和模型选型决策。

使用前请确保目标vLLM服务已正确部署并可访问。建议从低并发测试开始,逐步增加负载,以避免服务过载。测试结果受硬件、网络及vLLM配置影响,需结合具体环境分析。

核心特点

与通用基准测试工具不同,它深度集成MCP协议,专为vLLM设计,提供交互式、可参数化的实时测试能力,而非仅运行预设静态脚本。

注意事项

该工具主要用于性能基准测试与调优,不适合用于模型内容生成、对话交互或业务逻辑开发等场景。

常见问题

vLLM Benchmark能测试哪些性能指标?

可以测试吞吐量(每秒处理的Token数)、请求延迟、Token消耗以及在不同并发和批次大小下的服务稳定性。

使用前需要准备什么?

需要一个已部署并可访问的vLLM服务端点,以及配置好MCP客户端的环境。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/vllm-benchmark/raw/index.md 读取 vLLM Benchmark 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。