llmlb
统一管理与负载均衡多台机器上的LLM推理服务
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:llmlb。 它的用途是:统一管理与负载均衡多台机器上的LLM推理服务 完整的 Skill 内容见:https://321skill.com/skills/llmlb/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
“帮我把本地的Ollama服务和云端的OpenAI API统一管理起来,并设置成根据GPU负载自动分配请求。” 它会引导你部署llmlb,在Web UI中添加你的Ollama本地地址和OpenAI API密钥,并配置负载均衡策略为GPU感知模式,之后你的应用只需调用llmlb的单一端点即可。
介绍
LLM Load Balancer 解决了在多个机器上部署和管理不同LLM推理服务(如Ollama、vLLM)时,API端点分散、负载不均和故障处理复杂的问题。它通过提供一个统一的API网关,将请求智能地分发到后端的各个LLM服务实例,并自动进行健康检查和故障转移。
使用方式非常简单:部署llmlb服务后,将你的各种LLM推理服务(如本地Ollama、云端vLLM服务器)注册到其管理界面,你的应用程序只需调用llmlb提供的单一API端点即可。它还提供了Web仪表板,用于实时监控所有端点的状态、性能指标和请求历史。
这个工具非常适合需要集中管理多个LLM实例的团队或个人,例如企业内部希望统一管控各部门模型资源,或是开发者希望灵活调度本地和云端的不同模型。
需要注意的是,llmlb本身不提供模型推理能力,它只是一个路由和管理层。因此,你需要提前部署好底层的LLM服务。此外,虽然它支持云服务商前缀路由,但直接调用云API可能涉及额外的网络延迟和费用。
核心特点
与单纯的反向代理不同,它内置了基于Token吞吐量(TPS)的智能负载均衡和GPU感知路由,并能自动同步所有注册端点的模型列表。同时,它原生支持将请求通过模型名前缀(如 `openai:`)无缝代理到主流云服务商,实现了本地与云端模型的统一接入和管理。
注意事项
不适合仅需连接单个、固定的LLM服务端点的简单场景,会增加不必要的架构复杂度。
常见问题
llmlb支持哪些后端的LLM服务?
支持所有兼容OpenAI API的推理服务,包括Ollama、vLLM、LM Studio、llama.cpp服务器等,也支持通过前缀直接路由到OpenAI、Google、Anthropic的官方API。
如何监控各个LLM端点的状态?
llmlb提供了Web管理界面,可以实时查看所有注册端点的在线状态、性能指标(如TPS)、请求历史记录和GPU使用情况。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/llmlb/raw/index.md 读取 llmlb 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/llmlb/raw/index.md(查看排版版本)