@aittalam/pi-llamafile
Pi扩展管理本地llamafile模型进程
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:@aittalam/pi-llamafile。 它的用途是:Pi扩展管理本地llamafile模型进程 完整的 Skill 内容见:https://321skill.com/skills/aittalam-pi-llamafile/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
'帮我启动Qwen3 9B模型',它会自动运行配置好的llamafile二进制文件,等待服务就绪后返回可用状态。当你切换模型时,它会先停止当前进程,再启动新的模型,并在终端输出“Stopping llamafile ...”和“Stopped llamafile ...”的进度提示。
介绍
这个Skill解决了在Pi框架中管理本地llamafile模型进程的痛点。实际开发中,开发者经常需要同时运行多个本地大模型服务,手动启动、停止、切换模型不仅繁琐,还容易忘记清理进程导致端口冲突。它通过进程监督机制,自动管理模型的生命周期,确保每个模型只运行一个实例,并在退出时优雅停止。
使用方式很简单,你只需要在Pi的配置目录下定义模型列表,指定可执行文件路径、端口号等参数。之后就可以通过自然语言指令来“启动模型”“切换模型”或“停止模型”。Pi扩展会在你选择模型时自动启动二进制,等待服务就绪(通过/v1/models端点检测),并在你切换或退出时自动停止,所有操作都有进度提示。
它非常适合需要频繁切换本地大模型的开发者或团队,尤其是那些已经使用Pi作为智能体框架的用户。无论是部署Qwen、LLaMA还是其他llamafile格式的模型,都能通过统一配置管理。对于需要长期运行本地模型服务、同时又要保证资源不被浪费的运维场景也很有帮助。
建议在配置模型时统一使用port字段作为唯一端口来源,并通过{{port}}占位符在args中引用,避免硬编码。需要注意的是,它只管理由自己启动的进程,不会杀死外部启动的服务,因此端口冲突时会友好提示手动释放。另外,它依赖Pi框架版本,建议使用最新版Pi。
常见问题
如何配置模型?
在~/.pi/agent/models.json的llamafiles provider下添加模型,指定command、args、port等字段,参考README中的示例。
如何停止正在运行的模型?
直接切换模型或退出Pi,扩展会自动停止进程并打印“Stopping llamafile ...”信息。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/aittalam-pi-llamafile/raw/index.md 读取 @aittalam/pi-llamafile 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/aittalam-pi-llamafile/raw/index.md(查看排版版本)