training-hub-skills

基于Red Hat training-hub的LLM微调技能,支持从单GPU到多节点集群的完整工作流。

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:training-hub-skills。
它的用途是:基于Red Hat training-hub的LLM微调技能,支持从单GPU到多节点集群的完整工作流。
完整的 Skill 内容见:https://321skill.com/skills/training-hub-skills/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

'我想用公司的8张H100显卡微调一个70B参数的模型,请帮我制定训练方案。' 它会调用此Skill,为你生成一个针对多H100硬件优化的分布式训练配置文件,并估算所需内存和提供数据并行策略建议。或者,当你问'帮我检查一下这个JSONL数据集是否适合训练'时,它会运行内置的验证脚本并给出修改意见。

介绍

这个Skill解决了开发者和研究者在大语言模型(LLM)微调过程中面临的配置复杂、硬件适配难和流程不统一的问题。它深度集成了Red Hat training-hub项目,将数据集准备、模型训练、评估和推理部署等环节封装成一套标准化的工具和脚本,让用户无需深入底层细节即可高效启动微调任务。

使用方式非常便捷,无论是作为Claude Code插件安装还是手动克隆到本地,安装后Claude便能理解与LLM微调相关的各类问题。用户只需用自然语言描述需求,例如指定模型、硬件或任务目标,Claude就能调用该Skill提供对应的配置文件、内存估算、数据转换脚本或部署方案。

它非常适合需要定制化LLM的AI工程师、全栈开发者以及进行算法研究的学术人员。无论是想在个人RTX 4090上微调一个7B模型,还是在企业级的多H100集群上训练百亿参数大模型,都能从中找到经过优化的配置方案和操作指引。

建议用户在使用前,先通过内置的recommend_config.pyestimate_memory.py脚本进行硬件匹配和资源评估,避免因配置不当导致训练失败。同时,Skill提供了详尽的文档矩阵(如HARDWARE.md、SCALE.md),针对不同场景深入查阅能获得更佳效果。

核心特点

与同类通用微调指导技能相比,它深度绑定并优化了Red Hat training-hub这一企业级工具链,提供了从RTX 4090到多节点H200集群的、经过实测的硬件配置方案,并内置了数据集验证、内存估算等实用脚本,形成了开箱即用的完整工作流。

注意事项

该Skill主要围绕training-hub生态,不适用于其他微调框架(如Hugging Face Transformers Trainer)的深度定制或非标准硬件环境的配置。

常见问题

如何在RTX 4090上微调Llama 3.1 8B模型?

安装此Skill后,直接询问Claude,它会基于training-hub提供针对RTX 4090优化的LoRA或QLoRA配置方案、内存估算及具体操作步骤。

如何将我的CSV数据集转换成training-hub可用的格式?

Skill内置了数据转换脚本(如convert_to_jsonl.py),你可以通过Claude调用该脚本,或直接询问转换方法,它会指导你生成符合要求的JSONL格式数据。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/training-hub-skills/raw/index.md 读取 training-hub-skills 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。