AI-Dataset-Generator
为AI代码模型生成、清洗和导出训练数据集的本地工具
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:AI-Dataset-Generator。 它的用途是:为AI代码模型生成、清洗和导出训练数据集的本地工具 完整的 Skill 内容见:https://321skill.com/skills/ai-dataset-generator/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
“dataset generate ‘Python函数单元测试示例’ --count 200”,它会基于主题生成200条规范化的训练数据记录。然后说:“dataset export --format huggingface”,它会将处理好的数据集导出为Hugging Face格式,供模型微调使用。
介绍
AI-Dataset-Generator是一个专为Codex、Antigravity和Claude Code等AI代码模型设计的本地数据集处理流水线。它解决了开发者需要为特定任务(如代码补全、指令微调)准备高质量、结构化训练数据,但缺乏自动化工具和标准化流程的痛点。
使用方式主要通过命令行接口,例如dataset generate用于根据主题生成新数据集,dataset collect用于从URL或本地路径收集素材,dataset verify和dataset audit用于数据验证与去重,dataset export则支持将处理后的数据导出为OpenAI、Hugging Face、CSV、JSONL等多种格式。其核心在于利用IDE原生工具进行浏览、搜索和推理,并配合本地Python脚本实现确定性的数据处理。
该工具非常适合AI工程师、研究者和需要为代码大模型(如Claude Code)定制训练数据的开发者。它尤其适用于需要从零构建数据集、清洗现有杂乱数据,或为SFT(监督微调)、DPO(直接偏好优化)等工作流准备标准化输入的场景。
与同类工具相比,它不依赖外部LLM API进行数据处理,所有操作均在本地执行,确保了流程的确定性、可复现性和数据隐私安全。其架构明确区分了固定的内部规范模式(canonical schema)与灵活可配的输出模式(export schema),提供了从数据采集到导出的完整、可控的端到端解决方案。
核心特点
核心区别在于:1) 完全本地化、确定性的处理流水线,不调用外部LLM API,确保数据隐私和流程可复现;2) 采用“固定内部规范模式+灵活输出模式”的双层架构,既保证了数据处理流程的标准化,又支持为不同下游模型(如Codex, Claude Code)定制输出格式。
注意事项
不适合需要依赖外部大模型API进行复杂内容生成或深度语义理解的数据创建任务。
常见问题
这个工具能直接从网上爬取数据吗?
主要依赖IDE原生工具或本地脚本进行素材收集,不包含复杂的网络爬虫功能。
支持哪些AI模型的训练数据格式?
支持为Codex、Antigravity、Claude Code生成数据,并可导出为OpenAI、Hugging Face、CSV、JSONL等通用格式。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/ai-dataset-generator/raw/index.md 读取 AI-Dataset-Generator 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/ai-dataset-generator/raw/index.md(查看排版版本)