AI-Dataset-Generator

为AI代码模型生成、清洗和导出训练数据集的本地工具

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:AI-Dataset-Generator。
它的用途是:为AI代码模型生成、清洗和导出训练数据集的本地工具
完整的 Skill 内容见:https://321skill.com/skills/ai-dataset-generator/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

“dataset generate ‘Python函数单元测试示例’ --count 200”,它会基于主题生成200条规范化的训练数据记录。然后说:“dataset export --format huggingface”,它会将处理好的数据集导出为Hugging Face格式,供模型微调使用。

介绍

AI-Dataset-Generator是一个专为Codex、Antigravity和Claude Code等AI代码模型设计的本地数据集处理流水线。它解决了开发者需要为特定任务(如代码补全、指令微调)准备高质量、结构化训练数据,但缺乏自动化工具和标准化流程的痛点。

使用方式主要通过命令行接口,例如dataset generate用于根据主题生成新数据集,dataset collect用于从URL或本地路径收集素材,dataset verifydataset audit用于数据验证与去重,dataset export则支持将处理后的数据导出为OpenAI、Hugging Face、CSV、JSONL等多种格式。其核心在于利用IDE原生工具进行浏览、搜索和推理,并配合本地Python脚本实现确定性的数据处理。

该工具非常适合AI工程师、研究者和需要为代码大模型(如Claude Code)定制训练数据的开发者。它尤其适用于需要从零构建数据集、清洗现有杂乱数据,或为SFT(监督微调)、DPO(直接偏好优化)等工作流准备标准化输入的场景。

与同类工具相比,它不依赖外部LLM API进行数据处理,所有操作均在本地执行,确保了流程的确定性、可复现性和数据隐私安全。其架构明确区分了固定的内部规范模式(canonical schema)与灵活可配的输出模式(export schema),提供了从数据采集到导出的完整、可控的端到端解决方案。

核心特点

核心区别在于:1) 完全本地化、确定性的处理流水线,不调用外部LLM API,确保数据隐私和流程可复现;2) 采用“固定内部规范模式+灵活输出模式”的双层架构,既保证了数据处理流程的标准化,又支持为不同下游模型(如Codex, Claude Code)定制输出格式。

注意事项

不适合需要依赖外部大模型API进行复杂内容生成或深度语义理解的数据创建任务。

常见问题

这个工具能直接从网上爬取数据吗?

主要依赖IDE原生工具或本地脚本进行素材收集,不包含复杂的网络爬虫功能。

支持哪些AI模型的训练数据格式?

支持为Codex、Antigravity、Claude Code生成数据,并可导出为OpenAI、Hugging Face、CSV、JSONL等通用格式。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/ai-dataset-generator/raw/index.md 读取 AI-Dataset-Generator 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。