rag-dataset-builder

构建高质量RAG评估数据集,优化RAG系统测试

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:rag-dataset-builder。
它的用途是:构建高质量RAG评估数据集,优化RAG系统测试
完整的 Skill 内容见:https://321skill.com/skills/rag-dataset-builder/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

“我需要评估我们新上线的文档问答RAG系统,请帮我运行这个仓库的评估脚本,使用其中的‘中等’难度数据集进行测试,并生成一份包含准确率和召回率的分析报告。” 它会引导你配置环境、运行测试,并汇总关键指标。或者,你可以说:“我有一份产品白皮书PDF,想用它生成一个测试我们客服机器人的问答集。” 它会指导你使用数据集构建流水线,从解析PDF到生成带证据链的复杂问题。

介绍

该仓库解决了评估检索增强生成(RAG)系统时缺乏高质量、可定制基准数据集的痛点。它提供了一个现成的、基于《龙与地下城》5e规则书构建的评估数据集,并配套一个完整的流水线工具,允许用户从自己的PDF文档生成专属的QA数据集。

用户可以直接使用其提供的56个分难度(简单/中等)的问答对来测试自己的RAG系统,评估其检索和推理能力。更重要的是,用户可以利用其数据集构建工具,输入自己的PDF文档(如产品手册、技术文档),自动生成结构化的问答数据集,用于内部模型的迭代和评估。

该工具非常适合需要开发和优化RAG系统的AI工程师、研究人员,以及任何希望量化其知识库问答系统效果的技术团队。对于从事智能体开发、文档问答系统构建的项目尤为实用。

使用建议:对于初步评估,建议从“简单”数据集开始建立基线。若需生成自己的“中等”难度数据集,请注意其提示中提到的成本警告(约100美元),建议在小规模文档上先行测试流程,并考虑优化提示词以控制Token消耗。

核心特点

不仅提供现成的、经过人工校验的高质量RAG评估数据集,更核心的是提供了一套完整的、可复现的从PDF到带证据支持问答对的自动化构建流水线,允许用户基于私有领域文档快速生成定制化评估集。

注意事项

生成“中等”难度数据集依赖Claude Skills等高级功能,成本较高,不适合预算有限或仅需简单事实性问答评估的场景。

常见问题

这个数据集可以用来做什么?

主要用于评估RAG系统的检索准确性和答案生成质量,为模型优化提供基准。

如何用我自己的文档生成数据集?

使用仓库中的数据集构建工具,按照README指引处理PDF,运行相应脚本即可生成问答对。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/rag-dataset-builder/raw/index.md 读取 rag-dataset-builder 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。