Discovery
自动发现表格数据中新颖、统计验证的模式
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:Discovery。 它的用途是:自动发现表格数据中新颖、统计验证的模式 详细介绍见:https://321skill.com/skills/discovery/ 请根据该页面的说明完成安装。
使用示例
‘请使用Discovery Skill分析这份客户行为数据集,找出影响高价值客户留存的关键特征组合和条件。’ 它会自动搜索特征间的交互作用,验证其统计显著性,并返回如‘在年龄25-34岁且使用过功能A的用户子群中,留存率显著提升30%’这样的结构化模式,同时附上效应大小、p值、相关文献引用和新颖性评分。
介绍
Discovery Skill 旨在解决数据分析中“未知的未知”问题。面对海量表格数据,分析师往往只能基于经验和假设进行探索,容易遗漏那些意想不到但可能至关重要的特征交互、子群效应和条件关系。
该Skill通过系统性的自动化搜索来工作。它会穷举数据特征间的组合,寻找具有统计显著性的模式,并使用留出数据和经过FDR校正的p值对每个发现进行严格验证。更重要的是,它会将每个发现与学术文献进行比对,评估其新颖性。
它非常适合数据分析师、学术研究者以及任何需要从结构化数据中挖掘深层洞察的专业人士,例如希望发现用户细分、产品关联或风险因子的产品经理和量化研究员。
使用建议:准备好结构清晰、质量较高的表格数据(如CSV文件)。由于涉及大量计算和文献检索,处理大型数据集时可能需要一定时间。建议先在小样本上测试流程,并仔细阅读输出的“新颖性分数”和引用文献,以判断发现的实践与理论价值。
核心特点
与普通探索性数据分析工具相比,其核心区别在于:1)不仅寻找模式,还通过FDR校正和留出数据验证确保统计稳健性;2)自动与学术文献交叉比对,为每个发现标注新颖性分数和已有研究引用,将数据洞察直接置于学术背景之下。
注意事项
不适合处理非结构化数据(如文本、图像)或实时流数据。
常见问题
Discovery 能处理多大的数据量?
适合处理结构化的表格数据,具体性能取决于数据维度和样本量,建议先在小样本上测试。
输出的“新颖性分数”是如何计算的?
通过将发现的统计模式与现有学术文献数据库进行比对,评估其是否已被前人研究过,从而得出新颖性评分。