llm-embedding-clustering

融合传统聚类与LLM,实现大规模短文本的智能分层主题发现

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:llm-embedding-clustering。
它的用途是:融合传统聚类与LLM,实现大规模短文本的智能分层主题发现
完整的 Skill 内容见:https://321skill.com/skills/llm-embedding-clustering/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

“帮我对这份用户反馈数据做一下分层主题聚类。” 它会先与你确认数据路径、聚类目的等关键信息,然后自动运行全套流程。完成后,你将获得一个Excel文件,其中清晰展示了文本到各级主题的映射关系,以及一个图文并茂的HTML报告,让你在浏览器中就能交互式地查看每个簇的案例和聚类决策过程。

介绍

这是一个专为短文本(如标题、查询、标签)设计的智能分层聚类工具。它解决了传统聚类方法语义解释性差、无法自动构建层级主题的痛点,特别适合需要从海量零散文本中自动归纳出清晰、可解释主题结构的场景。

使用流程清晰:用户只需提供数据文件路径和文本列名,工具会通过对话明确聚类目的(如分析主题分布、发现风险行为等),随后自动完成从数据预处理、向量化、分层聚类、LLM语义命名到可视化报告生成的全过程。最终输出包含层级映射的Excel、详细过程报告HTML以及交互式2D散点图。

它非常适合产品经理分析用户反馈、运营人员归纳内容主题、客服管理者洞察高频问题,或任何需要对大量短文本进行自动化、可解释主题发现的从业者。

与单纯使用传统聚类(如k-means)或纯LLM归纳的方法不同,本工具创新性地将二者优势结合:用传统算法(k-means/HDBSCAN)高效处理大规模向量计算的“规模问题”,用LLM精准解决语义命名、边界判断和父级合并的“理解问题”,实现了效率与智能的平衡。

核心特点

核心区别在于“分层语义聚类”与“全自动决策”:它不仅分堆,还构建出可解释的层级主题树(Clio风格);并且能根据数据规模和特征,自动选择聚类算法、决定每层簇数、判断何时停止迭代,无需人工调参。

注意事项

不适用于长文档(需先压缩成摘要),且处理百万级数据时可能因LLM调用频繁而较慢。

常见问题

支持处理多少条数据?

支持几百到几百万条,但几万条以内体验最佳,百万级会较慢。

必须用LLM吗?能只用传统聚类吗?

LLM用于语义命名和层级合并,是核心。若只需传统向量聚类,建议直接使用scikit-learn。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/llm-embedding-clustering/raw/index.md 读取 llm-embedding-clustering 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。