data-engineering-learning-ceva

基于数据湖仓的动物健康数据分析与智能查询Agent

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:data-engineering-learning-ceva。
它的用途是:基于数据湖仓的动物健康数据分析与智能查询Agent
完整的 Skill 内容见:https://321skill.com/skills/data-engineering-learning-ceva/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

“帮我对比一下去年家禽和反刍动物的季度产量趋势”,它会首先理解你的业务意图,生成相应的SQL查询语句从银层数据中提取数据,然后在Streamlit界面中自动绘制出折线图或柱状图进行直观对比。

介绍

该项目旨在为动物健康领域的数据分析工作提供一个端到端的解决方案。它通过构建一个数据湖仓(Lakehouse)架构,整合来自伴侣动物、家禽和反刍动物等多个业务单元的生产与目录数据,并建立了从原始数据到银层(Silver Layer)的ETL流程,支持数据仓库和数据星型架构两种模型,最终以Parquet格式存储,为上层分析提供高质量数据。

用户可以通过一个专门的Data Analyst Agent,使用自然语言直接查询数据。该Agent基于LangGraph构建,集成了HuggingFaceHub,能够理解用户意图,生成并优化针对DuckDB的SQL查询,并自动选择合适的可视化方式,最终在Streamlit应用中呈现交互式图表或数据表格,极大降低了非技术用户进行数据探索的门槛。

该Skill非常适合需要处理特定领域(如动物健康、农业)结构化数据的数据分析师、数据工程师以及相关业务人员。他们可以利用这个项目快速搭建一个具备语义理解能力的数据分析原型,将业务问题转化为数据洞察。

使用建议:该项目目前处于概念验证(POC)阶段,部分功能(如数据仓库、RAG)仍在开发中。建议用户将其作为学习数据工程、Lakehouse架构以及AI Agent开发的参考项目,或在其基础上进行定制化开发,以适应自身的数据源和业务逻辑。注意,项目环境使用uv进行Python依赖管理。

核心特点

核心区别在于其专注于动物健康领域的垂直数据栈,并集成了一个能够理解领域术语、将自然语言转化为SQL查询的专用AI Agent,而非通用的数据分析工具。同时,它在数据层并行实现了数据仓库和星型架构两种经典模型,为学习不同数据建模方法提供了实践案例。

注意事项

该项目目前是概念验证阶段,RAG等高级功能尚未实现,且Agent能力高度依赖于特定领域的数据结构和语义层定义,不适合直接用于通用或生产环境的数据分析。

常见问题

这个项目能分析哪些数据?

目前主要分析伴侣动物目录、家禽生产和反刍动物生产三类业务数据,具体结构见项目内的数据描述文件。

如何用自然语言查询数据?

在运行Streamlit应用后,在顶部的文本输入框直接输入业务问题,Agent会自动生成SQL并展示查询结果和可视化图表。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/data-engineering-learning-ceva/raw/index.md 读取 data-engineering-learning-ceva 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。