OpenInsight
OpenInsight 是基于现有数据平台产品,提供的面向 Agent 开源解决方案框架。
要解决的问题
-
如何让 Agent 打通数据平台上下游的产品
- 数据开发平台:YuceCube、DophinScheduler、Airflow、Dataworks、Dataphin、...
- 数据分析平台:YuceCube、Superset、QuickBI、 ....
- 持续集成平台:Gitlab、 ...
-
如何为模型提供正确的上下文
- 概念和实体不一致:一个数据模型里有几百个看着都能用的字段,背后可能藏着上百万个。你问「有多少活跃用户」,什么动作算活跃?算不算欺诈账号?回溯窗口取7天还是30天?模型在这堆近义选项里,挑不出对的那个。
- 数据过时:数据源、业务定义、表结构天天在变。模型脑子里的知识慢慢「生锈」,开始返回「细微处出错」的答案。这种错最难发现,看着全对,其实早就不对了。
- 检索失败:信息其实就躺在模型里,标注也完整。可搜索空间太大,它压根没翻到。
-
如何即使发现数据问题
- 非专业用户查询时,如何快速知道查询口径是否正确,这个口径是否经过专业分析师保障,是否是企业内的标准指标
- 数据仓库发生变更时,如何快速发现数据集定义与数据的不一致
系统结构

-
原始数据层
- 将各个数据平台的元数据转换为 CLI 甚至 Agent 直接可以访问的对象
-
事实来源层
- 由分析师团队沉淀标准数据集,包括:业务背景、数据粒度、通用过滤条件、核心管控数据表、高频踩坑点、通用查询文档、跨文档参考
- 由分析师团队沉淀项目内通用的业务术语
-
Skills层
- 提供框架内置的标准技能
- 沉淀项目和企业内的特有技能
-
数据验证层
- 数据质量门禁,通过问题集保障数据集与底层数据的一致性
文档导航
- 快速开始 — 安装 CLI 并初始化数据分析库
实现原理
- Object Model — 本地文件结构与 YAML 契约
- 预策数据魔方 — 登录授权及 API 到标准对象的字段映射
参考
- OpenInsight 的设计借鉴了 Anthropic 的企业内部数据分析经验 [链接] (https://claude.com/blog/how-anthropic-enables-self-service-data-analytics-with-claude)