陶玉印的博客

企业数据治理、数据仓库、数据质量、AI应用实践与研究

0%

从开发答案到生成答案:AI 为什么会重构整个企业数据体系?

如果要用一句话概括过去二十年企业数据体系的发展,我更愿意这样描述:

企业数据体系的发展史,本质上是一部不断降低“获取答案成本”的历史。

从数据库到数据仓库,从 BI 到 ChatBI,再到今天的 Data Agent,技术形态不断变化,但企业真正追求的目标始终没有改变——如何更快、更准确、更低成本地获得经营问题的答案。

过去,我们一直在优化数据。

今天,我们开始重新思考答案。

这看似只是表达方式的变化,却意味着企业数据体系正在发生一次比数据库、数据仓库甚至大数据平台更加深刻的变革。

一个长期被忽略的问题

很多企业在建设数据平台时,都会把注意力放在技术架构上。

选择什么数据库?

采用什么计算引擎?

使用 Hive 还是 Spark?

建设数据湖还是 Lakehouse?

这些问题当然重要。

但如果站在企业经营的角度来看,它们其实都属于手段,而不是目的。

企业建设数据平台,从来不是为了拥有更多的数据。

企业真正需要的是:

能够快速得到经营问题的答案。

例如:

为什么利润下降了?

哪些客户正在流失?

哪些产品值得继续投入?

库存为什么持续增加?

这些问题,才是企业真正关心的问题。

因此,我们不妨换一个视角重新理解过去二十年的数据体系。

数据仓库也好,BI 也好,数据治理也好,它们真正解决的,其实都是同一个问题:

如何更高效地生产答案。

为什么传统数据体系一定要“开发答案”?

在上一篇文章中,我们讨论了 Data Agent 开始具备完成任务的能力。

那么,在 Agent 出现之前,企业是如何获得答案的?

答案其实非常熟悉。

业务部门提出需求。

数据团队分析需求。

开发 ETL。

建设数据模型。

开发指标。

开发报表。

最后,业务查看结果。

整个过程几乎所有企业都经历过。

如果用一句话概括传统数据开发模式,那就是:

先开发答案,再等待问题出现。

为什么会形成这样的模式?

因为过去的软件系统几乎都是”预定义”的。

报表需要提前设计。

指标需要提前计算。

分析主题需要提前建设。

甚至用户能够点击哪些按钮,也需要提前开发。

这种模式有一个非常明显的特点:

企业需要预测未来会提出哪些问题,然后提前准备好对应的答案。

因此,数据团队真正开发的,并不是 SQL,也不是报表,而是一套能够回答未来问题的答案体系。

过去二十年,数据仓库和BI之所以能够成功,很大程度上正是因为这种模式满足了企业当时的管理需求。

为什么今天开始变了?

过去几年,大模型的发展让很多人第一次意识到一件事情:

也许,并不是所有答案都需要提前准备。

例如,当管理者提出:

“分析一下华东地区利润下降最快的客户,并说明主要原因。”

传统模式下,数据团队通常需要新增分析主题、新增指标、新增报表,经过开发、测试和上线之后,才能得到最终结果。

而今天,一个具备企业知识和数据能力的 Agent,已经能够自动理解问题、规划分析步骤、生成 SQL,并最终形成分析结论。

请注意,这里真正发生变化的,并不是 SQL 生成。

而是答案的生产方式。

过去,答案来自开发。

今天,答案开始来自生成。

这是 AI 带来的第一层变化。

从“预定义答案”到“动态生成答案”

如果进一步观察,会发现传统 BI 和 Data Agent 之间最大的区别,并不是交互方式。

很多人认为,过去点击报表,现在通过聊天窗口输入问题,这就是 AI 时代最大的变化。

实际上,这只是用户体验的变化。

真正的变化发生在系统内部。

过去的数据体系采用的是一种”预定义答案”模式。

数据团队需要提前定义业务指标,提前设计分析主题,提前开发报表。当用户提出问题时,系统实际上只是展示已经准备好的结果。

这种模式非常适合固定场景。

例如经营驾驶舱、月度报表、KPI 监控。

因为这些问题每天都会出现。

但它也存在天然局限。

企业真正有价值的问题,往往具有临时性和探索性。

管理者今天关心利润。

明天可能关心库存。

后天可能又开始分析客户结构。

这些问题无法全部提前设计。

于是,AI 带来了另一种可能。

系统不再提前准备所有答案,而是在用户提出问题之后,根据企业数据、业务规则以及知识体系,动态生成最合适的分析结果。

从预定义答案,到动态生成答案,这不仅仅是技术升级,更是企业数据消费模式的一次范式转换。

企业真正需要的,不是更多报表,而是更低的答案成本

如果我们重新审视企业过去二十年的数据建设,会发现一个有趣的规律。

数据库解决的是数据存储成本。

数据仓库解决的是数据整合成本。

BI 解决的是数据消费成本。

而 AI 正在解决另一个长期存在却容易被忽略的问题:

答案生产成本。

过去,一个新的分析需求,可能需要几天甚至几周。

未来,同样的问题,也许几分钟就能够完成。

这里节省的,不仅仅是开发时间。

更重要的是,企业开始拥有快速验证假设的能力。

过去,管理者往往因为获取答案成本太高,而放弃很多探索性问题。

未来,由于提问几乎没有成本,企业的数据分析方式也会随之改变。

从这个意义上说,AI 带来的不仅是效率提升,更可能改变企业决策的方式。

这是否意味着数据仓库不重要了?

很多人在看到这里时,都会产生一个疑问。

既然 AI 能够动态生成答案,那么是不是意味着数据仓库、BI 甚至 ETL 都会逐渐失去价值?

我的答案依然是否定的。

因为生成答案,并不意味着创造事实。

AI 能够生成分析过程。

却不能生成真实数据。

能够生成 SQL。

却不能生成统一口径。

能够生成报告。

却不能生成可信事实。

未来,Agent 生成答案的能力越强,对企业数据底座的要求反而越高。

统一的数据模型。

完善的数据治理。

可靠的数据质量。

标准化的业务语义。

这些能力不会因为 AI 而削弱,而会成为 AI 时代最重要的基础设施。

过去,数据仓库服务 BI。

未来,数据仓库将服务 Agent。

角色发生了变化,但价值没有改变。

企业数据体系正在进入新的阶段

过去二十年,企业数据体系一直围绕”数据如何流动”进行建设。

数据同步。

数据加工。

数据建模。

数据存储。

数据展示。

整个流程强调的是数据从一个系统流向另一个系统。

而今天,企业开始更加关注另一件事情:

知识如何沉淀。

语义如何表达。

答案如何生成。

换句话说,企业数据体系正在从”数据驱动”逐渐走向”知识驱动”。

数据依然重要,但数据已经不再是终点。

真正的目标,是让企业积累的数据能够持续转化为知识,并最终帮助企业持续获得高质量的答案。

这,或许才是 Data Agent 真正代表的未来。

写在最后

过去,我们一直认为,企业数据开发的目标是建设一个越来越完善的数据平台。

今天,我越来越觉得,这种理解已经不够完整。

未来的数据平台,不只是数据流转的平台,也不仅仅是报表分析的平台。

它更应该成为企业知识持续积累、持续理解、持续创造价值的平台。

如果说过去二十年的关键词是开发答案,那么未来十年的关键词,很可能就是生成答案

而这一变化,并不会终结数据仓库、BI 和数据治理。

相反,它们将共同构成 AI 时代企业数据体系的新底座。

因此,我更愿意把今天的 AI 理解为一次新的起点,而不是传统数据体系的终点。