陶玉印的博客

企业数据治理、数据仓库、数据质量、AI应用实践与研究

0%

AI时代,数据质量为什么比模型更重要?

AI时代,数据质量为什么比模型更重要?

——重新理解企业数据质量体系

如果让我预测未来五年企业AI建设过程中最容易被低估的一项能力,我会毫不犹豫地选择:

数据质量(Data Quality)。

过去两年,大模型的发展几乎吸引了所有人的关注。

企业讨论最多的是模型参数、上下文长度、推理能力、Agent、RAG以及MCP,很少有人愿意花时间讨论数据质量。

原因并不难理解。

模型能够直接展示能力。

而数据质量是一项长期投入、短期难以看到效果的基础工程。

然而,在越来越多企业AI项目落地之后,一个现象开始变得十分明显:

决定AI项目最终效果的,往往不是模型,而是数据。

过去,企业更多关注模型是否足够聪明。

今天,越来越多企业开始意识到:

如果输入的数据本身存在问题,那么再优秀的大模型,也只能得到一个更加”聪明”的错误答案。


为什么BI时代的数据质量没有今天重要?

很多人会问:

企业过去二十年一直在建设数据仓库,也一直在强调数据质量,为什么今天突然变得更加重要?

原因在于:

数据消费方式发生了变化。

在BI时代,数据主要服务于报表和经营分析。

一张报表如果存在错误,通常会经历这样的过程:

1
2
3
4
5
6
7
业务发现异常。

数据团队排查。

修正ETL。

重新发布报表。

虽然影响业务,但由于报表具有固定使用对象、固定展示方式以及固定更新周期,错误通常能够较快暴露。

换句话说。

BI时代的数据质量问题,大多数属于”局部影响”。

而AI时代完全不同。

ChatBI、企业知识库、Data Agent以及智能运营平台都开始直接消费企业数据。

错误的数据一旦进入AI系统,就可能通过推理、总结、自动分析等方式快速传播到多个业务场景。

因此。

AI时代的数据质量已经不仅仅影响报表。

它开始直接影响企业决策。


AI为什么会放大数据质量问题?

很多人认为,大模型最大的风险是”幻觉(Hallucination)”。

事实上,对于企业来说,真正值得担心的往往不是模型幻觉,而是可信事实的缺失

例如,一家企业拥有两个利润指标。

ERP采用订单利润。

财务采用开票利润。

BI平台采用财务口径。

而Agent在生成SQL时,却引用了ERP事实表。

整个分析过程没有任何语法错误。

SQL能够正常执行。

模型推理过程也完全正确。

最终得到的答案却依然错误。

为什么?

因为:

AI能够保证推理逻辑正确,却无法保证事实基础正确。

这也是AI项目与互联网聊天机器人最大的区别。

企业AI真正回答的是经营问题。

经营问题没有”大概正确”。

只有”正确”与”错误”。


一个真实案例:为什么Agent总是回答错利润?

下面分享一个典型案例。

某制造企业建设了智能经营分析平台,希望管理层能够直接向Agent提问。

例如:

“分析最近半年利润下降最快的产品。”

Agent能够自动完成以下流程:

1
2
3
4
5
6
7
8
9
10
11
理解问题

定位利润指标

查询元数据

生成SQL

执行分析

生成报告

整个流程运行正常。

但业务部门始终认为结果不可信。

最终定位问题发现:

数据仓库同时维护了两个利润口径:

  • 毛利(Gross Profit)
  • 财务利润(Net Profit)

而元数据没有明确标注默认口径。

Agent自动选择了第一个指标。

SQL完全正确。

模型也没有幻觉。

真正的问题来自:

指标语义缺失。

这个案例说明:

未来影响AI项目的,不一定是算法。

而是企业知识表达是否完整。


数据质量已经不仅仅是”准确”

很多企业一提到数据质量,首先想到的是:

  • 空值
  • 重复值
  • 错误值
  • 格式错误

这些当然属于数据质量。

但如果站在AI时代重新理解数据质量,会发现它已经远远超出了传统定义。

作为《数据质量管理实践手册》中文版联合译者,在翻译这本书的过程中,有一句定义让我印象非常深刻:

数据质量并不是数据本身的属性,而是数据满足使用目的的程度。

AI时代,这句话值得重新理解。

过去,一份数据能够生成报表,我们认为质量合格。

今天,一份数据不仅需要生成报表,还需要支撑:

  • ChatBI
  • Agent
  • 自动决策
  • 企业知识库
  • 智能运营

数据的”使用目的”已经发生了变化。

因此,数据质量的评价标准也必须随之升级。


AI时代的数据质量体系应该关注什么?

我建议企业至少关注六类能力。

能力 BI时代 AI时代
准确性(Accuracy) ★★★★★ ★★★★★
完整性(Completeness) ★★★★ ★★★★★
一致性(Consistency) ★★★★ ★★★★★
时效性(Timeliness) ★★★ ★★★★★
语义一致性(Semantic Consistency) ★★ ★★★★★
可解释性(Explainability) ★★★★★

前三项是传统数据质量管理长期关注的问题。

后三项,则越来越成为AI时代的新要求。

例如:

Agent为什么选择这个指标?

SQL为什么这样生成?

为什么推荐这个客户?

未来,每一个AI回答,都需要能够追溯。


工程实践:把数据质量规则前移

很多企业的数据质量检查仍然发生在报表阶段。

AI时代,这种方式已经不够了。

建议将质量校验前移到数据进入语义层之前。

例如:

Hive数据进入DWS层之前完成完整性检查。

1
2
3
4
SELECT
COUNT(*) AS null_customer_cnt
FROM dwd_order_detail
WHERE customer_id IS NULL;

对于关键业务指标,可以建立自动质量规则。

例如:

1
2
3
4
5
6
7
8
9
10
11
rule_name: sales_amount_check

metric: sales_amount

check:
- not_null
- >=0
- compare_last_7_days
- compare_last_year_same_day

severity: HIGH

只有通过质量校验的数据,才能进入Semantic Layer,最终被Agent消费。

这比让Agent去”猜测”数据是否正确更加可靠。


工具参考

不同企业可以根据自身规模选择不同的数据质量体系。

类型 代表工具 适用场景
开源质量平台 Great Expectations、Soda Core 数据质量规则管理
元数据平台 Apache Atlas、DataHub 元数据与血缘分析
数据转换 dbt 建模与测试一体化
语义层 Cube、dbt Semantic Layer 指标统一管理
数仓平台 Hive、ClickHouse、Apache Doris、Snowflake 企业可信数据底座

工具不是目的。

真正重要的是建立一套能够持续运行的数据质量体系。


架构师视角:未来的数据质量属于AI基础设施

过去,我们通常认为:

数据质量属于数据治理。

今天,我越来越倾向于另一种理解:

数据质量已经成为AI基础设施的一部分。

未来企业AI平台真正依赖的,并不是GPU数量,也不是模型参数,而是:

可信数据。

统一语义。

高质量知识。

模型可以持续升级。

Agent可以不断演进。

但是,如果企业没有建立可信的数据体系,那么所有AI能力最终都会受到限制。


写在最后

过去二十年,数据质量更多是一项数据治理工作。

今天,它正在成为企业AI建设过程中最重要的基础能力之一。

AI不会自动提高数据质量。

它只会更加快速地消费数据,更加广泛地传播数据,也更加依赖数据。

因此,未来企业真正需要建设的,并不是一个”更聪明的大模型”,而是一套能够持续产生可信事实的数据体系。

因为只有可信的数据,才能支撑可信的AI。