AI时代,数据质量为什么比模型更重要?
——重新理解企业数据质量体系
如果让我预测未来五年企业AI建设过程中最容易被低估的一项能力,我会毫不犹豫地选择:
数据质量(Data Quality)。
过去两年,大模型的发展几乎吸引了所有人的关注。
企业讨论最多的是模型参数、上下文长度、推理能力、Agent、RAG以及MCP,很少有人愿意花时间讨论数据质量。
原因并不难理解。
模型能够直接展示能力。
而数据质量是一项长期投入、短期难以看到效果的基础工程。
然而,在越来越多企业AI项目落地之后,一个现象开始变得十分明显:
决定AI项目最终效果的,往往不是模型,而是数据。
过去,企业更多关注模型是否足够聪明。
今天,越来越多企业开始意识到:
如果输入的数据本身存在问题,那么再优秀的大模型,也只能得到一个更加”聪明”的错误答案。
为什么BI时代的数据质量没有今天重要?
很多人会问:
企业过去二十年一直在建设数据仓库,也一直在强调数据质量,为什么今天突然变得更加重要?
原因在于:
数据消费方式发生了变化。
在BI时代,数据主要服务于报表和经营分析。
一张报表如果存在错误,通常会经历这样的过程:
1 | 业务发现异常。 |
虽然影响业务,但由于报表具有固定使用对象、固定展示方式以及固定更新周期,错误通常能够较快暴露。
换句话说。
BI时代的数据质量问题,大多数属于”局部影响”。
而AI时代完全不同。
ChatBI、企业知识库、Data Agent以及智能运营平台都开始直接消费企业数据。
错误的数据一旦进入AI系统,就可能通过推理、总结、自动分析等方式快速传播到多个业务场景。
因此。
AI时代的数据质量已经不仅仅影响报表。
它开始直接影响企业决策。
AI为什么会放大数据质量问题?
很多人认为,大模型最大的风险是”幻觉(Hallucination)”。
事实上,对于企业来说,真正值得担心的往往不是模型幻觉,而是可信事实的缺失。
例如,一家企业拥有两个利润指标。
ERP采用订单利润。
财务采用开票利润。
BI平台采用财务口径。
而Agent在生成SQL时,却引用了ERP事实表。
整个分析过程没有任何语法错误。
SQL能够正常执行。
模型推理过程也完全正确。
最终得到的答案却依然错误。
为什么?
因为:
AI能够保证推理逻辑正确,却无法保证事实基础正确。
这也是AI项目与互联网聊天机器人最大的区别。
企业AI真正回答的是经营问题。
经营问题没有”大概正确”。
只有”正确”与”错误”。
一个真实案例:为什么Agent总是回答错利润?
下面分享一个典型案例。
某制造企业建设了智能经营分析平台,希望管理层能够直接向Agent提问。
例如:
“分析最近半年利润下降最快的产品。”
Agent能够自动完成以下流程:
1 | 理解问题 |
整个流程运行正常。
但业务部门始终认为结果不可信。
最终定位问题发现:
数据仓库同时维护了两个利润口径:
- 毛利(Gross Profit)
- 财务利润(Net Profit)
而元数据没有明确标注默认口径。
Agent自动选择了第一个指标。
SQL完全正确。
模型也没有幻觉。
真正的问题来自:
指标语义缺失。
这个案例说明:
未来影响AI项目的,不一定是算法。
而是企业知识表达是否完整。
数据质量已经不仅仅是”准确”
很多企业一提到数据质量,首先想到的是:
- 空值
- 重复值
- 错误值
- 格式错误
这些当然属于数据质量。
但如果站在AI时代重新理解数据质量,会发现它已经远远超出了传统定义。
作为《数据质量管理实践手册》中文版联合译者,在翻译这本书的过程中,有一句定义让我印象非常深刻:
数据质量并不是数据本身的属性,而是数据满足使用目的的程度。
AI时代,这句话值得重新理解。
过去,一份数据能够生成报表,我们认为质量合格。
今天,一份数据不仅需要生成报表,还需要支撑:
- ChatBI
- Agent
- 自动决策
- 企业知识库
- 智能运营
数据的”使用目的”已经发生了变化。
因此,数据质量的评价标准也必须随之升级。
AI时代的数据质量体系应该关注什么?
我建议企业至少关注六类能力。
| 能力 | BI时代 | AI时代 |
|---|---|---|
| 准确性(Accuracy) | ★★★★★ | ★★★★★ |
| 完整性(Completeness) | ★★★★ | ★★★★★ |
| 一致性(Consistency) | ★★★★ | ★★★★★ |
| 时效性(Timeliness) | ★★★ | ★★★★★ |
| 语义一致性(Semantic Consistency) | ★★ | ★★★★★ |
| 可解释性(Explainability) | ★ | ★★★★★ |
前三项是传统数据质量管理长期关注的问题。
后三项,则越来越成为AI时代的新要求。
例如:
Agent为什么选择这个指标?
SQL为什么这样生成?
为什么推荐这个客户?
未来,每一个AI回答,都需要能够追溯。
工程实践:把数据质量规则前移
很多企业的数据质量检查仍然发生在报表阶段。
AI时代,这种方式已经不够了。
建议将质量校验前移到数据进入语义层之前。
例如:
Hive数据进入DWS层之前完成完整性检查。
1 | SELECT |
对于关键业务指标,可以建立自动质量规则。
例如:
1 | rule_name: sales_amount_check |
只有通过质量校验的数据,才能进入Semantic Layer,最终被Agent消费。
这比让Agent去”猜测”数据是否正确更加可靠。
工具参考
不同企业可以根据自身规模选择不同的数据质量体系。
| 类型 | 代表工具 | 适用场景 |
|---|---|---|
| 开源质量平台 | Great Expectations、Soda Core | 数据质量规则管理 |
| 元数据平台 | Apache Atlas、DataHub | 元数据与血缘分析 |
| 数据转换 | dbt | 建模与测试一体化 |
| 语义层 | Cube、dbt Semantic Layer | 指标统一管理 |
| 数仓平台 | Hive、ClickHouse、Apache Doris、Snowflake | 企业可信数据底座 |
工具不是目的。
真正重要的是建立一套能够持续运行的数据质量体系。
架构师视角:未来的数据质量属于AI基础设施
过去,我们通常认为:
数据质量属于数据治理。
今天,我越来越倾向于另一种理解:
数据质量已经成为AI基础设施的一部分。
未来企业AI平台真正依赖的,并不是GPU数量,也不是模型参数,而是:
可信数据。
统一语义。
高质量知识。
模型可以持续升级。
Agent可以不断演进。
但是,如果企业没有建立可信的数据体系,那么所有AI能力最终都会受到限制。
写在最后
过去二十年,数据质量更多是一项数据治理工作。
今天,它正在成为企业AI建设过程中最重要的基础能力之一。
AI不会自动提高数据质量。
它只会更加快速地消费数据,更加广泛地传播数据,也更加依赖数据。
因此,未来企业真正需要建设的,并不是一个”更聪明的大模型”,而是一套能够持续产生可信事实的数据体系。
因为只有可信的数据,才能支撑可信的AI。