
这些年来,我曾与数百人进行过类似这样的对话:“我们的数据还挺不错的。”
有时这句话说得信心满满,有时则伴随着耸肩。偶尔还会接着说:“当然,我们确实有几条重复记录、一些缺失值,以及零星的不一致之处,但没什么大问题。”
接着,我会提出几个问题。
-
不同部门对同一项业务指标给出的数据是否各不相同?
-
是否有人在高管会议前要花数小时来核对报告?
-
同一组数据是否以多份副本的形式分散在数据仓库、数据湖、数据集市和云平台中?
-
你能解释某个具体数值的来源吗?
-
谁是该数据的所有者?
此时,现场通常会变得非常安静。事实上,大多数组织并没有“糟糕”的数据。他们面临的是几乎同样危险的东西——那就是“差不多就行(Good Enough)”的数据。
这正是我撰写最新著作《“差不多就行”数据的代价》的灵感来源。现代企业面临的最大风险通常并非戏剧性的数据库故障或灾难性停机,而是组织每天做出的无数微小妥协,这些妥协正逐渐侵蚀着人们对信息的信任。
我们曾经历过类似情况
作为数据库专业人士,我们一直深知走捷径最终会付出高昂代价。规范化处理不当会导致冗余。缺失的索引会演变成性能问题。忽视参照完整性的应用程序最终会导致数据损坏。
我花了数十年时间调优 Db2 系统,其中一个教训始终如一:大多数性能问题并非硬件问题,而是设计问题。
这一原则同样适用于企业数据。增加存储空间无法解决治理不善的问题;增加处理器无法消除不一致的业务定义;将数据迁移到云端也无法神奇地提升数据质量。
糟糕的架构,在更大规模下依然只是糟糕的架构。
数据债务的新代价
多年来,我们一直在讨论技术债务。如今,我们需要认识到另一种形式的债务:数据债务。
当组织推迟数据清理、元数据记录、所有权明确或消除冗余数据迁移时,数据债务便会不断累积。
就像财务债务一样,利息会复利增长。由于无人信任基础信息,项目周期被拉长。开发人员因无法找到权威数据源而重复创建现有数据。分析师花在验证报告上的时间比分析报告的时间还要多。由于重复数据消耗了不必要的存储和计算资源,基础设施规模不断扩大。
组织变得越来越复杂,却并未因此获得更多信息。
AI改变了游戏规则
AI迫使高管们开始关注数据库专业人士多年来一直在讨论的问题。
许多组织认为,成功的AI始于选择正确的模型。但我认为,它的起点完全不同,它始于可信的数据。
大型语言模型(LLMs)并不了解你的客户,不了解你的产品,也不了解你的业务规则,它们只能从你提供的信息中学习这些内容。
如果企业数据存在不一致、不完整、重复或文档记录不完善等问题,AI并不会纠正这些缺陷,反而会放大它们。
“垃圾输入”依然会产生“垃圾输出”。不同之处在于,AI现在能够以惊人的速度生成垃圾。这意味着“垃圾输入”会产生被放大的“垃圾输出”!
治理并非敌人
很少有话题能像数据治理这样引发如此强烈的抵触情绪。一提到治理,许多人立刻会联想到无休止的委员会、过多的文档以及官僚主义造成的延误。
那并不是真正的治理。良好的治理能解答诸如以下这些实际问题:
-
谁拥有这些数据?
-
这个字段的实际含义是什么?
-
这些信息源自何处?
-
如何对其进行验证?
-
谁负责更正错误?
如果没有这些答案,组织就会浪费大量时间去重新寻找本应早已掌握的信息。
我在书中讨论的方法之一是Robert S. Seiner提出的“非侵入式数据治理”方法论。我欣赏它的实用性,因为它不需要建立全新的官僚体系。相反,它认识到人们实际上已经在执行许多治理活动——只是这些活动尚未得到认可、协调或一致管理。
这才是改善企业信息状况的一条更切合实际的途径。
元数据值得被重视
元数据往往被视为可有可无的附带产物。但事实并非如此。元数据提供背景信息、建立数据血缘、记录数据转换过程、确保结果可重现,并支持合规性。
也许最重要的是,它让人们能够理解企业数据究竟代表什么。如今,它对AI系统也起着同样的作用。
如果没有元数据,组织最终会失去机构知识。经验丰富的员工退休,应用程序演进,系统迁移,不久之后,就没人记得某个特定计算为何存在,或者某个关键数据元素的来源了。
元数据保存了这些知识。
这对DBA意味着什么
有人认为DBA的角色正在缩小,但我并不认同。其职责范围正在扩大。性能调优、备份/恢复、安全、可用性以及容量规划依然至关重要。
随着组织现代化其架构并部署AI,DBA 所掌握的知识正是组织迫切需要的。他们可以协助记录工作负载模式、运营数据的来源,以及应用程序如何实际使用业务信息。
职位名称可能会演变,职责范围肯定会发生变化。但对经验丰富的数据库专业人员的需求并未消失,反而变得更加具有战略意义。
从基础做起
我希望读者从本书中领悟到的一点是:组织不需要又一项革命性技术,而是需要规范的数据管理。您知道的,那些核心基础工作包括:维护关键数据清单、减少不必要的副本、完善元数据、记录业务定义、持续衡量数据质量,以及简化数据管道。
在购买更多基础设施之前,先审查现有架构方是明智之举。
这些建议听起来并不令人兴奋。索引、参照完整性或设计良好的SQL也是如此。然而,数十年来,正是这些基础工作为系统提供了可靠性。
企业数据也是如此。
技术趋势将持续更迭。AI无疑会不断演进。新的平台将应运而生。供应商会推出号称能解决所有问题的新架构。
在所有这些变化中,有一条真理始终保持着惊人的稳定性:信任自身数据的组织能做出更明智的决策。而仅仅希望数据“差不多就行”的组织,最终必将为此付出代价。
根据我的经验,这笔代价总是远超任何人的预期。
作者:Craig S. Mullins