AI辅助数据质量监控
作 者:(美)杰里米·斯坦利(Jeremy Stanley),(美)佩奇·施瓦茨(Paige Schwartz) 著 李晗玥,柯幸烨,陈天皓 译
定 价:79
出 版 社:机械工业出版社
出版日期:2025年06月01日
页 数:440
装 帧:平装
ISBN:9787111780250
目录
●序1
前言3
第1章数据质量监控势在必行9
1.1高质量的数据是新时代的黄金11
1.1.1数据驱动型公司是当今的颠覆者11
1.1.2数据分析的普及12
1.1.3人工智能和机器学习是竞争优势之源13
1.1.4公司正在投资现代数据栈14
1.2数据越多,问题越多15
1.2.1数据工厂中的问题15
1.2.2数据迁移17
1.2.3第三方数据源18
1.2.4公司的成长与变化19
1.2.5外界因素21
1.3为什么我们需要数据质量监控23
1.3.1数据疤痕24
1.3.2数据冲击25
1.4自动化数据质量监控:一个全新的领域26
第2章数据质量监控策略与自动化的角色28
2.1监控需求28
2.2数据可观测性:必要但不充分30
2.3传统的数据质量监控方法32
2.3.1人工数据质量检测32
2.3.2基于规则的测试34
2.3.3指标监控39
2.4使用无监督机器学习实现自动化数据质量监控41
2.4.1什么是无监督机器学习42
2.4.2类比:车道偏离警告45
2.4.3自动化的局限性46
2.5数据质量监控的四大支柱方法49
第3章对自动化数据质量监控的商业影响进行评估52
3.1对数据进行评估53
3.1.1数量53
3.1.2种类54
3.1.3速度59
3.1.4真实性60
3.1.5特殊情况61
3.2评估你的行业61
3.2.1监管压力62
3.2.2人工智能/机器学习的风险63
3.2.3数据即产品66
3.3评估你的数据成熟度67
3.4评估对利益相关方的好处69
3.4.1工程师69
3.4.2数据团队领导者70
3.4.3科学家72
3.4.4消费者72
3.5进行投资回报率分析72
3.5.1定量指标73
3.5.2定性指标74
3.6总结77
第4章利用机器学习使数据质量监控自动化78
4.1要求78
4.1.1敏感性79
4.1.2特异性79
4.1.3透明度80
4.1.4可扩展性80
4.1.5非必要需求80
4.1.6数据质量监控不等同于异常检测81
4.2机器学习方法和算法82
4.2.1数据抽样84
4.2.2特征编码89
4.2.3模型开发91
4.2.4模型可解释性95
4.3整体思路的伪代码实现99
4.4其他应用101
4.5总结103
第5章构建一个适用于真实数据的模型105
5.1数据挑战及应对措施105
5.1.1季节性105
5.1.2基于时间的特征106
5.1.3混乱程度107
5.1.4就地更新表格108
5.1.5列之间的相关性111
5.2模型测试112
5.2.1引入合成异常113
5.2.2基准测试117
5.2.3模型改进124
5.3总结125
第6章实施警报机制同时避免警报疲劳126
6.1如何通过通知促进数据问题响应126
6.1.1分类处理127
6.1.2路由127
6.1.3解决方案128
6.1.4文档记录128
6.2在没有通知的情况下采取行动128
6.3一个通知的解析129
6.3.1可视化130
6.3.2操作131
6.3.3文本描述132
6.3.4检查的创建者/最后编辑者133
6.4发送通知133
6.4.1通知的受众133
6.4.2通知的渠道135
6.4.3通知的时机137
6.5避免警报疲劳137
6.5.1合理安排检查顺序138
6.5.2使用机器学习对警报进行聚类138
6.5.3抑制通知140
6.6自动化根因分析144
6.7总结146
第7章集成监控与数据工具和系统148
7.1监控数据堆栈149
7.2数据仓库150
7.2.1与数据仓库集成150
7.2.2安全性154
7.2.3多仓库之间的数据协调155
7.3数据编排器156
7.4数据目录160
7.5数据使用者163
7.5.1BI和分析工具163
7.5.2MLOps164
7.6总结166
第8章大规模运营解决方案167
8.1自建还是购买167
8.2配置171
8.2.1确定最重要的表格171
8.2.2决定监控表格中的哪些数据172
8.2.3大规模配置173
8.3启用173
8.3.1用户角色和权限173
8.3.2培训、支持与推广174
8.4持续改善数据质量175
8.4.1数据健康计划176
8.4.2衡量指标176
8.5从混乱到清晰178
附录数据质量问题的类型180
内容介绍
本书主要介绍了如何确保企业所依赖的数据的质量。书中详细阐述了自动化数据质量监控的重要性,并提供了实用的方法,帮助企业高效地覆盖所有数据表,主动发现数据问题,并立即解决。作者们解释了如何构建无监督机器学习模型来检测数据问题,以及如何实施通知机制以减少警报疲劳,并迅速分类和解决这些问题。此外,本书还探讨了如何将自动化数据质量监控与数据目录、BI和ML系统集成,以克服自动化监控的局限性,并在大规模环境中部署和管理监控解决方案。这本书是数据质量领域的实用指南,为企业提供了确保数据质量的有效策略和方法。
(美)杰里米·斯坦利(Jeremy Stanley),(美)佩奇·施瓦茨(Paige Schwartz) 著 李晗玥,柯幸烨,陈天皓 译