目录
●推荐序一
推荐序二
前 言
第一部分 新范式——为什么可观测性需要大语言模型
第1章 大语言模型驱动的云原生可观测性技术背景 3
1.1 可观测性的基础知识 3
1.1.1 可观测性的基本定义与理论基础 4
1.1.2 架构视角下的范式对比:传统监控和可观测 7
1.1.3 可观测范式的典型应用场景与架构适配 10
1.1.4 可观测性的核心价值与业务影响 13
1.2 可观测性平台的支柱体系 14
1.2.1 事件:离散状态变更的数据基石 15
1.2.2 日志:事件记录与语义溯源 17
1.2.3 指标:量化评估与趋势分析 19
1.2.4 追踪:调用路径与因果追踪 21
1.2.5 上下文——跨域关联与语义整合 23
1.3 可观测性架构的发展演进 25
1.3.1 阶段一:面向运维监控的集中式日志和指标监控 25
1.3.2 阶段二:面向系统集成的分布式链路请求追踪 27
1.3.3 阶段三:面向业务驱动的全链路统一可观测性 28
1.4 本章小结 30
第2章 从模型到范式——大语言模型基础 31
2.1 大语言模型概述 31
2.1.1 大语言模型的定义和核心特征 31
2.1.2 与传统语言模型的区别 33
2.1.3 大语言模型的架构及工作机制 34
2.2 大语言模型的发展历程和现实格局 36
2.2.1 大语言模型的演进历程 36
2.2.2 大语言模型的现状 38
2.2.3 大语言模型展望 43
2.3 大语言模型的能力边界与挑战 49
2.3.1 理论局限性 50
2.3.2 技术瓶颈 53
2.3.3 伦理与社会风险 55
2.4 本章小结 56
第二部分 核心技术——当可观测性遇上大语言模型
第3章 大语言模型的系统化能力与工程化体系 59
3.1 大语言模型生态体系的构成框架 59
3.1.1 生态体系简介 59
3.1.2 生态体系的构成要素 62
3.1.3 云原生下生态体系的核心特征 67
3.2 大语言模型的架构与算力支撑生态 72
3.2.1 模型架构生态 73
3.2.2 算力基座与硬件生态 96
3.2.3 数据训练与推理生态 109
3.3 本章小结 115
第4章 大语言模型应用部署生态 116
4.1 大语言模型的开发框架与库 116
4.1.1 大语言模型构建框架 116
4.1.2 模型训练库 124
4.1.3 专用模型构建框架 129
4.2 模型管理与微调工具 138
4.2.1 Lightning AI 框架 139
4.2.2 MLflow 框架 142
4.3 模型部署与服务化工具 146
4.3.1 TorchServe 146
4.3.2 TensorFlow Serving 150
4.4 本章小结 153
第5章 云原生可观测性技术原理与体系标准 154
5.1 云原生可观测性的三大支柱技术及原理 154
5.1.1 日志技术及原理 154
5.1.2 指标技术及原理 169
5.1.3 追踪技术及原理 180
5.2 云原生可观测性的关键技术 187
5.2.1 传统的Agent技术 187
5.2.2 SideCar技术 191
5.2.3 新一代的eBPF技术 197
5.3 云原生可观测性体系标准 203
5.3.1 可观测性体系标准的架构 203
5.3.2 云原生可观测性体系标准的核心要素 205
5.3.3 云原生可观测性体系标准的核心原则 206
5.3.4 云原生可观测性体系标准的实施框架 207
5.4 本章小结 208
第6章 国外主流大语言模型解析:技术架构与应用实例 209
6.1 OpenAI的GPT系列 209
6.1.1 模型架构与特点 209
6.1.2 训练数据与方法 217
6.1.3 很好实践 220
6.2 Google的AI系列 224
6.2.1 模型架构与特点 225
6.2.2 训练数据与方法 229
6.2.3 很好实践 232
6.3 Meta的Llama系列 235
6.3.1 模型架构与特点 235
6.3.2 训练数据与方法 245
6.3.3 开源生态与应用案例 248
6.4 本章小结 253
第7章 国内主流大语言模型解析:DeepSeek的创新与实践 254
7.1 DeepSeek系列模型概述 254
7.1.1 DeepSeek模型矩阵与生态贡献 254
7.1.2 DeepSeek-V3模型 259
7.1.3 DeepSeek-R1模型 262
7.2 DeepSeek模型训练 265
7.2.1 DeepSeek-V3的基础训练过程 265
7.2.2 DeepSeek-R1的多阶段训练流程 267
7.2.3 训练效率与成本控制策略 268
7.3 DeepSeek模型很好实践 272
7.3.1 DeepSeek模型选型 272
7.3.2 DeepSeek模型部署优化 275
7.3.3 DeepSeek应用场景构建 281
7.4 本章小结 286
第三部分 融合与创新——如何构建一个大语言模型驱动的可观测性系统
第8章 OpenTelemetry在大语言模型可观测性中的演进与实践 289
8.1 OpenTelemetry概述 289
8.1.1 OpenTelemetry的前身与使命 290
8.1.2 什么是OpenTelemetry 292
8.1.3 为什么选择OpenTelemetry 295
8.2 OpenTelemetry的核心架构设计及实现原理 297
8.2.1 OpenTelemetry观测数据流生命周期 297
8.2.2 OpenTelemetry的架构设计理念 300
8.2.3 OpenTelemetry的技术原理 314
8.3 OpenTelemetry在云原生与大语言模型可观测性生态中的应用 322
……
内容介绍
内容简介
这是一部系统讲解如何将大模型技术应用于云原生可观测性领域的实战指南。它为读者构建了智能可观测性的完整知识图谱,能为研发团队与技术决策者提供从方法论到工程落地的完整路径,从而将数据转化为洞察,将被动响应转化为主动决策。
全书共11章,分为四个部分。
第一部分(第1、2章):剖析云原生时代运维的根本挑战,首次提出将大模型作为应对这些挑战的新范式,涵盖可观测性基础知识、大模型核心特征与能力边界。
第二部分(第3~7章):深入解析大模型与可观测性的核心技术体系,包括大模型生态框架、应用部署工具链、云原生可观测三大支柱(日志/指标/追踪)、OpenTelemetry/eBPF关键技术,以及GPT/DeepSeek/Llama等国内外主流大模型的架构设计与很好实践。
第三部分(第8、9章):详细阐述大模型与可观测性技术融合的机制和创新点,提供从数据处理到智能决策的完整技术路径。围绕OpenT......