商品详情
书名:面向AI大模型的智能算力基础设施构建与应用
定价:89.8
ISBN:9787115699091
作者:苗青 张先锋 黄瑾 李强 等
版次:第1版
出版时间:2026-08
内容提要:
本书系统阐述面向AI大模型的智能算力基础设施的构建之道与应用前景。本书遵循“需求—技术—建设—应用—展望”的逻辑,从驱动AI发展的算力需求出发,深入讲解多元异构计算、芯片间高速互连、节点间高性能无损网络、弹性高速存储等核心技术。在此基础上,本书提供详尽的基础设施建设方案,包括网络建设方案、资源配置方案、资源池管理方案、*建设方案及AI平台建设方案等。此外,本书还探讨算力互联互通的实现路径,展示行业大模型的构建方法与应用案例,并分析*大规模集群面对的挑战及应对方案。本书从专业设计视角出发,聚焦顶层规划与设计决策背后的原理及权衡,有助于*提升读者在AI算力领域的系统性思维和实践能力。 本书适合需要部署AI大模型的企业或组织的技术决策者和一线工程师阅读,也适合AI领域的研究者、投资者阅读。
作者简介:
苗青,博士,正*工程师,曾任上海邮电设计咨询研究院有限公司执行董事、*委书记、总经理,现任中国电信集团有限公司云南电信实业分公司、云南省通信产业服务有限公司董事、*委书记、总经理。长期从事云计算、物联网、人工智能、语音处理及信息系统集成等领域的技术研究,作为企业负责人和项目负责人完成*“网络协同制造业务流程优化工业互联网平台测试床项目”、上海市发展和改革委员会“基于AI语音技术的中小企业自助客服云平台”、上海市科学技术委员会“区域级消防物联网关键技术研发与应用”和“基于人工智能的物联网产业敏捷服务平台”等重点课题项目,带领团队荣获多个奖项。 张先锋,硕士,正*工程师,现任上海邮电设计咨询研究院有限公司*委书记、总经理。长期从事IT系统、大数据、云计算等领域的技术研究工作,作为项目负责人完成大量政府、企事业单位(包括运营商总部)的项目规划、咨询和设计工作。 黄瑾,硕士,正*工程师,国家注册一级建造师、注册咨询工程师、注册监理工程师,现任上海邮电设计咨询研究院有限公司数据勘察设计院副总工程师。长期从事算力基础设施的规划设计、标准编制及新技术跟踪研究工作,曾获多项*和省部级*咨询奖项,多次主编或参编国家及行业标准。 李强,工程师,现任上海邮电设计咨询研究院有限公司一级设计师。长期从事云计算、人工智能及IT系统等领域的技术研究和运营商总部项目咨询与设计工作,曾以项目设计负责人身份参与天翼云上海临港国产万卡算力池工程建设项目。近年来聚焦算力网络、大规模智算集群建设等方向的技术落地与实践。
目录:
第 1 章 概述... 1
1.1 算力:数字时代的核心生产力... 1
1.2 AI:新质生产力的重要引擎与算力需求的变革者... 5
1.3 智能算力:为 AI 而生的计算新范式... 11
1.4 AI 大模型:驱动智能算力走向*大规模的核心引擎... 12
1.5 标准化:构建产业协同的基石... 13
第 2 章 AI 对智能算力基础设施的需求... 15
2.1 AI 发展对算力的宏观需求与驱动... 15
2.1.1 技术演进重塑算力基础设施的需求... 15
2.1.2 算力规模增长与结构演变... 16
2.2 智能算力服务模式分类 ... 20
2.3 大模型预训练场景的需求... 21
2.3.1 预训练对智能算力基础设施的功能需求... 21
2.3.2 预训练对智能算力基础设施的资源需求... 23
2.4 大模型微调场景的需求 ... 25
2.4.1 SFT:追求*性能的高昂路径... 27
2.4.2 PEFT:兼顾效果与成本的主流选择... 28
2.4.3 微调的资源需求与策略选择 ... 31
2.5 大模型推理场景的需求 ... 33
2.5.1 模型准备与优化:奠定*推理的基础... 34
2.5.2 推理对智能算力基础设施的资源需求 ... 39
第 3 章 智能算力基础设施的关键技术 ... 41
3.1 多元异构计算 ... 41
3.1.1 多元异构计算的架构... 41
3.1.2 智算服务器架构设计理念... 462
3.1.3 深度学习训练型 AI 服务器... 47
3.1.4 智能应用推理型 AI 服务器... 48
3.1.5 技术发展趋势...49
3.2 芯片间高速互连...50
3.2.1 PCIe... 50
3.2.2 CXL... 52
3.2.3 NVLink... 55
3.2.4 PCIe、CXL、NVLink 的对比... 57
3.3 节点间高性能无损网络...58
3.3.1 核心使能技术 RDMA...58
3.3.2 关键网络架构与拓扑...62
3.3.3 应用方案:从智算中心内到跨广域网... 69
3.4 弹性高速存储... 73
3.4.1 AI 大模型的存储需求...73
3.4.2 主流存储技术的适用性...75
3.4.3 优化存储性能和成本的策略... 76
3.5 并行加速技术... 77
3.5.1 数据并行...78
3.5.2 张量并行...79
3.5.3 流水线并行...81
3.5.4 混合并行与使能技术...82
3.6 模型优化关键技术...83
3.6.1 模型压缩...84
3.6.2 提示词工程...91
3.6.3 RAG... 93
3.7 资源管理与调度...95
3.7.1 异构算力管理与调度的挑战... 95
3.7.2 异构算力管理与调度的关键技术... 96
3.8 智能体... 98
3.8.1 核心架构与关键组件...99
3.8.2 人机协同模式... 100
3.8.3 主要应用场景与产业实践... 101
3.9 AI * ... 101
3.9.1 数据*... 102
3.9.2 模型*... 103
3.9.3 应用*... 104
第 4 章 智能算力基础设施的建设 ... 106
4.1 总体架构 ... 106
4.1.1 硬件层... 108
4.1.2 软件层... 108
4.1.3 平台服务层... 109
4.1.4 业务系统层... 109
4.1.5 运维管理层... 109
4.2 网络建设方案 ... 110
4.2.1 参数网络... 112
4.2.2 存储网络... 117
4.2.3 业务网络... 120
4.2.4 管理网络... 122
4.3 资源配置方案 ... 127
4.3.1 GPU 服务器配置 ... 128
4.3.2 存储资源配置... 129
4.3.3 其他服务器资源... 137
4.4 资源池管理方案... 139
4.4.1 核心功能... 139
4.4.2 资源池管理平台系统架构与技术选型 ... 144
4.5 *建设方案 ... 146
4.5.1 资源池*风险分析... 146
4.5.2 资源池*防护目标... 149
4.5.3 纵深防御:分层*建设方案与技术选型 ... 151
4.6 AI 平台建设方案 ... 155
4.6.1 AI 平台的核心定位与功能... 1564
4.6.2 AI 平台建设路径与技术栈选型... 157
第 5 章 算力互联互通...160
5.1 算力网络...160
5.1.1 算力网络的背景...160
5.1.2 算力互联互通的核心需求... 162
5.1.3 算力互联互通的流程机理... 166
5.1.4 算力网络的参考架构...173
5.2 跨域算力调度系统...177
5.2.1 系统定位...177
5.2.2 功能架构...179
5.2.3 关键技术...180
5.3 算力网络的产业实践...188
5.3.1 电信运营商:网络的构建者与服务的主导者...188
5.3.2 设备与方案供应商:全栈技术的赋能者...188
5.3.3 云服务提供商:算力供给与平台创新的核心...189
5.4 算力网络的未来发展趋势...189
第 6 章 行业大模型构建与应用...191
6.1 行业大模型构建...191
6.1.1 行业需求分析与资源评估... 192
6.1.2 行业数据与大模型共建...195
6.1.3 行业大模型微调与优化部署... 198
6.2 行业大模型能力评价指标...200
6.2.1 行业大模型基础能力评估... 200
6.2.2 行业大模型服务能力评估... 205
6.3 DeepSeek 大模型在银行系统部署的行业实践案例 ...207
6.3.1 挑战与需求分析...208
6.3.2 系统架构设计...208
6.3.3 系统部署与持续优化...210
6.3.4 成本估算...211
6.4 大模型应用面临的风险与应对措施... 214
6.4.1 大模型的幻觉问题... 214
6.4.2 信息*及隐私风险... 215
6.4.3 算法偏见与社会公平性挑战 ... 216
第 7 章 *大规模集群展望... 218
7.1 *大规模集群是通向更强 AI 的算力阶梯... 218
7.2 *大规模集群面对的挑战与应对方案 ... 219
7.2.1 应对功耗挑战:园区级部署与散热方案... 220
7.2.2 应对网络挑战:*大规模拓扑设计策略... 221
7.2.3 优化物理互连:布线方案与成本效益 ... 223
7.2.4 保障系统稳定:可靠性设计与故障恢复... 223
7.2.5 控制建设成本:网络技术选型与权衡 ... 225
参考文献... 229
定价:89.8
ISBN:9787115699091
作者:苗青 张先锋 黄瑾 李强 等
版次:第1版
出版时间:2026-08
内容提要:
本书系统阐述面向AI大模型的智能算力基础设施的构建之道与应用前景。本书遵循“需求—技术—建设—应用—展望”的逻辑,从驱动AI发展的算力需求出发,深入讲解多元异构计算、芯片间高速互连、节点间高性能无损网络、弹性高速存储等核心技术。在此基础上,本书提供详尽的基础设施建设方案,包括网络建设方案、资源配置方案、资源池管理方案、*建设方案及AI平台建设方案等。此外,本书还探讨算力互联互通的实现路径,展示行业大模型的构建方法与应用案例,并分析*大规模集群面对的挑战及应对方案。本书从专业设计视角出发,聚焦顶层规划与设计决策背后的原理及权衡,有助于*提升读者在AI算力领域的系统性思维和实践能力。 本书适合需要部署AI大模型的企业或组织的技术决策者和一线工程师阅读,也适合AI领域的研究者、投资者阅读。
作者简介:
苗青,博士,正*工程师,曾任上海邮电设计咨询研究院有限公司执行董事、*委书记、总经理,现任中国电信集团有限公司云南电信实业分公司、云南省通信产业服务有限公司董事、*委书记、总经理。长期从事云计算、物联网、人工智能、语音处理及信息系统集成等领域的技术研究,作为企业负责人和项目负责人完成*“网络协同制造业务流程优化工业互联网平台测试床项目”、上海市发展和改革委员会“基于AI语音技术的中小企业自助客服云平台”、上海市科学技术委员会“区域级消防物联网关键技术研发与应用”和“基于人工智能的物联网产业敏捷服务平台”等重点课题项目,带领团队荣获多个奖项。 张先锋,硕士,正*工程师,现任上海邮电设计咨询研究院有限公司*委书记、总经理。长期从事IT系统、大数据、云计算等领域的技术研究工作,作为项目负责人完成大量政府、企事业单位(包括运营商总部)的项目规划、咨询和设计工作。 黄瑾,硕士,正*工程师,国家注册一级建造师、注册咨询工程师、注册监理工程师,现任上海邮电设计咨询研究院有限公司数据勘察设计院副总工程师。长期从事算力基础设施的规划设计、标准编制及新技术跟踪研究工作,曾获多项*和省部级*咨询奖项,多次主编或参编国家及行业标准。 李强,工程师,现任上海邮电设计咨询研究院有限公司一级设计师。长期从事云计算、人工智能及IT系统等领域的技术研究和运营商总部项目咨询与设计工作,曾以项目设计负责人身份参与天翼云上海临港国产万卡算力池工程建设项目。近年来聚焦算力网络、大规模智算集群建设等方向的技术落地与实践。
目录:
第 1 章 概述... 1
1.1 算力:数字时代的核心生产力... 1
1.2 AI:新质生产力的重要引擎与算力需求的变革者... 5
1.3 智能算力:为 AI 而生的计算新范式... 11
1.4 AI 大模型:驱动智能算力走向*大规模的核心引擎... 12
1.5 标准化:构建产业协同的基石... 13
第 2 章 AI 对智能算力基础设施的需求... 15
2.1 AI 发展对算力的宏观需求与驱动... 15
2.1.1 技术演进重塑算力基础设施的需求... 15
2.1.2 算力规模增长与结构演变... 16
2.2 智能算力服务模式分类 ... 20
2.3 大模型预训练场景的需求... 21
2.3.1 预训练对智能算力基础设施的功能需求... 21
2.3.2 预训练对智能算力基础设施的资源需求... 23
2.4 大模型微调场景的需求 ... 25
2.4.1 SFT:追求*性能的高昂路径... 27
2.4.2 PEFT:兼顾效果与成本的主流选择... 28
2.4.3 微调的资源需求与策略选择 ... 31
2.5 大模型推理场景的需求 ... 33
2.5.1 模型准备与优化:奠定*推理的基础... 34
2.5.2 推理对智能算力基础设施的资源需求 ... 39
第 3 章 智能算力基础设施的关键技术 ... 41
3.1 多元异构计算 ... 41
3.1.1 多元异构计算的架构... 41
3.1.2 智算服务器架构设计理念... 462
3.1.3 深度学习训练型 AI 服务器... 47
3.1.4 智能应用推理型 AI 服务器... 48
3.1.5 技术发展趋势...49
3.2 芯片间高速互连...50
3.2.1 PCIe... 50
3.2.2 CXL... 52
3.2.3 NVLink... 55
3.2.4 PCIe、CXL、NVLink 的对比... 57
3.3 节点间高性能无损网络...58
3.3.1 核心使能技术 RDMA...58
3.3.2 关键网络架构与拓扑...62
3.3.3 应用方案:从智算中心内到跨广域网... 69
3.4 弹性高速存储... 73
3.4.1 AI 大模型的存储需求...73
3.4.2 主流存储技术的适用性...75
3.4.3 优化存储性能和成本的策略... 76
3.5 并行加速技术... 77
3.5.1 数据并行...78
3.5.2 张量并行...79
3.5.3 流水线并行...81
3.5.4 混合并行与使能技术...82
3.6 模型优化关键技术...83
3.6.1 模型压缩...84
3.6.2 提示词工程...91
3.6.3 RAG... 93
3.7 资源管理与调度...95
3.7.1 异构算力管理与调度的挑战... 95
3.7.2 异构算力管理与调度的关键技术... 96
3.8 智能体... 98
3.8.1 核心架构与关键组件...99
3.8.2 人机协同模式... 100
3.8.3 主要应用场景与产业实践... 101
3.9 AI * ... 101
3.9.1 数据*... 102
3.9.2 模型*... 103
3.9.3 应用*... 104
第 4 章 智能算力基础设施的建设 ... 106
4.1 总体架构 ... 106
4.1.1 硬件层... 108
4.1.2 软件层... 108
4.1.3 平台服务层... 109
4.1.4 业务系统层... 109
4.1.5 运维管理层... 109
4.2 网络建设方案 ... 110
4.2.1 参数网络... 112
4.2.2 存储网络... 117
4.2.3 业务网络... 120
4.2.4 管理网络... 122
4.3 资源配置方案 ... 127
4.3.1 GPU 服务器配置 ... 128
4.3.2 存储资源配置... 129
4.3.3 其他服务器资源... 137
4.4 资源池管理方案... 139
4.4.1 核心功能... 139
4.4.2 资源池管理平台系统架构与技术选型 ... 144
4.5 *建设方案 ... 146
4.5.1 资源池*风险分析... 146
4.5.2 资源池*防护目标... 149
4.5.3 纵深防御:分层*建设方案与技术选型 ... 151
4.6 AI 平台建设方案 ... 155
4.6.1 AI 平台的核心定位与功能... 1564
4.6.2 AI 平台建设路径与技术栈选型... 157
第 5 章 算力互联互通...160
5.1 算力网络...160
5.1.1 算力网络的背景...160
5.1.2 算力互联互通的核心需求... 162
5.1.3 算力互联互通的流程机理... 166
5.1.4 算力网络的参考架构...173
5.2 跨域算力调度系统...177
5.2.1 系统定位...177
5.2.2 功能架构...179
5.2.3 关键技术...180
5.3 算力网络的产业实践...188
5.3.1 电信运营商:网络的构建者与服务的主导者...188
5.3.2 设备与方案供应商:全栈技术的赋能者...188
5.3.3 云服务提供商:算力供给与平台创新的核心...189
5.4 算力网络的未来发展趋势...189
第 6 章 行业大模型构建与应用...191
6.1 行业大模型构建...191
6.1.1 行业需求分析与资源评估... 192
6.1.2 行业数据与大模型共建...195
6.1.3 行业大模型微调与优化部署... 198
6.2 行业大模型能力评价指标...200
6.2.1 行业大模型基础能力评估... 200
6.2.2 行业大模型服务能力评估... 205
6.3 DeepSeek 大模型在银行系统部署的行业实践案例 ...207
6.3.1 挑战与需求分析...208
6.3.2 系统架构设计...208
6.3.3 系统部署与持续优化...210
6.3.4 成本估算...211
6.4 大模型应用面临的风险与应对措施... 214
6.4.1 大模型的幻觉问题... 214
6.4.2 信息*及隐私风险... 215
6.4.3 算法偏见与社会公平性挑战 ... 216
第 7 章 *大规模集群展望... 218
7.1 *大规模集群是通向更强 AI 的算力阶梯... 218
7.2 *大规模集群面对的挑战与应对方案 ... 219
7.2.1 应对功耗挑战:园区级部署与散热方案... 220
7.2.2 应对网络挑战:*大规模拓扑设计策略... 221
7.2.3 优化物理互连:布线方案与成本效益 ... 223
7.2.4 保障系统稳定:可靠性设计与故障恢复... 223
7.2.5 控制建设成本:网络技术选型与权衡 ... 225
参考文献... 229
- 人民邮电出版社有限公司 (微信公众号认证)
- 人民邮电出版社微店,为您提供最全面,最专业的一站式购书服务
- 扫描二维码,访问我们的微信店铺
- 随时随地的购物、客服咨询、查询订单和物流...