基于HLS的深度神经网络 FPGA硬件加速器设计 从算法到硬件 李国庆 AI硬件加速器 DNN硬件 协同设计 神经网络硬件加速器设计技术书
| 运费: | 免运费 |
商品详情
定价:128.0
ISBN:9787111813736
作者:李国庆 陈廷欢 张经纬
版次:1
出版时间:2026-08
内容提要:
人工智能(AI),特别是深度神经网络(DNN)近年来在计算机视觉、自然语言处理等领域取得了突破性进展,
但其庞大的计算需求给传统CPU和GPU架构带来严峻挑战。为满足边缘计算、自动驾驶、
智能终端等场景对低延迟、低功耗、高能效的严苛要求,AI硬件加速器已成为产业界与学术界的核心研究方向。
本书将高层次综合(HLS)提升为一种核心的协同设计研究工具,为相关领域的研究人员提供了一套标准化、可复现的研究方法论。
《基于HLS的深度神经网络FPGA硬件加速器设计》通过两个详尽的案例,
不仅清晰地展示了深度神经网络硬件加速器的设计过程,更从中提炼出两种具有普遍指导意义的硬件架构范式:
计算单元复用式架构——为解决资源受限问题提供了系统性的设计原则与优化策略,是研究高能效比、
低成本边缘加速器的典型范本;流水线数据流架构——为追求高吞吐量的应用展示了如何通过精细的流
水线设计和数据流调度,最大化硬件并行度与计算效率。从算法模型分析出发,通过HLS进行硬件建模与迭代优化,
最终以FPGA为验证平台,能够有效降低设计人员进入“AI加速器设计”这一高门槛领域的难度。
人工智能(AI),特别是深度神经网络(DNN)近年来在计算机视觉、自然语言处理等领域取得了突破性进展,
但其庞大的计算需求给传统CPU和GPU架构带来严峻挑战。为满足边缘计算、自动驾驶、
智能终端等场景对低延迟、低功耗、高能效的严苛要求,AI硬件加速器已成为产业界与学术界的核心研究方向。
本书将高层次综合(HLS)提升为一种核心的协同设计研究工具,为相关领域的研究人员提供了一套标准化、可复现的研究方法论。
《基于HLS的深度神经网络FPGA硬件加速器设计》通过两个详尽的案例,
不仅清晰地展示了深度神经网络硬件加速器的设计过程,更从中提炼出两种具有普遍指导意义的硬件架构范式:
计算单元复用式架构——为解决资源受限问题提供了系统性的设计原则与优化策略,是研究高能效比、
低成本边缘加速器的典型范本;流水线数据流架构——为追求高吞吐量的应用展示了如何通过精细的流水线设计和数据流调度,
最大化硬件并行度与计算效率。从算法模型分析出发,通过HLS进行硬件建模与迭代优化
,最终以FPGA为验证平台,能够有效降低设计人员进入“AI加速器设计”这一高门槛领域的难度。
目录:
第 1 章 深度神经网络基础 4
1.1 卷积
1.1.1 标准卷积
1.1.1.1 卷积的基本概念和特点
1.1.1.2 优缺点
1.1.1.3 参数量和计算量分析
1.1.2 深度可分离卷积
1.1.2.1 逐深度卷积
1.1.2.2 逐点卷积
1.1.2.3 参数量与计算量
1.2 池化
1.2.1 最大/平均池化
1.2.2 全局池化
1.2.3 随机池化
1.2.4 自适应池化
1.3 激活
1.3.1 Sigmoid 函数
1.3.2 双曲正切函数(Tanh)
1.3.3 线性整流单元(ReLU)
1.3.4 Leaky ReLU
1.3.5 Swish 函数
1.3.6 对比总结
1.4 全连接层
1.4.1 全连接层的基本概念和特点
1.4.2 全连接层的作用
1.5 批归一化
1.5.1 批归一化的计算步骤
1.5.2 批归一化的优点和缺点
第 2 章 经典卷积神经网络
2.1 VGG
2.1.1 VGG 特点简介
2.1.2 VGG 网络结构
2.1.3 VGG 网络的参数量和计算量
2.1.4 VGG 的优点和缺点
2.1.4.1 VGG 网络的优点(相较于之前的网络)
2.1.4.2 VGG 网络的缺点
2.2 ResNet
2.2.1 ResNet 特点简介
2.2.1.1 残差结构
2.2.1.2 瓶颈结构 Bottleneck
2.2.2 ResNet 网络结构
2.2.3 ResNet 网络的参数量和计算量
2.2.4 ResNet 网络的优缺点
2.2.4.1 ResNet 网络的优点
2.2.4.2 ResNet 网络的缺点
2.3 MobileNetV2
2.3.1 MobileNetV2 特点简介
2.3.2 MobileNetV2 网络结构
2.3.3 MobileNetV2 网络的参数量和计算量
2.3.4 MobileNetV2 网络的优点和缺点
2.3.4.1 MobileNetV2 网络的优点
2.3.4.2 MobileNetV2 网络的缺点
2.4 YOLOV2
2.4.1 YOLOV2 特点简介
2.4.1.1 使用 BN 层
2.4.1.2 高分辨率主干网络
2.4.1.3 Anchor Box 机制
2.4.1.4 全卷积网络结构
2.4.1.5 新的主干网络
2.4.1.6 特征金字塔网络
2.4.2 YOLOV2 训练过程
2.4.3 YOLOV2 的优缺点
2.4.3.1 YOLOV2 的主要优点
2.4.3.2 YOLOV2 的主要缺点
第 3 章 神经网络量化
3.1 对称量化与非对称量化
3.1.1 对称量化
3.1.1.1 对称量化基本原理
3.1.1.2 缩放因子的计算
3.1.1.3 反量化
3.1.1.4 量化误差
3.1.1.5 对称量化的优点
3.1.1.6 对称量化的局限性
3.1.1.7 代码展示
3.1.2 非对称量化
3.1.2.1 非对称量化基本原理
3.1.2.2 缩放因子的计算
3.1.2.3 零点的计算
3.1.2.4 反量化
3.1.2.5 量化误差
3.1.2.6 非对称量化的优点
3.1.2.7 非对称量化的局限性
3.1.2.8 代码展示
3.1.3 量化策略对比总结
3.2 训练后量化与感知量化
3.2.1 训练后量化
3.2.1.1 量化粒度
3.2.1.2 量化精度
3.2.1.3 训练后量化的基本步骤
3.2.1.4 训练后量化的优点和局限性
3.2.1.5 代码展示
3.2.2 感知量化
3.2.2.1 感知量化的基本步骤
3.2.2.2 感知量化的优点和局限性
3.2.2.3 代码展示
3.2.3 QAT 与 PTQ 对比总结
第 4 章 神经网络硬件加速理论
4.1 脉动阵列
4.1.1 脉动阵列的结构
、4.1.2 数据流
4.1.2.1 OS 数据流
4.1.2.2 WS 数据流
4.1.2.3 IS 数据流
4.1.3 脉动阵列的优点
4.2 基于卷积空间算法的硬件加速方法
4.2.1 循环展开
4.2.1.1 循环展开的原理与意义
4.2.1.2 卷积核维度上的循环展开(Loop1 和 Loop2)
4.2.1.3 特征图空间维度上的循环展开(Loop3 和 Loop4)
4.2.1.4 输入与输出通道维度上的循环展开(Loop5 和 Loop6)
4.2.1.5 循环展开策略的设计考虑
4.2.2 循环分块
4.2.3 循环交换
4.2.3.1 最大化数据复用
4.2.3.2 空间并行性
4.2.3.3 访存
4.3 屋顶模型理论
第 5 章 Vivado HLS 介绍
5.1 HLS 概述
5.1.1 HLS 的功能特点
5.1.2 HLS 的优势
5.1.3 术语说明
5.2 数据类型
5.2.1 标准 C 整数类型
5.2.2 任意精度类型
5.2.3 浮点类型
5.3 基本运算
5.3.1 算术运算符
5.3.2 算术赋值运算符
5.3.3 自增与自减运算符
5.3.4 条件与关系运算符
5.3.5 逻辑与位运算符
5.4 接口类型
5.5 循环优化
5.5.1 变量循环边界
5.5.2 循环流水线(LOOP PIPILINE)
5.5.2.1 流水线化 LOOP_J
5.5.2.2 流水线化 LOOP_I
5.5.2.3 流水线化顶层函数
- 机械工业出版社旗舰店 (微信公众号认证)
- 扫描二维码,访问我们的微信店铺
- 随时随地的购物、客服咨询、查询订单和物流...