商品详情

前言
在人工智能浪潮席卷全球的今天,计算机视觉作为该领域最具活力的分支之一,正凭借其对图像和视频数据的智能解析能力,深度融入医疗健康、智能安防、自动驾驶、工业检测等关键领域,成为连接虚拟世界与物理现实的核心桥梁。然而,面对庞杂的理论体系、飞速迭代的框架工具与复杂多变的工程实践,初学者往往面临 “入门难、实践难、落地更难” 的挑战。
本书正是为突破这些壁垒而精心编写的计算机视觉全流程学习指南。我们力求以 “全流程贯通、理论实践并重” 理念,构建系统性与实用性兼具的知识体系。无论是简单入门的 AI 爱好者、工程技术从业者,还是深耕算法研究的科研人员,都能在本书找到从知识学习到工程落地的完整路径。
本书以 “从基础到部署” 为主线,串联计算机视觉技术的发展脉络与核心模块,实现从理论到实践的闭环,秉持 “理论引导 十 实践驱动” 理念,配套数学推导、代码实现与案例解析,覆盖模型训练、推理、部署等关键环节,帮助读者实现真正意义上的 “学以致用”。具体内容安排如下。
第 1 章:从技术发展脉络切入,梳理计算机视觉的发展历程,解析图像分类、目标检测、目标跟踪、语义分割、实例分割等核心任务的原理与应用场景,并结合 Paper with Code、arXiv 等前沿资源,帮助读者建立领域宏观认知。
第 2 章:聚焦深度学习环境安装,涵盖 Python、CUDA、PyTorch 等关键工具链,提供 Windows 与 Linux 系统下的操作指南及常见问题解决方案,助力读者迈出实战第一步。
第 3 章:系统讲解神经网络基础原理,从梯度下降、卷积操作到注意力机制等前沿架构,结合数学推导与代码实例,厘清模型设计的底层逻辑,使读者 “知其然,更知其所以然”。
第 4 章:深入讲解数据工程全流程,包括数据标注、数据增强、归一化、数据集划分及模型评估(如准确率、F1_score、ROC 曲线等),解析 COCO、ImageNet 等常用数据集特点,引导读者建立科学的数据处理与评估思维。
第 5 章:系统解析 LeNet_5、VGGNet、ResNet 等经典分类网络的架构设计思想与演进路径,帮助读者掌握卷积神经网络的基础范式与优化脉络。
第 6 章:聚焦目标检测算法,系统讲解 R_CNN 系列、SSD、YOLOv1/v2、RetinaNet 等经典模型,覆盖两阶段、单阶段检测及损失函数优化等核心技术,分析算法的速度与精度平衡策略。
第 7 章:详解语义分割技术,包括从传统方法到 FCN、DeepLab 系列、SegNet、UNet 等深度学习模型,解析像素级分类的关键技术。
第 8 章:深度解析从 YOLOv3 至 YOLOv11 系列模型,逐代对比特征金字塔、锚框机制、动态标签分配等模型优化策略,配套训练推理流程与实战演示,突出其实战性与工程化价值。
第 9 章:聚焦模型部署技术,包括 ONNX 转换、模型量化与加密打包,覆盖 CPU、GPU、边缘设备等多平台部署策略,打通算法落地 “最后一公里”,实现学以致用。
第 10 章:结合安全帽检测和人脸识别签到的实战项目,演示从数据准备、模型训练到部署验证的全流程,提供可直接复用的工程模板与案例,助力读者实现 “从代码到应用” 的能力跃迁。
每章均配备实践与练习环节,鼓励读者通过动手操作加深理解。完整的项目案例(如 YOLOv5 全流程开发、人脸识别系统搭建等)为读者提供了可复用的工程模板。各章节配有可运行的代码与详细注释,全书代码与项目资源可扫描以下本书资源二维码下载。
在写作过程中,我们始终怀揣对知识的敬畏与对读者的责任,力求内容准确、逻辑清晰、浅显易懂。感谢开源社区的贡献者,正是他们的共享精神加速了技术传播的效率;感谢所有参与本书校对与反馈的朋友,是你们的专业能力让本书不断完善;更要感谢每一位选择本书的读者,你们的信任是我们持续前行的动力。由于计算机视觉技术发展迅猛,书中难免存在不足,诚邀读者提出宝贵意见(可扫描技术支持二维码联系),共同打磨这本学习指南。
愿本书成为你开启计算机视觉之门的钥匙,在探索人工智能奥秘的旅程中,既能领略理论的宏伟架构,也能体会动手创造的喜悦。让我们以代码为笔,以数据为墨,在智能时代书写属于自己的技术篇章。
叶汇贤
2026 年 3 月
《AI全栈开发新范式:全场景效能跃迁手册》以“从基础到部署”为清晰主线,系统拆解计算机视觉全流程知识,从神经网络、数据工程到前沿算法,再到模型训练、推理与落地部署,形成完整学习闭环。书中理论讲解透彻、代码案例丰富,遵循由浅入深、知其然更知其所以然的学习逻辑,帮助读者真正打通“理论、代码、部署”全链路。无论是入门自学还是职场进阶,都能为计算机视觉学习者与算法工程师提供扎实、实用的成长路径。
《AI全栈开发新范式:全场景效能跃迁手册》以“从基础到部署”为主线,全面且系统地介绍计算机视觉相关技术旨在帮助读者本书以“从基础到部署”为主线,全面且系统地介绍计算机视觉相关技术旨在帮助读者本书以“从基础到部署”为主线,全面且系统地介绍计算机视觉相关技术旨在帮助读者本书以“从基础到部署”为主线,全面且系统地介绍计算机视觉相关技术旨在帮助读者本书以“从基础到部署”为主线,全面且系统地介绍计算机视觉相关技术旨在帮助读者构建完整的理论与实践体系。本书内容涵盖神经网络基础、数据工程典前沿视觉算法,构建完整的理论与实践体系。本书内容涵盖神经网络基础、数据工程典前沿视觉算法,构建完整的理论与实践体系。本书内容涵盖神经网络基础、数据工程典前沿视觉算法,构建完整的理论与实践体系。本书内容涵盖神经网络基础、数据工程典前沿视觉算法,构建完整的理论与实践体系。本书内容涵盖神经网络基础、数据工程典前沿视觉算法,构建完整的理论与实践体系。本书内容涵盖神经网络基础、数据工程典前沿视觉算法,构建完整的理论与实践体系。本书内容涵盖神经网络基础、数据工程典前沿视觉算法,以及模型训练、推理和部署等全流程环节,完整展示了从数据准备到的闭。每以及模型训练、推理和部署等全流程环节,完整展示了从数据准备到的闭。每以及模型训练、推理和部署等全流程环节,完整展示了从数据准备到的闭。每以及模型训练、推理和部署等全流程环节,完整展示了从数据准备到的闭。每章内容不仅包括深入的算法解析,还配有丰富实验代码。本书各章节均按照“知其然,所以”的理念进行构建由浅入深、循序渐地带领本书各章节均按照“知其然,所以”的理念进行构建由浅入深、循序渐地带领本书各章节均按照“知其然,所以”的理念进行构建由浅入深、循序渐地带领本书各章节均按照“知其然,所以”的理念进行构建由浅入深、循序渐地带领本书各章节均按照“知其然,所以”的理念进行构建由浅入深、循序渐地带领读者学习,使其能扎实掌握核心理念并在际工作中灵活运用。本书适合计算机、人工智能自动化等相关专业的科生研究及希望系统入门本书适合计算机、人工智能自动化等相关专业的科生研究及希望系统入门本书适合计算机、人工智能自动化等相关专业的科生研究及希望系统入门本书适合计算机、人工智能自动化等相关专业的科生研究及希望系统入门视觉领域的自学者,也适用于职场中计算机视工程师、觉领域的自学者,也适用于职场中计算机视工程师、AI算法工程师、图像处理等算法工程师、图像处理等技术从业者,还能满足有一定深度学习基础、想入掌握视觉算法核心并打通“理论解析技术从业者,还能满足有一定深度学习基础、想入掌握视觉算法核心并打通“理论解析技术从业者,还能满足有一定深度学习基础、想入掌握视觉算法核心并打通“理论解析技术从业者,还能满足有一定深度学习基础、想入掌握视觉算法核心并打通“理论解析技术从业者,还能满足有一定深度学习基础、想入掌握视觉算法核心并打通“理论解析_代码实现_场景部署”全链路的进阶学习者。
叶汇贤,博士,广东省高级职称—高级工程师,长期从事人工智能深度学习产品与算法研发,尤其擅长计算机视觉二维和三维算法的研究与应用,精通数字人和大模型算法的设计与实现。拥有丰富的全栈开发经验,能够将先进的算法成功产品化并落地应用。还具备出色的团队建设与管理能力,曾带领并扩展多个项目团队,实现了从研发到产品化的全流程管理与执行。在专利申请与学术研究方面,已发表学术论文10篇;拥有40余项专利,其中包括2项PCT国际专利,授权专利超过20项。2024年1月,本人出版了《人工智能点云处理及深度学习算法》一书,出版社为北京航空航天大学出版社。现任广州美央创新科技有限公司(AIMIRA)高级算法专家,主要负责算法研发和技术管理,专注于人工智能领域计算机视觉二维、三维算法以及数字人和大模型算法的开发。AIMIRA是一家领先的高端医疗科技公司,致力于通过人工智能和深度学习技术革新抗衰老医学领域的诊疗方法,提供更为安全高效的治疗方案。在科学研究工作方面,于浙江省之江实验室(人工智能国家实验室)工作一年,参与场景文本理解算法和智能计算育种计算平台课题研究,针对性地提出一种新型基于关键点的表型检测算法,并且已完成算法设计与验证测试。此外,参与申报了2020~2021年度广东省重点领域研发计划“新一代人工智能”重大专项——基于Atlas计算平台生态创新协同技术研究及应用。
目录
第 1 章 技术发展背景1
1.1 计算机视觉发展简介1
1.2 计算机视觉常见任务5
1.2.1 图像分类5
1.2.2 目标检测6
1.2.3 目标跟踪7
1.2.4 语义分割7
1.2.5 实例分割8
1.2.6 关键点检测9
1.2.7 图像生成10
1.2.8 图像去噪11
1.2.9 三维视觉12
1.3 最新进展与研究方向13
1.3.1 Paper with Code13
1.3.2 顶级会议15
1.3.3 顶级期刊16
1.3.4 arXiv16
1.4 实践与练习17
第 2 章 深度学习环境安装18
2.1 Python 环境安装18
2.1.1 Miniconda 安装18
2.1.2 常用 Conda 命令19
2.2 Python IDE 与调试20
2.2.1 Visual Studio Code20
2.2.2 程序调试22
2.3 CUDA 安装24
2.3.1 Windows CUDA Toolkit 安装26
2.3.2 Linux CUDA ToolKit 安装28
2.4 cuDNN 安装29
2.4.1 Windows cuDNN 安装32
2.4.2 Linux cuDNN 安装33
2.5 PyTorch 介绍与安装36
2.5.1 核心特性36
2.5.2 安装方式37
2.5.3 模块组件39
2.6 实践与练习44
第 3 章 神经网络基础原理45
3.1 基础知识45
3.1.1 梯度下降45
3.1.2 链式法则47
3.1.3 梯度消失与爆炸49
3.2 感知机51
3.2.1 感知机的组成51
3.2.2 感知机的工作原理52
3.2.3 感知机的作用与局限性53
3.3 卷积神经网络54
3.3.1 全连接层54
3.3.2 卷积层55
3.3.3 模型资源与计算复杂度58
3.3.4 池化层62
3.3.5 激活函数63
3.3.6 损失函数67
3.3.7 训练方法70
3.3.8 优化器72
3.3.9 正则化74
3.3.10 卷积神经网络示例76
3.3.11 模型保存与加载79
3.3.12 模型结构可视化82
3.4 循环神经网络87
3.5 注意力机制88
3.6 生成对抗网络91
3.7 扩散模型93
3.8 实践与练习94
第 4 章 数据工程96
4.1 有监督学习96
4.2 无监督学习98
4.3 数据标注102
4.3.1 图像分类103
4.3.2 目标检测103
4.3.3 语义分割106
4.3.4 标注工具107
4.3.5 半自动标注108
4.3.6 质量控制109
4.4 数据增强110
4.4.1 数据增强的作用110
4.4.2 基本几何变换112
4.4.3 颜色变换117
4.4.4 噪声注入119
4.4.5 Mixup 和 Cutout120
4.4.6 马赛克增强121
4.4.7 深度学习增强123
4.4.8 AutoAugment124
4.4.9 Albumentations 增强库125
4.5 归一化127
4.5.1 输入数据归一化128
4.5.2 批归一化129
4.5.3 层归一化130
4.5.4 实例归一化131
4.5.5 组归一化131
4.6 数据集划分132
4.6.1 数据集类别132
4.6.2 划分方式133
4.7 模型评估134
4.7.1 准确率134
4.7.2 精确率、召回率和 F1_score135
4.7.3 ROC 曲线和 AUC 值136
4.7.4 平均精度137
4.7.5 交并比138
4.7.6 混淆矩阵140
4.7.7 Top_k 准确率141
4.7.8 对数损失141
4.8 常用数据集142
4.8.1 MNIST 数据集143
4.8.2 CIFAR_10 和 CIFAR_100 数据集145
4.8.3 ImageNet 数据集147
4.8.4 COCO 数据集150
4.8.5 COCO128 数据集153
4.8.6 PASCAL VOC 数据集153
4.8.7 LFW 数据集153
4.8.8 Cityscapes 数据集154
4.8.9 Open Images 数据集154
4.9 实践与练习155
第 5 章 基础神经网络156
5.1 LeNet_5156
5.2 AlexNet162
5.3 VGGNet167
5.4 GoogLeNet171
5.5 ResNet177
5.6 DenseNet181
5.7 MobileNet185
5.7.1 MobileNet 概述185
5.7.2 MobileNet 系列的迭代升级188
5.8 ShuffleNet190
5.9 EfficientNet193
5.10 实践与练习197
第 6 章 目标检测算法198
6.1 R_CNN 系列199
6.1.1 候选区域生成199
6.1.2 特征提取与分类回归200
6.1.3 Fast R_CNN203
6.1.4 Faster R_CNN215
6.2 SSD230
6.2.1 模型结构230
6.2.2 Anchor 设计234
6.2.3 损失函数236
6.3 YOLO238
6.3.1 模型结构238
6.3.2 损失函数与推理示例240
6.3.3 YOLOv2 优化243
6.4 RetinaNet: Focal Loss245
6.4.1 模型结构246
6.4.2 损失函数与推理示例252
6.5 EfficientDet254
6.6 未来方向与挑战258
6.7 实践与练习260
第 7 章 语义分割技术261
7.1 早期语义分割方法261
7.2 FCN263
7.3 DeepLab 系列272
7.3.1 DeepLab v1272
7.3.2 DeepLab v2276
7.3.3 DeepLab v3278
7.3.4 DeepLab v3十281
7.4 SegNet285
7.5 UNet288
7.6 注意力机制与 Transformer292
7.7 轻量级模型与高效计算292
7.8 未来发展方向与挑战293
7.9 实践与练习294
第 8 章 YOLO 目标检测295
8.1 YOLOv3295
8.2 YOLOv4300
8.2.1 模型结构300
8.2.2 Mish 激活函数306
8.2.3 CIoU307
8.2.4 DropBlock309
8.2.5 CmBN309
8.2.6 损失函数310
8.2.7 总结311
8.3 YOLOv5312
8.3.1 数据增强312
8.3.2 模型结构315
8.3.3 损失函数319
8.3.4 官方程序325
8.3.5 训练流程与技巧326
8.3.6 模型推理327
8.3.7 总结327
8.4 YOLOX328
8.4.1 模型结构328
8.4.2 Anchor_free 机制330
8.4.3 SimOTA 动态标签分配332
8.4.4 性能表现334
8.5 YOLOv6334
8.6 YOLOv7338
8.6.1 运行程序339
8.6.2 模型结构与 ELAN340
8.6.3 重新参数化351
8.6.4 coarse_to_fine 结构352
8.7 YOLOv8355
8.8 YOLOv9359
8.9 YOLOv10369
8.9.1 模型架构优化369
8.9.2 NMS_free 后处理377
8.10 YOLOv11379
8.11 YOLO 系列总结386
8.12 实践与练习387
第 9 章 模型部署技术389
9.1 模型部署389
9.1.1 模型部署的意义389
9.1.2 部署平台391
9.1.3 硬件环境394
9.1.4 软件环境396
9.1.5 模型优化398
9.2 模型转换398
9.2.1 ONNX 背景398
9.2.2 ONNX 使用399
9.2.3 ONNX Optimizer403
9.3 模型量化405
9.3.1 量化背景405
9.3.2 常见量化方法407
9.3.3 PyTorch 量化409
9.3.4 ONNX 量化414
9.4 模型加密417
9.5 模型打包部署419
9.6 实践与练习421
第 10 章 实验课程422
10.1 安全帽检测模型422
10.1.1 数据集制作422
10.1.2 模型训练432
10.1.3 模型转换436
10.1.4 模型量化440
10.1.5 模型加密448
10.1.6 打包与解压456
10.1.7 部署验证457
10.2 业务应用:人脸识别签到461
10.2.1 基本流程462
10.2.2 人脸注册462
10.2.3 人脸检测与识别463
10.2.4 Web 界面搭建464
10.2.5 完整程序465
10.3 实践与练习471
- 新华一城书集 (微信公众号认证)
- 上海新华书店官方微信书店
- 扫描二维码,访问我们的微信店铺
- 随时随地的购物、客服咨询、查询订单和物流...