机器学习与R语言(原书第4版)
作 者:(美)布雷特·兰茨(Brett Lantz) 著 著 卢浩 等译 译
定 价:149
出 版 社:机械工业出版社
出版日期:2026年01月01日
页 数:456
装 帧:平装
ISBN:9787111792758
目录
●译者序
前言
关于作者
关于审校者
第1章 机器学习概述1
1.1 机器学习起源1
1.2 机器学习的应用与滥用3
1.2.1 机器学习能做什么4
1.2.2 机器学习的局限性5
1.2.3 机器学习伦理6
1.3 机器如何学习8
1.3.1 数据存储9
1.3.2 抽象9
1.3.3 泛化11
1.3.4 评估12
1.4 机器学习实践13
1.4.1 输入数据类型13
1.4.2 机器学习算法分类15
1.4.3 选择合适的算法17
1.5 基于R语言的机器学习18
1.5.1 安装R软件包18
1.5.2 加载和卸载R软件包19
1.5.3 安装RStudio19
1.5.4 为何选择R语言20
1.6 小结21
第2章 管理与解读数据22
2.1 R语言中的数据结构22
2.1.1 向量23
2.1.2 因子24
2.1.3 列表26
2.1.4 数据框28
2.1.5 矩阵和数组30
2.2 管理数据32
2.2.1 保存、加载、删除数据结构32
2.2.2 从CSV文件导入和保存数据集33
2.2.3 用RStudio导入数据集34
2.3 探索和解读数据36
2.3.1 数据结构分析36
2.3.2 数值型特征分析37
2.3.3 类别型特征分析45
2.3.4 特征间的关系47
2.4 小结51
第3章 懒惰学习—最近邻分类52
3.1 最近邻分类52
3.1.1 k-NN算法53
3.1.2 何为“懒惰”算法58
3.2 示例:用k-NN算法诊断乳腺癌59
3.2.1 第1步:收集数据59
3.2.2 第2步:探索并准备数据59
3.2.3 第3步:训练模型63
3.2.4 第4步:评估模型性能64
3.2.5 第5步:优化模型性能65
3.3 小结67
第4章 概率学习—朴素贝叶斯分类69
4.1 朴素贝叶斯算法69
4.1.1 贝叶斯算法的基本概念70
4.1.2 朴素贝叶斯算法简介74
4.2 示例:用朴素贝叶斯算法过滤手机垃圾短信78
4.2.1 第1步:收集数据78
4.2.2 第2步:探索并准备数据79
4.2.3 第3步:训练模型91
4.2.4 第4步:评估模型性能92
4.2.5 第5步:优化模型性能93
4.3 小结94
第5章 分而治之—用决策树和规则分类95
5.1 决策树95
5.1.1 分而治之96
5.1.2 C5.0决策树算法99
5.2 示例:使用C5.0决策树识别高风险银行贷款101
5.2.1 第1步:收集数据102
5.2.2 第2步:探索并准备数据102
5.2.3 第3步:训练模型105
5.2.4 第4步:评估模型性能108
5.2.5 第5步:优化模型性能109
5.3 分类规则113
5.3.1 离而治之114
5.3.2 1R算法115
5.3.3 RIPPER算法116
5.3.4 决策树中的规则117
5.3.5 何为决策树和规则的贪婪118
5.4 示例:用规则学习器识别毒蘑菇119
5.4.1 第1步:收集数据120
5.4.2 第2步:探索并准备数据120
5.4.3 第3步:训练模型121
5.4.4 第4步:评估模型性能122
5.4.5 第5步:优化模型性能123
5.5 小结125
第6章 预测数值型数据—回归法126
6.1 回归126
6.1.1 简单线性回归128
6.1.2 普通最小二乘估计129
6.1.3 相关性131
6.1.4 多重线性回归132
6.1.5 广义线性模型与逻辑回归135
6.2 示例:用线性回归预测汽车保险理赔成本138
6.2.1 第1步:收集数据138
6.2.2 第2步:探索并准备数据139
6.2.3 第3步:训练模型143
6.2.4 第4步:评估模型性能146
6.2.5 第5步:优化模型性能147
6.2.6 更进一步:用逻辑回归预测保险客户流失152
6.3 回归树和模型树156
6.4 示例:用回归树和模型树评估葡萄酒的品质158
6.4.1 第1步:收集数据159
6.4.2 第2步:探索并准备数据159
6.4.3 第3步:训练模型161
6.4.4 第4步:评估模型性能164
6.4.5 第5步:优化模型性能165
6.5 小结168
第7章 黑盒法—神经网络和支持向量机169
7.1 神经网络169
7.1.1 从生物神经元到人工神经元170
7.1.2 激活函数171
7.1.3 网络拓扑结构173
7.1.4 用反向传播训练神经网络176
7.2 示例:用ANN对混凝土强度进行建模177
7.2.1 第1步:收集数据178
7.2.2 第2步:探索并准备数据178
7.2.3 第3步:训练模型179
7.2.4 第4步:评估模型性能181
7.2.5 第5步:优化模型性能182
7.3 支持向量机187
7.3.1 用超平面分类187
7.3.2 使用核函数处理非线性空间190
7.4 示例:使用SVM进行OCR识别191
7.4.1 第1步:收集数据192
7.4.2 第2步:探索并准备数据192
7.4.3 第3步:训练模型193
7.4.4 第4步:评估模型性能195
7.4.5 第5步:优化模型性能196
7.5 小结199
第8章 发掘模式—用关联规则进行购物篮分析200
8.1 关联规则200
8.1.1 Apriori算法201
8.1.2 衡量规则的兴趣度—支持度和置信度203
8.1.3 用先验原则建立规则203
8.2 示例:用关联规则识别热销商品204
8.2.1 第1步:收集数据205
8.2.2 第2步:探索并准备数据205
8.2.3 第3步:训练模型211
8.2.4 第4步:评估模型性能214
8.2.5 第5步:优化模型性能217
8.3 小结222
第9章 寻找数据分组—k均值聚类223
9.1 聚类223
9.1.1 基于聚类的机器学习224
9.1.2 聚类算法中的簇225
9.1.3 k均值聚类算法228
9.2 用k均值聚类找出青少年用户细分市场232
9.2.1 第1步:收集数据232
9.2.2 第2步:探索并准备数据233
……
内容介绍
R本身是一款十分优秀的数据分析和数据可视化软件。本书由机器学习领域的专家撰写,通过将实践案例与核心的理论知识相结合,全面介绍多种重要的机器学习算法,从对案例数据的探索、整理到模型的建立和模型的评估,每一步都给出详尽的步骤和R代码,为读者深入理解并灵活应用R语言进行数据挖掘和机器学习提供翔实参考。无论你是经验丰富的R语言用户还是初学者,作者都会教你如何进行数据预处理、发现关键见解、做出新的预测以及将结果可视化。这本书新增了机器学习成功之道、高级数据准备、构建更好的学习器以及利用大数据等章节,反映了机器学习在过去几年中取得的进步,帮助你掌握更多的数据科学技能,解决更具挑战性的问题。这本书已更新至 R语言4.2.2版,其中包含更新、更好的库,关于机器学习中的道德和偏见问题的建议以及深度学习方面的介绍。无论你是想迈出使用R进行机器学习的第一步,还是想确保技能和知识与时俱进,这本书都是不......
(美)布雷特·兰茨(Brett Lantz) 著 著 卢浩 等译 译
布雷特·兰茨(Brett Lantz),在应用创新的数据方法理解人类行为方面有近20年经验。作为一名科班出身的社会学家,他最初在研究一个包含青少年社交网络档案的大型数据库时,便对机器学习产生了浓厚兴趣。布雷特是DataCamp平台的讲师,曾在全球多地开展机器学习工作坊教学。他热衷于探索数据科学在体育、电子游戏、自动驾驶汽车、外语学习等多个领域的应用,并致力于在个人网站dataspelunking.com上就这些主题撰写文章分享见解。