1.Norman Matloff为畅销书作者,《R语言编程艺术》卷销量12000+,著有多本数据科学的图书。 2.两大特:“不涉及高等数学的机器学习”和“算法+数据+R语言”。 3.数十个运用真实数据集的说明性示例。
售 价:¥
纸质售价:¥63.00购买纸书
6.6
温馨提示:数字商品不支持退换货,不提供源文件,不支持导出打印
为你推荐

版 权 声 明
内 容 提 要
关 于 作 者
关于技术审稿人
致 谢
前 言
什么是机器学习
数学在机器学习理论和实践中担负的角色
为什么要阅读本书
反复出现的主题和章节
所需背景
“qe”系列软件
本书架构
补充说明
资源与支持
资源获取
提交勘误
与我们联系
关于异步社区和异步图书
第1部分 序言与基于近邻的方法
第1章 回归模型
1.1 示例:共享单车数据集
1.1.1 载入数据
1.1.2 未来前瞻
1.2 机器学习与预测
1.2.1 预测过去、现在和未来
1.2.2 对比统计学中的预测与机器学习中的预测
1.3 k近邻算法简介
1.3.1 使用k近邻算法预测单车骑行量
1.4 虚拟变量与分类变量
1.5 使用qeKNN()进行分析
1.5.1 利用qeKNN()预测骑行量
1.6 回归函数:机器学习的基础
1.7 偏差-方差权衡
1.7.1 选举投票类比
1.7.2 回到机器学习
1.8 示例:mlb数据集
1.9 k近邻算法与分类特征
1.10 归一化
1.11 选择超参数
1.11.1 对训练数据进行预测
1.12 留出集
1.12.1 损失函数
1.12.2 “qe”系列函数中的留出集
1.12.3 使用交叉验证法的动机
1.12.4 超参数、数据集大小与特征数量
1.13 陷阱:p值篡改与超参数的选择
1.14 陷阱:数据中的长期时间趋势
1.15 陷阱:脏数据
1.16 陷阱:数据缺失
1.17 直接使用k近邻算法的代码
1.18 结论
第2章 分类模型
2.1 分类是回归的特例
2.2 示例:电信用户流失数据集
2.2.1 陷阱:R因子数据误读为非因子类型
2.2.2 陷阱:保留无用特征
2.2.3 处理空值
2.2.4 应用k近邻算法
2.2.5 陷阱:过多类别的特征造成过拟合
2.3 示例:脊椎病数据集
2.3.1 分析
2.4 陷阱:利用特征只能小幅降低错误率
2.5 混淆矩阵
2.6 清除混乱:不平衡数据
2.6.1 示例:Kaggle预约数据集
2.6.2 处理不平衡数据的更好方法
2.7 受试者操作特征曲线与曲线下面积
2.7.1 ROC与AUC的细节
2.7.2 qeROC()函数
2.7.3 示例:电信用户流失数据
2.7.4 示例:脊椎病数据
2.7.5 陷阱:过度依赖AUC
2.8 结论
第3章 偏差、方差、过拟合与交叉验证
3.1 过拟合与欠拟合
3.1.1 特征数量与过拟合的关系
3.1.2 与总体数据集大小的关系
3.1.3 最佳的k值和p值分别是多少
3.2 交叉验证
3.2.1 K折交叉验证法
3.2.2 使用replicMeans()函数
3.2.3 示例:程序员与工程师数据集
3.2.4 三重交叉验证
3.3 结论
第4章 处理大量特征
4.1 陷阱:大规模数据集的计算困境
4.2 维数约简简介
4.2.1 示例:百万歌曲数据集
4.2.2 降维的需求
4.3 降维方法
4.3.1 合并与嵌入
4.3.2 所有可能子集法
4.3.3 主成分分析
4.3.4 但我们现在有两个超参数了
4.3.5 使用qePCA()封装器
4.3.6 主成分与偏差-方差权衡
4.4 维数灾难
4.5 维数约简的其他方法
4.5.1 按条件独立性排列特征
4.5.2 统一流形逼近与投影
4.6 在计算中更进一步
4.7 结论
第2部分 基于树的方法
第5章 比kNN算法更进一步:决策树
5.1 决策树的基础知识
5.2 qeDT()函数
5.2.1 查看图形
5.3 示例:纽约出租车数据集
5.3.1 陷阱:过多因子等级的组合
5.3.2 基于树的分析
5.4 示例:森林覆盖数据集
5.5 决策树的超参数:如何分割节点
5.6 qeDT()函数的超参数
5.7 结论
第6章 对树的调整
6.1 偏差与方差、装袋与提升
6.2 bagging:通过重采样创建新树
6.2.1 随机森林
6.2.2 qeRF()函数
6.2.3 示例:脊椎病数据
6.2.4 示例:遥感土壤分析
6.3 boosting:反复对树进行调整
6.3.1 实现:AdaBoost
6.3.2 梯度提升
6.3.3 呼叫网络监控
6.3.4 示例:脊椎病数据
6.3.5 boosting方法中的偏差与方差
6.3.6 计算速度
6.3.7 其他超参数
6.3.8 学习率
6.4 陷阱:“没有免费的午餐”
第7章 找一组好的超参数
7.1 超参数的组合
7.2 利用qeFT()进行网格搜索
7.2.1 如何调用qeFT()
7.3 示例:程序员与工程师数据(一)
7.3.1 置信区间
7.3.2 从网格搜索学到了什么
7.4 示例:程序员与工程师数据(二)
7.5 示例:音位数据集
7.6 结论
第3部分 基于线性关系的方法
第8章 参数化方法
8.1 引例:棒球球员数据
8.1.1 引导直觉的图像
8.1.2 降维的视角
8.2 lm()函数
8.3 “qe”系列函数中的lm()封装器:qeLin()
8.4 使用多个特征
8.4.1 示例:棒球球员数据(续)
8.4.2 β记号
8.4.3 示例:爱彼迎(Airbnb)数据
8.4.4 应用线性模型
8.5 降维
8.5.1 哪些特征更重要
8.5.2 统计显著性与降维
8.6 最小二乘法与残差
8.7 诊断:线性模型有效吗
8.7.1 精确性
8.7.2 诊断方法
8.8 R2
8.9 分类应用:逻辑斯谛模型
8.9.1 glm()与qeLogit()函数
8.9.2 示例:电信用户流失数据
8.9.3 多分类问题
8.9.4 跌倒检测数据集
8.10 线性模型和广义线性模型的偏差与方差
8.10.1 示例:共享单车数据
8.11 多项式模型
8.11.1 动机
8.11.2 利用线性模型对非线性关系建模
8.11.3 多项式逻辑斯谛回归
8.11.4 示例:程序员与工程师工资
8.12 将线性模型与其他方法混合
8.13 qeCompare()函数
8.13.1 多项式模型的注意事项
8.14 下一步
第9章 缩小规模:正则化
9.1 动机
9.2 向量的长度
9.3 岭回归与LASSO回归
9.3.1 工作原理
9.3.2 偏差-方差权衡,避免过拟合
9.3.3 λ、n和p之间的关系
9.3.4 对比岭回归与LASSO回归
9.4 软件
9.5 示例:纽约出租车数据
9.6 示例:爱彼迎数据
9.7 示例:非洲土壤数据
9.7.1 LASSO分析
9.8 选读:著名的LASSO图
9.9 后续章节
第4部分 基于划分直线与平面的方法
第10章 边界方法:支持向量机
10.1 动机
10.1.1 示例:森林覆盖数据集
10.2 直线、平面与超平面
10.3 数学记号
10.3.1 向量表达式
10.3.2 点积
10.3.3 作为参数模型的SVM
10.4 SVM:基本思路——可分情形
10.4.1 示例:鸢尾花数据集
10.4.2 最优化准则
10.5 主要问题:不具有线性可分性
10.5.1 应用“核函数”
10.5.2 软间隔
10.6 示例:森林覆盖数据
10.7 核技巧是什么
10.8 “警告:迭代次数已达上限”
10.9 小结
第11章 针对类固醇的线性模型:神经网络
11.1 概述
11.2 在复杂结构的基础上工作
11.3 示例:脊椎病数据
11.4 神经网络的超参数
11.5 激活函数
11.6 正则化
11.6.1 L1与L2正则化
11.6.2 通过随机失活实现正则化
11.7 示例:跌倒检测数据
11.8 陷阱:收敛问题
11.9 与多项式回归的密切联系
11.10 神经网络的偏差与方差
11.11 讨论
第5部分 应 用
第12章 图像分类
12.1 示例:时装MNIST数据集
12.1.1 使用logit模型的尝试
12.1.2 利用PCA进行优化
12.2 卷积模型
12.2.1 对局部认知的需求
12.2.2 卷积方法概述
12.2.3 图块划分
12.2.4 卷积操作
12.2.5 池化操作
12.2.6 不同层之间的尺寸变化
12.2.7 随机失活
12.2.8 尺寸变化小结
12.2.9 平移不变性
12.3 诀窍
12.3.1 数据增强
12.3.2 预训练网络
12.4 还有过拟合问题呢
12.5 结论
第13章 处理时间序列与文本数据
13.1 将时间序列数据转换为常规形式
13.1.1 小例子
13.1.2 regtools函数TStoX()
13.2 qeTS()函数
13.3 示例:天气数据
13.4 偏差与方差
13.5 文本应用
13.5.1 词袋模型
13.5.2 qeText()函数
13.5.3 示例:测验数据
13.5.4 示例:AG新闻数据
13.6 小结
附 录
附录A 缩写与符号清单
附录B 统计学与机器学习术语对照表
附录C 矩阵、数据框与因子转换
C.1 矩阵
C.2 转换:R因子与虚拟变量的转换、数据框与矩阵的转换
附录D 陷阱:当心“p值篡改”
买过这本书的人还买过
读了这本书的人还在读
同类图书排行榜