为你推荐

版权页
1.1 大数据简介:什么是“4V”
1.2 大数据处理流程:数据的奇妙冒险
1.3 大数据具体落地:怎么才算是美味
1.3.1 杭州城市大脑
1.3.2 京东销量预测
1.4 大数据核心组件:将会用到什么
1.4.1 大数据采集
1.4.2 大数据存储
1.4.3 大数据处理
1.4.4 大数据分析
1.5 总结
2.1 什么是Hadoop
2.1.1 Hadoop的诞生
2.1.2 什么是HDFS
2.2 HDFS:仓库管理员
2.2.1 部署HDFS集群
2.2.2 操作HDFS集群
2.2.3 HDFS存储文件机制
2.2.4 总结
2.3 ZooKeeper:分布式系统的协调者
2.3.1 ZooKeeper与HDFS
2.3.2 HA的背后原理
2.3.3 总结
2.4 HBase:一个NoSQL数据库
2.4.1 HBase介绍
2.4.2 部署HBase集群
2.4.3 HBase基础操作
2.4.4 Java API连接HBase
2.4.5 HBase背后的存储原理
2.5 总结
3.1 MapReduce介绍
3.1.1 MapReduce的历史地位
3.1.2 MapReduce的发展历程
3.1.3 MapReduce的编程思想
3.1.4 总结
3.2 Yarn:资源协调者
3.2.1 为什么需要Yarn
3.2.2 Yarn的思想
3.2.3 配置HA-Yarn
3.2.4 总结
3.3 MapReduce案例
3.3.1 准备数据集
3.3.2 创建项目,导入相关依赖
3.3.3 编写代码
3.3.4 运行作业
3.3.5 查看作业结果
3.3.6 总结
3.4 Spark介绍
3.4.1 提出Spark的原因
3.4.2 弹性分布式数据集(RDD)
3.4.3 Spark程序运行架构
3.4.4 总结
3.5 Spark案例
3.5.1 编写代码
3.5.2 提交Spark程序
3.6 总结
4.1 流处理/批处理区别:着急或不着急
4.1.1 流处理(Stream Processing)
4.1.2 批处理(Batch Processing)
4.1.3 流处理和批处理的区别
4.2 初步了解实时数据处理
4.2.1 Flume
4.2.2 Kafka
4.2.3 Storm
4.3 数据收集与分发:井然有序的数据传输线
4.3.1 Flume
4.3.2 Kafka
4.3.3 Flume与Kafka整合
4.4 数据流处理
4.4.1 Storm及其安装配置
4.4.2 Flume+Kafka+Storm+HBase整合
4.5 其他常见流处理框架
4.5.1 Spark Streaming(Spark流处理)
4.5.2 Flink
4.6 总结
5.1 Hive介绍
5.1.1 Hive的历史
5.1.2 总结
5.2 Hive实践
5.2.1 Hive安装
5.2.2 Hive的基本操作
5.2.3 总结
5.3 Hive进阶实践
5.3.1 Hive中的表类型
5.3.2 使用JavaAPI连接Hive
5.3.3 Spark SQL
5.3.4 总结
5.4 其他常见的数据仓库
5.5 总结
6.1 电影评论情感倾向与用户评价关联性初探
6.1.1 实验背景
6.1.2 实验准备
6.1.3 正式开始实验
6.1.4 执行程序并分析结果
6.2 网站日志信息处理案例
6.2.1 实验背景
6.2.2 实验准备
6.2.3 正式开始实验
6.3 总结
附录A 本书GitHub仓库的说明
附录B 本书所用服务器配置信息
附录C 节点在集群中的分布情况
买过这本书的人还买过
读了这本书的人还在读
同类图书排行榜