万本电子书0元读

万本电子书0元读

顶部广告

大数据技术基础实验电子书

《大数据技术基础实验》是一本面向大数据处理的实验教材,旨在帮助学生从理论学习过渡到实际操作,*掌握大数据技术的实践应用。本书系统讲解了Spark、Storm、Flink等主流大数据处理框架的实践操作,涵盖了从大数据的存储(HDFS,HBase)到批处理、流处理全过程。

售       价:¥

纸质售价:¥54.50购买纸书

0人正在读 | 0人评论 6.8

作       者:欧中洪,朱一凡,等

出  版  社:电子工业出版社

出版时间:2026-07-01

字       数:8.1万

所属分类: 科技 > 计算机/网络 > 多媒体/数据通信

温馨提示:数字商品不支持退换货,不提供源文件,不支持导出打印

为你推荐

  • 读书简介
  • 目录
  • 累计评论(条)
  • 读书简介
  • 目录
  • 累计评论(条)
《大数据技术基础实验》是一本面向大数据处理的实验教材,旨在帮助学生从理论学习过渡到实际操作,全面掌握大数据技术的实践应用。本书系统讲解了Spark、Storm、Flink等主流大数据处理框架的实践操作,涵盖了从大数据的存储(HDFS,HBase)到批处理、流处理全过程。教材内容分为六章,每章围绕一个核心主题展。第一章介绍大数据技术的总体框架、大数据的处理流程和三大核心:HDFS、HBase和MapReduce,让读者从宏观上认识大数据技术。后四章围绕具体实操展,辅以具体命令和代码,系统介绍从存储――处理――分析的大数据技术全过程。简单说明如下:第二章聚焦于大数据技术的基础――数据存储,具体包括HDFS,HBase等组件的使用。第三章讨论批处理框架,介绍MapReduce、Spark引擎。第四章讨论流处理框架,介绍使用flume和kafka行数据收集和分发,使用storm等行流处理。第五章介绍分布式查询引擎Hive、Druid等的使用。第六章为大数据综合实验,通过实际案例让学生综合运用所学知识,完成数据全流程操作。<br/>【作者】<br/>欧中洪,北京邮电大学计算机学院(国家示范性软件学院)长聘教授、博士生导师,人事处副处长、人才办主任,国家重研发计划青年科学家,北京市青年教学名师。曾任计算机学院(国家示范性软件学院)副院长,现任教育部虚拟仿真实验教学创新联盟计算机类专委会主任、中国通信标准化协会TC11 VR/AR子工作组副组长、全国高等院校计算机基础教育研究会教育创新与产教融合专委会副主任,CCF教育专委会常务委员,中国人工智能学会智能服务专委会常务委员,CCF大数据/计算机视觉执行委员,中国互联网协会青年专家,CCF高级会员。主持科技创新2030-"新一代人工智能”重大项目等国家和省部级项目20余项,在IEEE TMC、TMM、TNNLS、TCC、ACM SenSys等发表高水平论文80余篇,研究成果曾被BBC News、ACM TechNews、The Register等20余家国际知名媒体报道,获得中国安全生产协会科技步一等奖、中国产学研合作创新与促奖等科技奖励多项。研究兴趣包括小样本学习、跨域自适应、小目标检测等。<br/>
目录展开

版权页

1.1 大数据简介:什么是“4V”

1.2 大数据处理流程:数据的奇妙冒险

1.3 大数据具体落地:怎么才算是美味

1.3.1 杭州城市大脑

1.3.2 京东销量预测

1.4 大数据核心组件:将会用到什么

1.4.1 大数据采集

1.4.2 大数据存储

1.4.3 大数据处理

1.4.4 大数据分析

1.5 总结

2.1 什么是Hadoop

2.1.1 Hadoop的诞生

2.1.2 什么是HDFS

2.2 HDFS:仓库管理员

2.2.1 部署HDFS集群

2.2.2 操作HDFS集群

2.2.3 HDFS存储文件机制

2.2.4 总结

2.3 ZooKeeper:分布式系统的协调者

2.3.1 ZooKeeper与HDFS

2.3.2 HA的背后原理

2.3.3 总结

2.4 HBase:一个NoSQL数据库

2.4.1 HBase介绍

2.4.2 部署HBase集群

2.4.3 HBase基础操作

2.4.4 Java API连接HBase

2.4.5 HBase背后的存储原理

2.5 总结

3.1 MapReduce介绍

3.1.1 MapReduce的历史地位

3.1.2 MapReduce的发展历程

3.1.3 MapReduce的编程思想

3.1.4 总结

3.2 Yarn:资源协调者

3.2.1 为什么需要Yarn

3.2.2 Yarn的思想

3.2.3 配置HA-Yarn

3.2.4 总结

3.3 MapReduce案例

3.3.1 准备数据集

3.3.2 创建项目,导入相关依赖

3.3.3 编写代码

3.3.4 运行作业

3.3.5 查看作业结果

3.3.6 总结

3.4 Spark介绍

3.4.1 提出Spark的原因

3.4.2 弹性分布式数据集(RDD)

3.4.3 Spark程序运行架构

3.4.4 总结

3.5 Spark案例

3.5.1 编写代码

3.5.2 提交Spark程序

3.6 总结

4.1 流处理/批处理区别:着急或不着急

4.1.1 流处理(Stream Processing)

4.1.2 批处理(Batch Processing)

4.1.3 流处理和批处理的区别

4.2 初步了解实时数据处理

4.2.1 Flume

4.2.2 Kafka

4.2.3 Storm

4.3 数据收集与分发:井然有序的数据传输线

4.3.1 Flume

4.3.2 Kafka

4.3.3 Flume与Kafka整合

4.4 数据流处理

4.4.1 Storm及其安装配置

4.4.2 Flume+Kafka+Storm+HBase整合

4.5 其他常见流处理框架

4.5.1 Spark Streaming(Spark流处理)

4.5.2 Flink

4.6 总结

5.1 Hive介绍

5.1.1 Hive的历史

5.1.2 总结

5.2 Hive实践

5.2.1 Hive安装

5.2.2 Hive的基本操作

5.2.3 总结

5.3 Hive进阶实践

5.3.1 Hive中的表类型

5.3.2 使用JavaAPI连接Hive

5.3.3 Spark SQL

5.3.4 总结

5.4 其他常见的数据仓库

5.5 总结

6.1 电影评论情感倾向与用户评价关联性初探

6.1.1 实验背景

6.1.2 实验准备

6.1.3 正式开始实验

6.1.4 执行程序并分析结果

6.2 网站日志信息处理案例

6.2.1 实验背景

6.2.2 实验准备

6.2.3 正式开始实验

6.3 总结

附录A 本书GitHub仓库的说明

附录B 本书所用服务器配置信息

附录C 节点在集群中的分布情况

累计评论(条) 个书友正在讨论这本书 发表评论

发表评论

发表评论,分享你的想法吧!

买过这本书的人还买过

读了这本书的人还在读

回顶部