《自己动手做大数据系统》内容简介与阅读建议

获取这本书 暂无已核验电子书资源
下载
分类
科技技术
出版年份
2016
出版社
电子工业出版社
页数
248 页
语言
中文

《自己动手做大数据系统》内容简介

如果你是一位在校大学生,对大数据感兴趣,也知道使用的企业越来越多,市场需求更是日新月异,但苦于自己基础不够,心有余而力不足;也看过不少大数据方面的书籍、博客、视频等,但感觉进步不大;如果你是一位在职人员,但目前主要使用传统技术,虽然对大数据很有兴趣,也深知其对未来的影响,但因时间不够,虽有一定的基础,常常也是打两天鱼、晒三天网,进展不是很理想。如果你有上述疑惑或遇到相似问题,本书正好比较适合你。本书从OpenStack云平台搭建、软件部署、需求开发实现到结果展示,以纵向角度讲解了生产性大数据项目上线的整个流程;以完成一个实际项目需求贯穿各章节,讲述了Hadoop生态圈中互联网爬虫技术、Sqoop、Hive、HBase组件协同工作流程,并展示了Spark计算框架、R制图软件和SparkRHive组件的使用方法。本书的一大特色是提供了实际操作环境,用户可以在线登录云平台来动手操作书中的数据和代码,登录网址请参考http://www.feiguyun.com/support。

《自己动手做大数据系统》书籍信息摘要

《自己动手做大数据系统》内容简介与阅读建议,作者 张魁/张粤磊/刘未昕/吴茂贵,科技技术,2016年。获取前建议核对作者、出版社、年份、ISBN、版本和正版渠道。相关主题:大数据、计算机类。

《自己动手做大数据系统》适合哪些读者?

适合希望系统学习技术概念、实践方法、工具使用和行业知识的读者。

获取建议

《自己动手做大数据系统》怎么获取更合适?

优先确认版本和阅读目的;下载区只展示已核验的公版、授权、开放许可或官方试读资源。

下载

暂无已核验电子书资源;本站不展示未授权完整文件。

下载

版本

优先选择作者、译者、出版社、出版年份和 ISBN 信息明确的版本;经典作品可优先选择校注、导读或权威出版社版本。

目录

  1. 目 录
  2. 第1章 为什么要自己动手做大数据系统 1
  3. 1.1 大数据时代 1
  4. 1.2 实战大数据项目 2
  5. 1.3 大数据演练平台 2
  6. 第2章 项目背景及准备 4
  7. 2.1 项目背景 4
  8. 2.2 项目简介 4
展开全部(共 129 章节)
  1. 2.3 项目架构 4
  2. 2.4 操作系统 5
  3. 2.5 数据存储 7
  4. 2.6 数据处理 8
  5. 2.7 开发工具 9
  6. 2.8 调试工具 10
  7. 2.9 版本管理 10
  8. 第3章 大数据环境搭建和配置 11
  9. 3.1 各组件功能说明 11
  10. 3.1.1 各种数据源的采集工具 12
  11. 3.1.2 企业大数据存储工具 12
  12. 3.1.3 企业大数据系统的数据仓库工具 12
  13. 3.1.4 企业大数据系统的分析计算工具 13
  14. 3.1.5 企业大数据系统的数据库工具 13
  15. 3.2 大数据系统各组件安装部署配置 13
  16. 3.2.1 安装的前期准备工作 13
  17. 3.2.2 Hadoop基础环境安装及配置 15
  18. 3.2.3 Hive安装及配置 21
  19. 3.2.4 Sqoop安装及配置 24
  20. 3.2.5 Spark安装及配置 30
  21. 3.2.6 Zookeeper安装及配置 31
  22. 3.2.7 HBase安装及配置 33
  23. 3.3 自动化安装及部署说明 35
  24. 3.3.1 自动化安装及部署整体架构设计 35
  25. 3.3.2 大数据系统自动化部署逻辑调用关系 36
  26. 3.4 本章小结 43
  27. 第4章 大数据的获取 44
  28. 4.1 使用爬虫获取互联网数据 45
  29. 4.2 Python和Scrapy 框架的安装 45
  30. 4.3 抓取和解析招聘职位信息 47
  31. 4.4 职位信息的落地 51
  32. 4.5 两个爬虫配合工作 53
  33. 4.6 让爬虫的架构设计更加合理 55
  34. 4.7 获取数据的其他方式 57
  35. 4.8 使用Sqoop同步论坛中帖子数据 57
  36. 4.9 本章小结 59
  37. 第5章 大数据的处理 60
  38. 5.1 Hive是什么 60
  39. 5.2 为什么使用Hive做数据仓库建模 60
  40. 5.3 飞谷项目中Hive建模步骤 61
  41. 5.3.1 逻辑模型的创建 62
  42. 5.3.2 物理模型的创建 67
  43. 5.3.3 将爬虫数据导入stg_job表 74
  44. 5.4 使用Hive进行数据清洗转换 77
  45. 5.5 数据清洗转换的必要性 78
  46. 5.6 使用HiveQL清洗数据、提取维度信息 79
  47. 5.6.1 使用HQL清洗数据 79
  48. 5.6.2 提取维度信息 82
  49. 5.7 定义Hive UDF封装处理逻辑 85
  50. 5.7.1 Hive UDF的开发、部署和调用 86
  51. 5.7.2 Python版本的UDF 89
  52. 5.8 使用左外连接构造聚合表rpt_job 92
  53. 5.9 让数据处理自动调度 96
  54. 5.9.1 HQL的几种执行方式 96
  55. 5.9.2 Hive Thrift服务 99
  56. 5.9.3 使用JDBC连接Hive 100
  57. 5.9.4 Python调用HiveServer服务 103
  58. 5.9.5 用crontab实现的任务调度 105
  59. 5.10 本章小结 107
  60. 第6章 大数据的存储 108
  61. 6.1 NoSQL及HBase简介 108
  62. 6.2 HBase中的主要概念 110
  63. 6.3 HBase客户端及JavaAPI 111
  64. 6.4 Hive数据导入HBase的两种方案 114
  65. 6.4.1 利用既有的JAR包实现整合 114
  66. 6.4.2 手动编写MapReduce程序 116
  67. 6.5 使用Java API查询HBase中的职位信息 122
  68. 6.5.1 为什么是HBase而非Hive 122
  69. 6.5.2 多条件组合查询HBase中的职位信息 123
  70. 6.6 如何显示职位表中的某条具体信息 132
  71. 6.7 本章小结 133
  72. 第7章 大数据的展示 134
  73. 7.1 概述 134
  74. 7.2 数据分析的一般步骤 135
  75. 7.3 用R来做数据分析展示 135
  76. 7.3.1 在Ubuntu上安装R 135
  77. 7.3.2 R的基本使用方式 137
  78. 7.4 用Hive充当R的数据来源 139
  79. 7.4.1 RHive组件 139
  80. 7.4.2 把R图表整合到Web页面中 145
  81. 7.5 本章小结 151
  82. 第8章 大数据的分析挖掘 152
  83. 8.1 基于Spark的数据挖掘技术 152
  84. 8.2 Spark和Hadoop的关系 153
  85. 8.3 在Ubuntu上安装Spark集群 154
  86. 8.3.1 JDK和Hadoop的安装 154
  87. 8.3.2 安装Scala 154
  88. 8.3.3 安装Spark 155
  89. 8.4 Spark的运行方式 157
  90. 8.5 使用Spark替代Hadoop Yarn引擎 160
  91. 8.5.1 使用spark-sql查看Hive表 160
  92. 8.5.2 在beeline客户端使用Spark引擎 161
  93. 8.5.3 在Java代码中引用Spark的ThriftServer 163
  94. 8.6 对招聘公司名称做全文检索 168
  95. 8.6.1 从HDFS数据源构造JavaRDD 169
  96. 8.6.2 使用Spark SQL操作RDD 173
  97. 8.6.3 把RDD运行结果展现在前端 174
  98. 8.7 如何把Spark用得更好 175
  99. 8.8 SparkR组件的使用 177
  100. 8.8.1 SparkR的安装及启动 177
  101. 8.8.2 运行自带的Sample例子 179
  102. 8.8.3 利用SparkR生成职位统计饼图 179
  103. 8.9 本章小结 181
  104. 第9章 自己动手搭建支撑大数据系统的云平台 182
  105. 9.1 云平台架构 182
  106. 9.1.1 一期云基础平台架构 182
  107. 9.1.2 二期云基础平台架构 184
  108. 9.2 云平台搭建及部署 185
  109. 9.2.1 安装组件前准备 185
  110. 9.2.2 Identity(Keystone)组件 190
  111. 9.2.3 Image(Glance)组件 198
  112. 9.2.4 Compute(Nova)组件 201
  113. 9.2.5 Storage(Cinder)组件 206
  114. 9.2.6 Networking(Neutron)组件 210
  115. 9.2.7 Ceph分布式存储系统 221
  116. 9.2.8 Dashboard(Horizon)组件 230
  117. 9.3 Identity(Keystone)与LDAP的整合 232
  118. 9.4 配置Image组件大镜像部署 235
  119. 9.5 配置业务系统无缝迁移 236
  120. 9.6 本章小结 237
  121. 参考文献 238

常见问题

《自己动手做大数据系统》适合谁读?

适合希望系统学习技术概念、实践方法、工具使用和行业知识的读者。

《自己动手做大数据系统》阅读难度高吗?

建议先看简介、目录、作者和相关书籍,再判断是否适合当前阶段阅读。

《自己动手做大数据系统》纸质书值得买吗?

当前暂未接入已核验的纸质书购买链接,建议通过出版社、京东、当当等正版渠道核对版本后购买。

《自己动手做大数据系统》哪个版本更适合?

优先选择作者、译者、出版社、出版年份和 ISBN 信息清楚的版本;经典作品可优先选择校注、导读或权威出版社版本。

在哪里可以合法获取《自己动手做大数据系统》?

当前没有确认授权的电子书下载资源,也暂未接入已核验购买链接;商业出版物不提供未授权下载,建议通过出版社、京东、当当或官方电子书平台核对获取。

如何继续查找《自己动手做大数据系统》相关书籍?

可以进入 张魁/张粤磊/刘未昕/吴茂贵 作者页查看其他作品,也可以通过分类、标签、排行榜、人工推荐和“读完这本还可以读”继续发现相近主题。

手机扫码下载

使用手机扫描二维码

扫码后会直接打开下载链接。

电子书下载二维码

手机端点击下载会直接跳转,无需扫码。