《PySpark大数据分析与应用》内容简介与阅读建议

获取这本书 暂无已核验电子书资源
下载
作者
戴刚
分类
科技技术
出版年份
2024
出版社
人民邮电出版社
页数
275 页
语言
中文

《PySpark大数据分析与应用》内容简介

本书以Python作为开发语言,系统介绍PySpark开发环境搭建流程及基于PySpark进行大数据分析的 相关知识。本书条理清晰、重点突出,理论叙述循序渐进、由浅入深。本书共7章,前5章包括PySpark 大数据分析概述、PySpark安装配置、基于PySpark的DataFrame操作、基于PySpark的流式数据处理、 基于PySpark的机器学习库,内容介绍注重理论与实践相结合,通过典型示例强化PySpark在大数据分析 中的实际应用;第6、7章通过基于PySpark的网络招聘信息的职业类型划分和基于PySpark的信用贷款 风险分析两个完整的案例实战,结合前5章的PySpark编程知识,实现完整的大数据分析过程。本书大部分章包含实训和课后习题,读者通过练习和操作实践,能够巩固所学的内容。

《PySpark大数据分析与应用》书籍信息摘要

《PySpark大数据分析与应用》内容简介与阅读建议,作者 戴刚,科技技术,2024年。获取前建议核对作者、出版社、年份、ISBN、版本和正版渠道。相关主题:PySpark、大数据分析、机器学习、科技农工。

《PySpark大数据分析与应用》适合哪些读者?

适合希望系统学习技术概念、实践方法、工具使用和行业知识的读者。

获取建议

《PySpark大数据分析与应用》怎么获取更合适?

优先确认版本和阅读目的;下载区只展示已核验的公版、授权、开放许可或官方试读资源。

下载

暂无已核验电子书资源;本站不展示未授权完整文件。

下载

版本

优先选择作者、译者、出版社、出版年份和 ISBN 信息明确的版本;经典作品可优先选择校注、导读或权威出版社版本。

目录

  1. 第1章PySpark大数据分析概述 1
  2. 1.1 大数据分析概述 1
  3. 1.1.1 大数据的概念 2
  4. 1.1.2 大数据分析的概念 3
  5. 1.1.3 大数据分析的流程 4
  6. 1.1.4 大数据分析的应用场景 6
  7. 1.1.5 大数据技术体系 6
  8. 1.2 Spark大数据技术框架 10
展开全部(共 156 章节)
  1. 1.2.1 Spark 简介 10
  2. 1.2.2 Spark 特点 11
  3. 1.2.3 Spark运行架构与流程 11
  4. 1.2.4 Spark RDD 14
  5. 1.2.5 Spark 生态圈 20
  6. 1.3 PySpark大数据分析 21
  7. 1.3.1 PySpark 简介 21
  8. 1.3.2 PySpark 子模块 22
  9. 小结 25
  10. 课后习题 26
  11. 第2章 PySpark安装配置 27
  12. 2.1 搭建单机模式的PySpark开发
  13. 环境 28
  14. 2.1.1 安装 K 28
  15. 2.1.2 安装 Anaconda 28
  16. 2.1.3 安装 Hadoop 30
  17. 2.1.4 安装 MySQL 36
  18. 2.1.5 安装 Hive 37
  19. 2.1.6 配置 PySpark 模块 43
  20. 2.1.7 运行 Jupyter Notebook 44
  21. 2.2 搭建分布式模式的PySpark开发
  22. 环境 45
  23. 2.2.1 安装配置虚拟机 46
  24. 2.2.2 安装 Java 53
  25. 2.2.3 搭建Hadoop分布式集群 58
  26. 2.2.4 安装MySQL数据库 62
  27. 2.2.5 安装Hive数据仓库工具 63
  28. 2.2.6 搭建Spark完全分布式集群 66
  29. 2.2.7 安装 PyCham 69
  30. 2.2.8 安装Python解释器及PySpark 模块 69
  31. 2.3 Python函数式编程 69
  32. 2.3.1 Python常用数据结构 70
  33. 2.3.2 Python函数式编程基础 75
  34. 小结 76
  35. 课后习题 76
  36. 第3章 基于 PySpark 的 DataFrame 操作 78
  37. 3.1 Spark SQL 概述 78
  38. 3.1.1 Spark SQL起源与发展历程 79
  39. 3.1.2 Spark SQL 主要功能 79
  40. 3.1.3 Spark SQL数据核心抽象 DataFrame 80
  41. 3.2 pyspark.sql 模块 82
  42. 3.2.1 pyspark. sql 模块简介 82
  43. 3.2.2 pyspark. sql 模块核心类 83
  44. 3.3 DataFrame 基础操作 85
  45. 3.3.1 创建 DataFrame 对象 86
  46. 332 DataFrame 操作 93
  47. 3.3.3 DataFrame 输出操作 113
  48. 小结 114
  49. 实训 114
  50. 实训1网站搜索热词统计分析 114
  51. 实训2大数据岗位招聘信息统计分析 …115
  52. 课后习题 116
  53. 第4章 基于PySpark的流式数据
  54. 处理 118
  55. 4.1 Spark Streaming 概述 119
  56. 4.1.1 流计算简介 119
  57. 4.1.2 Spark Streaming 基本概念 121
  58. 4.1.3 Spark Streaming 工作原理 121
  59. 4.1.4 Spark Streaming 运行机制 122
  60. 4.2 pyspark.streaming 模块 123
  61. 4.2.1 pyspark. streaming 模块简介 123
  62. 4.2.2 pyspark. streaming 模块核心类 124
  63. 4.2.3 DStream 基础操作 126
  64. 4.3 Structured Streaming 结构化流 处理 146
  65. 4.3.1 Structured Streaming 概述 146
  66. 4.3.2 Structured Streaming 编程模型 147
  67. 4.3.3 Structured Streaming 基础操作 148
  68. 4.3.4 Structured Streaming 编程步骤 152
  69. 小结 155
  70. 实训 155
  71. 实训1使用Spark Streaming实现菜品价格
  72. 实时计算 155
  73. 实训2使用Spark Streaming实时判别车辆 所属地 156
  74. 课后习题 156
  75. 第5章 基于PySpark的机器
  76. 学习库 158
  77. 5.1 MLlib 算法 159
  78. 5.1.1 机器学习 159
  79. 5.1.2 MLlib 159
  80. 5.1.3 pyspark.ml 模块 159
  81. 5.2 使用pyspark.ml模块的转换器处理
  82. 和转换数据 162
  83. 5.2.1 数据加载及数据集划分 162
  84. 5.2.2 数据降维 164
  85. 5.2.3 数据标准化 166
  86. 5.2.4 数据类型转换 171
  87. 5.3 pyspark.ml模块的评估器和模型 评估 175
  88. 5.3.1 使用PySpark构建并评估分类 模型 175
  89. 5.3.2 使用PySpark构建并评估回归 模型 182
  90. 5.3.3 使用PySpark构建并评估聚类 模型 186
  91. 5.3.4 使用PySpark构建并评估智能推荐
  92. 模型 189
  93. 小结 195
  94. 实训 195
  95. 实训1使用森林模型预测是否批准 用户申请 195
  96. 实训2使用回归模型实现房价预测………196
  97. 课后习题 197
  98. 第6章 案例分析:基于PySpark的网络 招聘信息的职业类型划分 ……199
  99. 6.1 需求与架构分析 200
  100. 6.1.1 业务需求分析与技术选型 200
  101. 6.1.2 系统架构分析 200
  102. 6.2 数据探索 201
  103. 6.2.1 数据说明 202
  104. 6.2.2 数据读取 202
  105. 6.2.3 重复数据与空值探索 204
  106. 6.2.4 异常数据探索 205
  107. 6.3 数据预处理 207
  108. 6.3.1 数据清洗 207
  109. 6.3.2 中文分词与去停用词 208
  110. 6.3.3 词特征向量化 210
  111. 6.4 模型构建与评估 213
  112. 6.4.1 LDA算法简介 214
  113. 6.4.2 LDA模型构建与评估 215
  114. 6.4.3 构建LDA模型 217
  115. 6.5 制作词云图 220
  116. 小结 225
  117. 第7章 案例分析:基于PySpark的
  118. 信用贷款风险分析 226
  119. 7.1 需求与架构分析 227
  120. 7.1.1 业务需求分析 227
  121. 7.1.2 系统架构分析 227
  122. 7.2 数据探索 228
  123. 7.2.1 数据说明 228
  124. 7.2.2 建立数据仓库并导入数据 230
  125. 7.2.3 用户信息完善情况与逾期率的关系
  126. 探索 233
  127. 7.2.4 用户信息修改情况与逾期率的关系
  128. 探索 236
  129. 7.2.5 用户借款月份与逾期率的关系
  130. 探索 240
  131. 7.3 数据预处理 243
  132. 7.3.1 计算用户信息缺失个数及借款月份
  133. 构建新特征 243
  134. 7.3.2 用户更新信息重建 245
  135. 7.3.3 用户登录信息重建 250
  136. 7.3.4 分类数据预处理 255
  137. 7.3.5 字符串字段编码处理 259
  138. 7.3.6 分类数据重编码 263
  139. 7.3.7 缺失值处理 265
  140. 7.4 模型构建与评估 267
  141. 7.4.1 了解 GBTs 算法 267
  142. 7.4.2 构建 GBTs 模型 268
  143. 7.4.3 评估 GBTs 模型 271
  144. 7.5 部署和提交PySpark应用程序…271
  145. 7.5.1 打包PySpark应用程序 271
  146. 7.5.2 提交PySpark应用程序 274
  147. 小结 275
  148. 参考文献 276

常见问题

《PySpark大数据分析与应用》适合谁读?

适合希望系统学习技术概念、实践方法、工具使用和行业知识的读者。

《PySpark大数据分析与应用》阅读难度高吗?

建议先看简介、目录、作者和相关书籍,再判断是否适合当前阶段阅读。

《PySpark大数据分析与应用》纸质书值得买吗?

当前暂未接入已核验的纸质书购买链接,建议通过出版社、京东、当当等正版渠道核对版本后购买。

《PySpark大数据分析与应用》哪个版本更适合?

优先选择作者、译者、出版社、出版年份和 ISBN 信息清楚的版本;经典作品可优先选择校注、导读或权威出版社版本。

在哪里可以合法获取《PySpark大数据分析与应用》?

当前没有确认授权的电子书下载资源,也暂未接入已核验购买链接;商业出版物不提供未授权下载,建议通过出版社、京东、当当或官方电子书平台核对获取。

如何继续查找《PySpark大数据分析与应用》相关书籍?

可以进入 戴刚 作者页查看其他作品,也可以通过分类、标签、排行榜、人工推荐和“读完这本还可以读”继续发现相近主题。

手机扫码下载

使用手机扫描二维码

扫码后会直接打开下载链接。

电子书下载二维码

手机端点击下载会直接跳转,无需扫码。