下载
暂无已核验电子书资源;本站不展示未授权完整文件。
下载本书共分3部分,主要介绍如何使用Python语言来处理大型数据集。第1部分介绍map和reduce编程风格,以及Python中基础的map和reduce函数,并介绍如何将对象持久化,通过惰性函数和并行函数来加快大型数据集的处理速度。第2部分介绍Hadoop和Spark框架,以及如何使用mrjob库来编写Hadoop作业,如何实现PageRank算法,如何使用Spark来实现决策树和随机森林的机器学习模型。第3部分重点介绍云计算和云存储的基础知识,包括如何通过boto3的Python库将文件上传到AWS S3服务,以及如何在AWS的EMR集群中运行分布式的Hadoop和Spark作业。本书适合有一定Python编程基础,且希望掌握大型数据集处理能力的开发人员和数据科学家阅读。
《深入大型数据集:并行与分布化Python代码》内容简介与阅读建议,作者 J.T. 沃勒翰,科技技术。获取前建议核对作者、出版社、年份、ISBN、版本和正版渠道。相关主题:计算机网络、软硬件开发。
适合希望系统学习技术概念、实践方法、工具使用和行业知识的读者。
获取建议
优先确认版本和阅读目的;下载区只展示已核验的公版、授权、开放许可或官方试读资源。
暂无已核验电子书资源;本站不展示未授权完整文件。
下载优先选择作者、译者、出版社、出版年份和 ISBN 信息明确的版本;经典作品可优先选择校注、导读或权威出版社版本。
当前暂无已核验电子书资源。若是商业出版物,建议优先通过出版社、书店或官方电子书平台获取。
适合希望系统学习技术概念、实践方法、工具使用和行业知识的读者。
建议先看简介、目录、作者和相关书籍,再判断是否适合当前阶段阅读。
当前暂未接入已核验的纸质书购买链接,建议通过出版社、京东、当当等正版渠道核对版本后购买。
优先选择作者、译者、出版社、出版年份和 ISBN 信息清楚的版本;经典作品可优先选择校注、导读或权威出版社版本。
当前没有确认授权的电子书下载资源,也暂未接入已核验购买链接;商业出版物不提供未授权下载,建议通过出版社、京东、当当或官方电子书平台核对获取。
可以进入 J.T. 沃勒翰 作者页查看其他作品,也可以通过分类、标签、排行榜、人工推荐和“读完这本还可以读”继续发现相近主题。