下载
暂无已核验电子书资源;本站不展示未授权完整文件。
下载本书是《深入浅出强化学习:原理入门》的姊妹篇,写作的初衷是通过编程实例帮助那些想要学习强化学习算法的读者更深入、更清楚地理解算法。本书首先介绍马尔可夫决策过程的理论框架,然后介绍基于动态规划的策略迭代算法和值迭代算法,在此基础上分3篇介绍了目前强化学习算法中很基本的算法。篇讲解基于值函数的强化学习算法,介绍了基于两种策略评估方法(蒙特卡洛策略评估和时间差分策略评估)的强化学习算法,以及如何将函数逼近的方法引入强化学习算法中。第2篇讲解直接策略搜索方法,介绍了基本的策略梯度方法、AC方法、PPO方法和DDPG算法。第3篇讲解基于模型的强化学习方法,介绍了基于MPC的方法、AlphaZero算法基本原理及在五子棋上的具体实现细节。建议读者根据书中的代码亲自动手编程,并修改程序中的超参数,根据运行结果不断体会算法原理。
《深入浅出强化学习:编程实战》内容简介与阅读建议,作者 郭宪,科技技术。获取前建议核对作者、出版社、年份、ISBN、版本和正版渠道。相关主题:计算机网络、软硬件开发。
适合希望系统学习技术概念、实践方法、工具使用和行业知识的读者。
获取建议
优先确认版本和阅读目的;下载区只展示已核验的公版、授权、开放许可或官方试读资源。
暂无已核验电子书资源;本站不展示未授权完整文件。
下载优先选择作者、译者、出版社、出版年份和 ISBN 信息明确的版本;经典作品可优先选择校注、导读或权威出版社版本。
当前暂无已核验电子书资源。若是商业出版物,建议优先通过出版社、书店或官方电子书平台获取。
适合希望系统学习技术概念、实践方法、工具使用和行业知识的读者。
建议先看简介、目录、作者和相关书籍,再判断是否适合当前阶段阅读。
当前暂未接入已核验的纸质书购买链接,建议通过出版社、京东、当当等正版渠道核对版本后购买。
优先选择作者、译者、出版社、出版年份和 ISBN 信息清楚的版本;经典作品可优先选择校注、导读或权威出版社版本。
当前没有确认授权的电子书下载资源,也暂未接入已核验购买链接;商业出版物不提供未授权下载,建议通过出版社、京东、当当或官方电子书平台核对获取。
可以进入 郭宪 作者页查看其他作品,也可以通过分类、标签、排行榜、人工推荐和“读完这本还可以读”继续发现相近主题。