《深度学习入门 4:强化学习》内容简介与阅读建议

获取这本书 暂无已核验电子书资源
下载
分类
科技技术
出版年份
2024
译者
郑明智
出版社
人民邮电出版社
页数
332 页
语言
中文
豆瓣评分
★ 9.3

《深度学习入门 4:强化学习》内容简介

本书前半部分介绍强化学习的重要思想和基础知识,后半部分介绍如何将深度学习应用于强化学习,遴选讲解了深度强化学习的最新技术。全书从最适合入门的多臂老虎机问题切入,依次介绍了定义一般强化学习问题的马尔可夫决策过程、用于寻找最佳答案的贝尔曼方程,以及解决贝尔曼方程的动态规划法、蒙特卡洛方法和TD方法。随后,神经网络和Q学习、DQN、策略梯度法等几章则分别讨论了深度学习在强化学习领域的应用。本书延续“鱼书”系列的风格,搭配丰富的图、表、代码示例,加上轻松、简明的讲解,让人循序渐进地理解强化学习中各种方法之间的关系,于不知不觉中登堂入室。

《深度学习入门 4:强化学习》书籍信息摘要

《深度学习入门 4:强化学习》内容简介与阅读建议,作者 [日]斋藤康毅,科技技术,2024年。获取前建议核对作者、出版社、年份、ISBN、版本和正版渠道。相关主题:强化学习、深度强化学习、DQN、计算机类。

《深度学习入门 4:强化学习》适合哪些读者?

适合希望系统学习技术概念、实践方法、工具使用和行业知识的读者。 评分 9.3 可作为选书参考。

获取建议

《深度学习入门 4:强化学习》怎么获取更合适?

优先确认版本和阅读目的;下载区只展示已核验的公版、授权、开放许可或官方试读资源。

下载

暂无已核验电子书资源;本站不展示未授权完整文件。

下载

版本

优先选择作者、译者、出版社、出版年份和 ISBN 信息明确的版本;经典作品可优先选择校注、导读或权威出版社版本。

目录

  1. 前言
  2. 第 1章 老虎机问题 1
  3. 1.1 机器学习的分类与强化学习 1
  4. 1.1.1 监督学习 2
  5. 1.1.2 无监督学习 2
  6. 1.1.3 强化学习 3
  7. 1.2 老虎机问题 5
  8. 1.2.1 什么是老虎机问题 5
展开全部(共 202 章节)
  1. 1.2.2 什么是好的老虎机 7
  2. 1.2.3 使用数学式表示 8
  3. 1.3 老虎机算法 9
  4. 1.3.1 价值的估计方法 10
  5. 1.3.2 求平均值的实现 12
  6. 1.3.3 玩家的策略 15
  7. 1.4 老虎机算法的实现 17
  8. 1.4.1 老虎机的实现 17
  9. 1.4.2 智能代理的实现 19
  10. 1.4.3 尝试运行 20
  11. 1.4.4 算法平均的特性 23
  12. 1.5 非稳态问题 28
  13. 1.5.1 解决非稳态问题前的准备工作 29
  14. 1.5.2 解决非稳态问题 32
  15. 1.6 小结 34
  16. 第 2章 马尔可夫决策过程 36
  17. 2.1 什么是MDP 37
  18. 2.1.1 MDP的具体例子 37
  19. 2.1.2 智能代理与环境的互动 39
  20. 2.2 环境和智能代理的数学表示 40
  21. 2.2.1 状态迁移 40
  22. 2.2.2 奖励函数 42
  23. 2.2.3 智能代理的策略 43
  24. 2.3 MDP的目标 45
  25. 2.3.1 回合制任务和连续性任务 45
  26. 2.3.2 收益 46
  27. 2.3.3 状态价值函数 47
  28. 2.3.4 最优策略和最优价值函数 48
  29. 2.4 MDP的例子 50
  30. 2.4.1 回溯线形图 51
  31. 2.4.2 找出最优策略 52
  32. 2.5 小结 54
  33. 第3章 贝尔曼方程 56
  34. 3.1 贝尔曼方程的推导 57
  35. 3.1.1 概率和期望值(推导贝尔曼方程的准备)57
  36. 3.1.2 贝尔曼方程的推导 60
  37. 3.2 贝尔曼方程的例子 64
  38. 3.2.1 有两个方格的网格世界 64
  39. 3.2.2 贝尔曼方程的意义 68
  40. 3.3 行动价值函数与贝尔曼方程 68
  41. 3.3.1 行动价值函数 69
  42. 3.3.2 使用行动价值函数的贝尔曼方程 70
  43. 3.4 贝尔曼最优方程 71
  44. 3.4.1 状态价值函数的贝尔曼最优方程 71
  45. 3.4.2 Q函数的贝尔曼最优方程 73
  46. 3.5 贝尔曼最优方程的示例 74
  47. 3.5.1 应用贝尔曼最优方程 74
  48. 3.5.2 得到最优策略 76
  49. 3.6 小结 78
  50. 第4章 动态规划法 79
  51. 4.1 动态规划法和策略评估 80
  52. 4.1.1 动态规划法简介 80
  53. 4.1.2 尝试迭代策略评估 81
  54. 4.1.3 迭代策略评估的其他实现方式 86
  55. 4.2 解决更大的问题 87
  56. 4.2.1 GridWorld类的实现 88
  57. 4.2.2 defaultdict的用法 94
  58. 4.2.3 迭代策略评估的实现 95
  59. 4.3 策略迭代法 99
  60. 4.3.1 策略的改进 99
  61. 4.3.2 重复评估和改进 101
  62. 4.4 实施策略迭代法 102
  63. 4.4.1 改进策略 103
  64. 4.4.2 重复评估和改进 105
  65. 4.5 价值迭代法 107
  66. 4.5.1 价值迭代法的推导 109
  67. 4.5.2 价值迭代法的实现 113
  68. 4.6 小结 116
  69. 第5章 蒙特卡洛方法 117
  70. 5.1 蒙特卡洛方法的基础知识 117
  71. 5.1.1 骰子的点数和 118
  72. 5.1.2 分布模型和样本模型 119
  73. 5.1.3 蒙特卡洛方法的实现 121
  74. 5.2 使用蒙特卡洛方法评估策略 123
  75. 5.2.1 使用蒙特卡洛方法计算价值函数 124
  76. 5.2.2 求所有状态的价值函数 126
  77. 5.2.3 蒙特卡洛方法的高效实现 129
  78. 5.3 蒙特卡洛方法的实现 130
  79. 5.3.1 step方法 130
  80. 5.3.2 智能代理类的实现 132
  81. 5.3.3 运行蒙特卡洛方法 134
  82. 5.4 使用蒙特卡洛方法的策略控制 136
  83. 5.4.1 评估和改进 136
  84. 5.4.2 使用蒙特卡洛方法实现策略控制 137
  85. 5.4.3 ε-greedy算法(第 1个修改) 139
  86. 5.4.4 修改为固定值α的方式(第 2个修改) 141
  87. 5.4.5 [ 修改版] 使用蒙特卡洛方法实现策略迭代法 142
  88. 5.5 异策略型和重要性采样 145
  89. 5.5.1 同策略型和异策略型 145
  90. 5.5.2 重要性采样 146
  91. 5.5.3 如何减小方差 150
  92. 5.6 小结 152
  93. 第6章 TD方法 153
  94. 6.1 使用TD方法评估策略 153
  95. 6.1.1 TD方法的推导 154
  96. 6.1.2 MC方法和TD方法的比较 157
  97. 6.1.3 TD方法的实现 158
  98. 6.2 SARSA 161
  99. 6.2.1 同策略型的SARSA 161
  100. 6.2.2 SARSA的实现 162
  101. 6.3 异策略型的SARSA 165
  102. 6.3.1 异策略型和重要性采样 166
  103. 6.3.2 异策略型的SARSA的实现 167
  104. 6.4 Q学习 169
  105. 6.4.1 贝尔曼方程与SARSA 170
  106. 6.4.2 贝尔曼最优方程与Q学习 171
  107. 6.4.3 Q学习的实现 173
  108. 6.5 分布模型与样本模型 175
  109. 6.5.1 分布模型与样本模型 175
  110. 6.5.2 样本模型版的Q学习 176
  111. 6.6 小结 179
  112. 第7章 神经网络和Q学习 181
  113. 7.1 DeZero简介 182
  114. 7.1.1 使用DeZero 183
  115. 7.1.2 多维数组(张量)和函数 184
  116. 7.1.3 最优化 186
  117. 7.2 线性回归 189
  118. 7.2.1 玩具数据集 189
  119. 7.2.2 线性回归的理论知识 190
  120. 7.2.3 线性回归的实现 191
  121. 7.3 神经网络 195
  122. 7.3.1 非线性数据集 195
  123. 7.3.2 线性变换和激活函数 196
  124. 7.3.3 神经网络的实现 197
  125. 7.3.4 层与模型 199
  126. 7.3.5 优化器(最优化方法)202
  127. 7.4 Q学习与神经网络 204
  128. 7.4.1 神经网络的预处理 204
  129. 7.4.2 表示Q函数的神经网络 205
  130. 7.4.3 神经网络和Q学习 208
  131. 7.5 小结 212
  132. 第8章 DQN 213
  133. 8.1 OpenAI Gym 213
  134. 8.1.1 OpenAI Gym的基础知识 214
  135. 8.1.2 随机智能代理 216
  136. 8.2 DQN的核心技术 218
  137. 8.2.1 经验回放 218
  138. 8.2.2 经验回放的实现 220
  139. 8.2.3 目标网络 223
  140. 8.2.4 目标网络的实现 224
  141. 8.2.5 运行DQN 227
  142. 8.3 DQN与Atari 230
  143. 8.3.1 Atari的游戏环境 231
  144. 8.3.2 预处理 232
  145. 8.3.3 CNN 232
  146. 8.3.4 其他技巧 233
  147. 8.4 DQN的扩展 234
  148. 8.4.1 Double DQN 234
  149. 8.4.2 优先级经验回放 235
  150. 8.4.3 Dueling DQN 236
  151. 8.5 小结 238
  152. 第9章 策略梯度法 239
  153. 9.1 最简单的策略梯度法 239
  154. 9.1.1 策略梯度法的推导 240
  155. 9.1.2 策略梯度法的算法 241
  156. 9.1.3 策略梯度法的实现 243
  157. 9.2 REINFORCE 248
  158. 9.2.1 REINFORCE算法 249
  159. 9.2.2 REINFORCE的实现 250
  160. 9.3 基线 251
  161. 9.3.1 基线的思路 251
  162. 9.3.2 带基线的策略梯度法 253
  163. 9.4 Actor-Critic 254
  164. 9.4.1 Actor-Critic的推导 255
  165. 9.4.2 Actor-Critic的实现 257
  166. 9.5 基于策略的方法的优点 260
  167. 9.6 小结 262
  168. 第 10章 进一步学习 263
  169. 10.1 深度强化学习算法的分类 263
  170. 10.2 策略梯度法的改进算法 265
  171. 10.2.1 A3C和A2C 265
  172. 10.2.2 DDPG 268
  173. 10.2.3 TRPO和PPO 271
  174. 10.3 DQN的改进算法 272
  175. 10.3.1 分类DQN 272
  176. 10.3.2 Noisy Network 274
  177. 10.3.3 Rainbow 274
  178. 10.3.4 在Rainbow以后提出的改进算法 275
  179. 10.4 案例研究 276
  180. 10.4.1 棋盘游戏 277
  181. 10.4.2 机器人控制 279
  182. 10.4.3 NAS 280
  183. 10.4.4 其他案例 282
  184. 10.5 深度强化学习的挑战和可能性 283
  185. 10.5.1 应用于实际系统 283
  186. 10.5.2 将问题表示为MDP形式时的建议 286
  187. 10.5.3 通用人工智能系统 288
  188. 10.6 小结 288
  189. 附录A 异策略型的蒙特卡洛方法 291
  190. 附录B n-step TD方法 298
  191. 附录C Double DQN的理解 300
  192. 附录D 策略梯度法的证明 304
  193. 后记 308
  194. 参考文献 310

常见问题

《深度学习入门 4:强化学习》适合谁读?

适合希望系统学习技术概念、实践方法、工具使用和行业知识的读者。 评分 9.3 可作为选书参考。

《深度学习入门 4:强化学习》阅读难度高吗?

建议先看简介、目录、作者和相关书籍,再判断是否适合当前阶段阅读。

《深度学习入门 4:强化学习》纸质书值得买吗?

当前暂未接入已核验的纸质书购买链接,建议通过出版社、京东、当当等正版渠道核对版本后购买。

《深度学习入门 4:强化学习》哪个版本更适合?

优先选择作者、译者、出版社、出版年份和 ISBN 信息清楚的版本;经典作品可优先选择校注、导读或权威出版社版本。

在哪里可以合法获取《深度学习入门 4:强化学习》?

当前没有确认授权的电子书下载资源,也暂未接入已核验购买链接;商业出版物不提供未授权下载,建议通过出版社、京东、当当或官方电子书平台核对获取。

如何继续查找《深度学习入门 4:强化学习》相关书籍?

可以进入 [日]斋藤康毅 作者页查看其他作品,也可以通过分类、标签、排行榜、人工推荐和“读完这本还可以读”继续发现相近主题。

手机扫码下载

使用手机扫描二维码

扫码后会直接打开下载链接。

电子书下载二维码

手机端点击下载会直接跳转,无需扫码。