《深度强化学习》内容简介与阅读建议

获取这本书 暂无已核验电子书资源
下载
分类
科技技术
出版年份
2022
出版社
人民邮电出版社
页数
294 页
语言
中文

《深度强化学习》内容简介

本书基于备受读者推崇的王树森“深度强化学习”系列公开视频课,专门解决“入门深度强化学习难”的问题。

《深度强化学习》书籍信息摘要

《深度强化学习》内容简介与阅读建议,作者 王树森/黎彧君/张志华,科技技术,2022年。获取前建议核对作者、出版社、年份、ISBN、版本和正版渠道。相关主题:学习、王树森、DQN、计算机类。

《深度强化学习》适合哪些读者?

适合希望系统学习技术概念、实践方法、工具使用和行业知识的读者。

获取建议

《深度强化学习》怎么获取更合适?

优先确认版本和阅读目的;下载区只展示已核验的公版、授权、开放许可或官方试读资源。

下载

暂无已核验电子书资源;本站不展示未授权完整文件。

下载

版本

优先选择作者、译者、出版社、出版年份和 ISBN 信息明确的版本;经典作品可优先选择校注、导读或权威出版社版本。

目录

  1. 序言 i
  2. 前言 v
  3. 常用符号 xi
  4. 第 一部分 基础知识
  5. 第 1章 机器学习基础 2
  6. 1.1 线性模型 2
  7. 1.1.1 线性回归 2
  8. 1.1.2 逻辑斯谛回归 4
展开全部(共 300 章节)
  1. 1.1.3 softmax分类器 7
  2. 1.2 神经网络 10
  3. 1.2.1 全连接神经网络 10
  4. 1.2.2 卷积神经网络 11
  5. 1.3 梯度下降和反向传播 12
  6. 1.3.1 梯度下降 13
  7. 1.3.2 反向传播 14
  8. 知识点小结 16
  9. 习题 16
  10. 第 2章 蒙特卡洛方法 18
  11. 2.1 随机变量 18
  12. 2.2 蒙特卡洛方法实例 21
  13. 2.2.1 例一:近似π值 21
  14. 2.2.2 例二:估算阴影部分面积 23
  15. 2.2.3 例三:近似定积分 25
  16. 2.2.4 例四:近似期望 26
  17. 2.2.5 例五:随机梯度 27
  18. 知识点小结 29
  19. 习题 29
  20. 第3章 强化学习基本概念 31
  21. 3.1 马尔可夫决策过程 31
  22. 3.1.1 状态、动作、奖励 31
  23. 3.1.2 状态转移 32
  24. 3.2 策略 33
  25. 3.3 随机性 35
  26. 3.4 回报与折扣回报 37
  27. 3.4.1 回报 37
  28. 3.4.2 折扣回报 37
  29. 3.4.3 回报中的随机性 38
  30. 3.4.4 有限期MDP和无限期MDP 39
  31. 3.5 价值函数 39
  32. 3.5.1 动作价值函数 40
  33. 3.5.2 动作价值函数 40
  34. 3.5.3 状态价值函数 41
  35. 3.6 实验环境:OpenAI Gym 42
  36. 知识点小结 44
  37. 习题 44
  38. 第二部分 价值学习
  39. 第4章 DQN与Q学习 48
  40. 4.1 DQN 48
  41. 4.1.1 概念回顾 48
  42. 4.1.2 DQN表达式 49
  43. 4.1.3 DQN的梯度 50
  44. 4.2 TD算法 50
  45. 4.2.1 驾车时间预测示例 50
  46. 4.2.2 TD算法的原理 51
  47. 4.3 用TD训练DQN 53
  48. 4.3.1 算法推导 53
  49. 4.3.2 训练流程 55
  50. 4.4 Q 学习算法 57
  51. 4.4.1 表格形式的Q学习 57
  52. 4.4.2 算法推导 57
  53. 4.4.3 训练流程 58
  54. 4.5 同策略与异策略 59
  55. 相关文献 60
  56. 知识点小结 61
  57. 习题 61
  58. 第5章 SARSA算法 63
  59. 5.1 表格形式的SARSA 63
  60. 5.1.1 算法推导 63
  61. 5.1.2 训练流程 64
  62. 5.1.3 Q学习与SARSA的对比 65
  63. 5.2 神经网络形式的SARSA 66
  64. 5.2.1 价值网络 66
  65. 5.2.2 算法推导 66
  66. 5.2.3 训练流程 67
  67. 5.3 多步TD目标 68
  68. 5.3.1 算法推导 68
  69. 5.3.2 多步TD目标的原理 69
  70. 5.3.3 训练流程 70
  71. 5.4 蒙特卡洛方法与自举 70
  72. 5.4.1 蒙特卡洛方法 71
  73. 5.4.2 自举 71
  74. 5.4.3 蒙特卡洛方法和自举的对比 72
  75. 相关文献 73
  76. 知识点小结 73
  77. 习题 74
  78. 第6章 价值学习高级技巧 75
  79. 6.1 经验回放 75
  80. 6.1.1 经验回放的优点 76
  81. 6.1.2 经验回放的局限性 76
  82. 6.1.3 优先经验回放 77
  83. 6.2 高估问题及解决方法 79
  84. 6.2.1 自举导致偏差传播 79
  85. 6.2.2 化导致高估 80
  86. 6.2.3 高估的危害 81
  87. 6.2.4 使用目标网络 82
  88. 6.2.5 双Q学习算法 84
  89. 6.2.6 总结 85
  90. 6.3 对决网络 86
  91. 6.3.1 优势函数 86
  92. 6.3.2 对决网络的结构 87
  93. 6.3.3 解决不性 88
  94. 6.3.4 对决网络的实际实现 89
  95. 6.4 噪声网络 90
  96. 6.4.1 噪声网络的原理 90
  97. 6.4.2 噪声DQN 91
  98. 6.4.3 训练流程 93
  99. 相关文献 94
  100. 知识点小结 94
  101. 习题 94
  102. 第三部分 策略学习
  103. 第7章 策略梯度方法 98
  104. 7.1 策略网络 98
  105. 7.2 策略学习的目标函数 99
  106. 7.3 策略梯度定理 101
  107. 7.3.1 简化证明 101
  108. 7.3.2 严格证明 102
  109. 7.3.3 近似策略梯度 106
  110. 7.4 REINFORCE 107
  111. 7.4.1 简化推导 108
  112. 7.4.2 训练流程 108
  113. 7.4.3 严格推导 109
  114. 7.5 actor-critic 110
  115. 7.5.1 价值网络 110
  116. 7.5.2 算法推导 111
  117. 7.5.3 训练流程 114
  118. 7.5.4 用目标网络改进训练 114
  119. 相关文献 115
  120. 知识点小结 115
  121. 习题 116
  122. 第8章 带基线的策略梯度方法 117
  123. 8.1 策略梯度中的基线 117
  124. 8.1.1 基线的引入 117
  125. 8.1.2 基线的直观解释 118
  126. 8.2 带基线的REINFORCE算法 119
  127. 8.2.1 策略网络和价值网络 120
  128. 8.2.2 算法推导 121
  129. 8.2.3 训练流程 121
  130. 8.3 advantage actor-critic 122
  131. 8.3.1 算法推导 123
  132. 8.3.2 训练流程 125
  133. 8.3.3 用目标网络改进训练 126
  134. 8.4 证明带基线的策略梯度定理 127
  135. 知识点小结 128
  136. 习题 128
  137. 第9章 策略学习高级技巧 129
  138. 9.1 置信域策略优化 129
  139. 9.1.1 置信域方法 129
  140. 9.1.2 策略学习的目标函数 132
  141. 9.1.3 算法推导 133
  142. 9.1.4 训练流程 135
  143. 9.2 策略学习中的熵正则 135
  144. 相关文献 138
  145. 知识点小结 138
  146. 第 10章 连续控制 139
  147. 10.1 连续空间的离散化 139
  148. 10.2 深度确定性策略梯度 140
  149. 10.2.1 策略网络和价值网络 140
  150. 10.2.2 算法推导 142
  151. 10.3 深入分析DDPG 145
  152. 10.3.1 从策略学习的角度看待DDPG 145
  153. 10.3.2 从价值学习的角度看待DDPG 146
  154. 10.3.3 DDPG的高估问题 147
  155. 10.4 双延迟深度确定性策略梯度 148
  156. 10.4.1 高估问题的解决方案——目标网络 148
  157. 10.4.2 高估问题的解决方案——截断双Q学习 148
  158. 10.4.3 其他改进点 149
  159. 10.4.4 训练流程 150
  160. 10.5 随机高斯策略 151
  161. 10.5.1 基本思路 152
  162. 10.5.2 随机高斯策略网络 153
  163. 10.5.3 策略梯度 154
  164. 10.5.4 用REINFORCE学习参数 155
  165. 10.5.5 用actor-critic学习参数 155
  166. 相关文献 157
  167. 知识点小结 157
  168. 第 11章 对状态的不完全观测 158
  169. 11.1 不完全观测问题 158
  170. 11.2 循环神经网络 159
  171. 11.3 基于RNN的策略网络 161
  172. 相关文献 162
  173. 知识点小结 163
  174. 习题 163
  175. 第 12章 模仿学习 165
  176. 12.1 行为克隆 165
  177. 12.1.1 连续控制问题 165
  178. 12.1.2 离散控制问题 166
  179. 12.1.3 行为克隆与强化学习的对比 168
  180. 12.2 逆向强化学习 169
  181. 12.2.1 IRL的基本设定 169
  182. 12.2.2 IRL的基本思想 170
  183. 12.2.3 从黑箱策略反推奖励 170
  184. 12.2.4 用奖励函数训练策略网络 171
  185. 12.3 生成判别模仿学习 171
  186. 12.3.1 生成判别网络 172
  187. 12.3.2 GAIL的生成器和判别器 175
  188. 12.3.3 GAIL的训练 176
  189. 相关文献 178
  190. 知识点小结 179
  191. 第四部分 多智能体强化学习
  192. 第 13章 并行计算 182
  193. 13.1 并行计算基础 182
  194. 13.1.1 并行梯度下降 182
  195. 13.1.2 MapReduce 183
  196. 13.1.3 用 MapReduce实现并行梯度下降 184
  197. 13.1.4 并行计算的代价 187
  198. 13.2 同步与异步 188
  199. 13.2.1 同步算法 188
  200. 13.2.2 异步算法 189
  201. 13.2.3 同步梯度下降与异步梯度下降的对比 191
  202. 13.3 并行强化学习 191
  203. 13.3.1 异步并行双Q学习 191
  204. 13.3.2 A3C:异步并行A2C 193
  205. 相关文献 195
  206. 知识点小结 195
  207. 习题 196
  208. 第 14章 多智能体系统 197
  209. 14.1 常见设定 197
  210. 14.2 基本概念 199
  211. 14.2.1 专业术语 199
  212. 14.2.2 策略网络 200
  213. 14.2.3 动作价值函数 200
  214. 14.2.4 状态价值函数 201
  215. 14.3 实验环境 202
  216. 14.3.1 multi-agent particle world 202
  217. 14.3.2 StarCraft multi-agent challenge 204
  218. 14.3.3 Hanabi Challenge 205
  219. 相关文献 206
  220. 知识点小结 206
  221. 第 15章 完全合作关系设定下的多智能体强化学习 207
  222. 15.1 完全合作关系设定下的策略学习 208
  223. 15.2 完全合作关系设定下的多智能体A2C 209
  224. 15.2.1 策略网络和价值网络 209
  225. 15.2.2 训练和决策 211
  226. 15.2.3 实现中的难点 212
  227. 15.3 三种架构 213
  228. 15.3.1 中心化训练 中心化决策 214
  229. 15.3.2 去中心化训练 去中心化决策 215
  230. 15.3.3 中心化训练 去中心化决策 217
  231. 相关文献 219
  232. 知识点小结 220
  233. 习题 220
  234. 第 16章 非合作关系设定下的多智能体强化学习 221
  235. 16.1 非合作关系设定下的策略学习 222
  236. 16.1.1 非合作关系设定下的目标函数 222
  237. 16.1.2 收敛的判别 223
  238. 16.1.3 评价策略的优劣 223
  239. 16.2 非合作关系设定下的多智能体A2C 224
  240. 16.2.1 策略网络和价值网络 224
  241. 16.2.2 算法推导 225
  242. 16.2.3 训练 226
  243. 16.2.4 决策 227
  244. 16.3 三种架构 227
  245. 16.3.1 中心化训练 中心化决策 227
  246. 16.3.2 去中心化训练 去中心化决策 228
  247. 16.3.3 中心化训练 去中心化决策 229
  248. 16.4 连续控制与MADDPG 231
  249. 16.4.1 策略网络和价值网络 231
  250. 16.4.2 算法推导 232
  251. 16.4.3 中心化训练 234
  252. 16.4.4 去中心化决策 236
  253. 相关文献 237
  254. 知识点小结 237
  255. 第 17章 注意力机制与多智能体强化学习 238
  256. 17.1 自注意力机制 238
  257. 17.1.1 自注意力层 239
  258. 17.1.2 多头自注意力层 241
  259. 17.2 自注意力改进多智能体强化学习 242
  260. 17.2.1 不使用自注意力的状态价值网络 242
  261. 17.2.2 使用自注意力的状态价值网络 243
  262. 17.2.3 使用自注意力的动作价值网络 244
  263. 17.2.4 使用自注意力的中心化策略网络 244
  264. 17.2.5 总结 245
  265. 相关文献 245
  266. 知识点小结 245
  267. 习题 246
  268. 第五部分 应用与展望
  269. 第 18章 AlphaGo与蒙特卡洛树搜索 248
  270. 18.1 强化学习眼中的围棋 248
  271. 18.2 蒙特卡洛树搜索 250
  272. 18.2.1 MCTS的基本思想 250
  273. 18.2.2 MCTS的四个步骤 250
  274. 18.2.3 MCTS的决策 255
  275. 18.3 训练策略网络和价值网络 255
  276. 18.3.1 AlphaGo 2016版本的训练 256
  277. 18.3.2 AlphaGo Zero版本的训练 258
  278. 相关文献 260
  279. 知识点小结 260
  280. 习题 261
  281. 第 19章 现实世界中的应用 262
  282. 19.1 神经网络结构搜索 262
  283. 19.1.1 超参数和交叉验证 262
  284. 19.1.2 强化学习方法 264
  285. 19.2 自动生成SQL语句 266
  286. 19.3 推荐系统 268
  287. 19.4 网约车调度 270
  288. 19.4.1 价值学习 271
  289. 19.4.2 派单机制 271
  290. 19.5 强化学习与监督学习的对比 273
  291. 19.5.1 决策是否改变环境 273
  292. 19.5.2 当前奖励还是长线回报 274

常见问题

《深度强化学习》适合谁读?

适合希望系统学习技术概念、实践方法、工具使用和行业知识的读者。

《深度强化学习》阅读难度高吗?

建议先看简介、目录、作者和相关书籍,再判断是否适合当前阶段阅读。

《深度强化学习》纸质书值得买吗?

当前暂未接入已核验的纸质书购买链接,建议通过出版社、京东、当当等正版渠道核对版本后购买。

《深度强化学习》哪个版本更适合?

优先选择作者、译者、出版社、出版年份和 ISBN 信息清楚的版本;经典作品可优先选择校注、导读或权威出版社版本。

在哪里可以合法获取《深度强化学习》?

当前没有确认授权的电子书下载资源,也暂未接入已核验购买链接;商业出版物不提供未授权下载,建议通过出版社、京东、当当或官方电子书平台核对获取。

如何继续查找《深度强化学习》相关书籍?

可以进入 王树森/黎彧君/张志华 作者页查看其他作品,也可以通过分类、标签、排行榜、人工推荐和“读完这本还可以读”继续发现相近主题。

手机扫码下载

使用手机扫描二维码

扫码后会直接打开下载链接。

电子书下载二维码

手机端点击下载会直接跳转,无需扫码。