为你推荐

书名页
内容简介
版权
前言
第1章 强化学习概述
1.1 什么是强化学习
1.1.1 初识强化学习
1.1.2 强化学习的关键要素
1.1.3 监督、无监督与强化学习
1.2 三条主线
1.2.1 试错
1.2.2 动态规划
1.2.3 时序差分
1.3 强化学习的方法与应用
1.3.1 强强联合之深度强化学习
1.3.2 强化学习的跨界赋能
1.3.3 强化学习的分类
第2章 马尔可夫与贝尔曼方程
2.1 “随机”那些事儿
2.1.1 概率的基本概念
2.1.2 网格迷宫的探索
2.1.3 探索的策略与奖励
2.1.4 探索的足迹
2.2 马尔可夫大家族
2.2.1 马尔可夫过程
2.2.2 马尔可夫奖励过程
2.2.3 马尔可夫决策过程
2.3 贝尔曼方程
2.3.1 价值函数与动作价值函数
2.3.2 贝尔曼方程
2.3.3 贝尔曼最优方程
第3章 动态规划
3.1 动态规划基础与环境
3.1.1 动态规划基础
3.1.2 环境:冰湖
3.2 策略迭代算法
3.2.1 原理
3.2.2 代码
3.3 价值迭代算法
3.3.1 原理
3.3.2 代码
第4章 蒙特卡洛
4.1 随机变量的数字特征
4.1.1 期望
4.1.2 方差
4.2 蒙特卡洛方法与应用
4.2.1 圆面积的估计
4.2.2 均值估计
4.3 蒙特卡洛与强化学习
4.3.1 原理
4.3.2 环境:21点
4.3.3 代码
第5章 时序差分
5.1 时序差分
5.1.1 时序差分基础
5.1.2 环境:悬崖漫步
5.2 Sarsa算法
5.2.1 原理
5.2.2 代码
5.3 Q-Learning算法
5.3.1 原理
5.3.2 代码
第6章 深度强化学习
6.1 DQN入门
6.1.1 DQN的基本概念
6.1.2 环境:车杆
6.2 BP神经网络+强化学习
6.2.1 原理
6.2.2 代码
6.3 卷积神经网络+强化学习
6.3.1 原理
6.3.2 代码
6.4 DQN的改进
第7章 策略学习
7.1 策略梯度算法
7.1.1 策略梯度原理
7.1.2 REINFORCE算法
7.1.3 代码
7.2 Actor-Critic算法
7.2.1 原理
7.2.2 环境:LunarLander
7.2.3 代码
7.3 其他基于策略的算法
附录
附录A 环境设置与行为探索
A.1 Gym库与环境设置
A.2 具有人类偏好的多智能体强化学习
附录B 博弈与策略
B.1 什么是博弈
B.2 混合策略博弈
B.3 序贯博弈
B.4 无限博弈与有限博弈
附录C 收益衡量
C.1 理性收益:期望价值
C.2 效用收益:期望效用
C.3 情感收益:前景理论
买过这本书的人还买过
读了这本书的人还在读
同类图书排行榜