万本电子书0元读

万本电子书0元读

顶部广告

人工智能超入门丛书--强化学习:人工智能如何知错能改电子书

售       价:¥

纸质售价:¥68.40购买纸书

1人正在读 | 0人评论 6.3

作       者:龚超

出  版  社:化学工业出版社

出版时间:2024-08-01

字       数:9.5万

所属分类: 科技 > 计算机/网络 > 计算机理论与教程

温馨提示:数字商品不支持退换货,不提供源文件,不支持导出打印

为你推荐

  • 读书简介
  • 目录
  • 累计评论(条)
  • 读书简介
  • 目录
  • 累计评论(条)
“人工智能超门丛书”面向人工智能各技术方向零基础的读者,内容涉及数据思维、机器学习、视觉感知、情感分析、搜索算法、强化学习、知识图谱、专家系统等方向,辅以程序代码解决问题,帮助读者快速门。 《数据素养:人工智能如何有据可依》是“人工智能超门丛书”中的分册,主要讲解数据的重要性,重解读处理数据的各种方法,培养读者的数据素养和数据思维。具体内容包括数据规律、数据收集、数据清洗、数据可视化,以及特征构建、图像处理、文本分析等,同时在本书*后一章,分析了各个学科中如何运用数据思维处理问题。 本书内容通俗易懂,可以作为人工智能及计算机相关工作岗位技术人员的门读物,对数据及人工智能方向感兴趣的人群也可以阅读。
目录展开

书名页

内容简介

版权

前言

第1章 强化学习概述

1.1 什么是强化学习

1.1.1 初识强化学习

1.1.2 强化学习的关键要素

1.1.3 监督、无监督与强化学习

1.2 三条主线

1.2.1 试错

1.2.2 动态规划

1.2.3 时序差分

1.3 强化学习的方法与应用

1.3.1 强强联合之深度强化学习

1.3.2 强化学习的跨界赋能

1.3.3 强化学习的分类

第2章 马尔可夫与贝尔曼方程

2.1 “随机”那些事儿

2.1.1 概率的基本概念

2.1.2 网格迷宫的探索

2.1.3 探索的策略与奖励

2.1.4 探索的足迹

2.2 马尔可夫大家族

2.2.1 马尔可夫过程

2.2.2 马尔可夫奖励过程

2.2.3 马尔可夫决策过程

2.3 贝尔曼方程

2.3.1 价值函数与动作价值函数

2.3.2 贝尔曼方程

2.3.3 贝尔曼最优方程

第3章 动态规划

3.1 动态规划基础与环境

3.1.1 动态规划基础

3.1.2 环境:冰湖

3.2 策略迭代算法

3.2.1 原理

3.2.2 代码

3.3 价值迭代算法

3.3.1 原理

3.3.2 代码

第4章 蒙特卡洛

4.1 随机变量的数字特征

4.1.1 期望

4.1.2 方差

4.2 蒙特卡洛方法与应用

4.2.1 圆面积的估计

4.2.2 均值估计

4.3 蒙特卡洛与强化学习

4.3.1 原理

4.3.2 环境:21点

4.3.3 代码

第5章 时序差分

5.1 时序差分

5.1.1 时序差分基础

5.1.2 环境:悬崖漫步

5.2 Sarsa算法

5.2.1 原理

5.2.2 代码

5.3 Q-Learning算法

5.3.1 原理

5.3.2 代码

第6章 深度强化学习

6.1 DQN入门

6.1.1 DQN的基本概念

6.1.2 环境:车杆

6.2 BP神经网络+强化学习

6.2.1 原理

6.2.2 代码

6.3 卷积神经网络+强化学习

6.3.1 原理

6.3.2 代码

6.4 DQN的改进

第7章 策略学习

7.1 策略梯度算法

7.1.1 策略梯度原理

7.1.2 REINFORCE算法

7.1.3 代码

7.2 Actor-Critic算法

7.2.1 原理

7.2.2 环境:LunarLander

7.2.3 代码

7.3 其他基于策略的算法

附录

附录A 环境设置与行为探索

A.1 Gym库与环境设置

A.2 具有人类偏好的多智能体强化学习

附录B 博弈与策略

B.1 什么是博弈

B.2 混合策略博弈

B.3 序贯博弈

B.4 无限博弈与有限博弈

附录C 收益衡量

C.1 理性收益:期望价值

C.2 效用收益:期望效用

C.3 情感收益:前景理论

累计评论(条) 个书友正在讨论这本书 发表评论

发表评论

发表评论,分享你的想法吧!

买过这本书的人还买过

读了这本书的人还在读

回顶部