第1版第2刷(および第1版第1刷)

<訂正>2024年5月17日

3章 教師あり学習
・p.69の下から1行目

誤:また、中間層と出力層はそれぞれ複数のユニットで構成されています。
正:また、中間層は複数のユニットで、出力層は1つのユニットで構成されています。

<訂正>2024年5月23日

5章 基本のQ学習:tableQ
・p.157の12行目

誤:確率的な(-1+γmaxQ([0120],a))の値の期待値に右辺のQ([0120],a)を収束させようとする狙いもあります。
正:確率的な(-1+γmaxQ([0120],a))の値の期待値に左辺のQ([1020],進む)を収束させようとする狙いもあります。

第1版第1刷(第1版第2刷以降は修正済み)

<訂正>2021年11月16日

講座B Pythonの基本
・p.365の下から3行目

誤:__init__()という必ず定義しなくてはいけないメソッドと、
正:__init__()という初期化用のメソッドと、

<訂正>2022年1月4日

4章 強化学習の問題設定
・p.129の下から3行目

誤:=(-1)+0.5×(-1)+0.52×(-1)+0.53×(-1)=-1.111
正:=(-1)+0.1×(-1)+0.12×(-1)+0.13×(-1)=-1.111

5章 基本のQ学習:tableQ
・p.135の本文の下から1行目

誤:Vの更新を100回繰り返し、
正:Vの更新を60回繰り返し、

<訂正>2022年9月22日

5章 基本のQ学習:tableQ
・p.159の図5-15の左の「エプシロン-グリーディー法」の中の説明文

誤:εの確率で
正:1-εの確率で

誤:1-εの確率で
正:εの確率で

・p.192の上から4行目

誤:次の状態next_obsを決め
正:次の観測next_obsを決め

・p.192の上から6行目

誤:次の状態next_obsの情報を
正:次の観測next_obsの情報を

<補足>2023年2月1日

5章 基本のQ学習:tableQ
・p.141の16行目

補足前:以下の式が導けます。
補足後:以下の式が導けます。以下の式では、式(5-6)の左辺のVをV(t)、右辺のVをV(t-1)、右辺のTをT(t)としています。

以上、お詫びして訂正いたします。
情報は随時更新いたします。