見出し画像

Gymで強化学習⑰SARSA:実装編

前回はTD学習法の理論について解説しました。今回は、オンポリシーでTD学習法を行うSARSAについて解説し実装します。

まずは、SARSAをオンポリシーのTD学習法として導入してから実装を解説します。

SARSAの仕組み

前回はTD学習法で状態価値関数を更新する方法について解説しました。最終的には次のような更新式になりました。

ここから先は

14,817字 / 1画像

キカベン・読み放題

¥1,000 / 月
初月無料
このメンバーシップの詳細

この記事が気に入ったらサポートをしてみませんか?