見出し画像

Gymで強化学習⑥ベルマン方程式

前回の記事ではマルコフ決定過程について解説しました。今回は、ベルマン方程式を導いて強化学習において報酬の最大化の意味を数式化します。

ベルマン方程式は、これまでに導入した概念を数式化していけばたどり着くことができます。なお、期待値や割引率などこれまで話していないことも登場しますが計算としては単純なので追って解説します。

最終的にはポリシーを含めたベルマン方程式から強化学習の全体像を見渡します。

では、一つ一つ強化学習の概念を数式化していきましょう。

ここから先は

6,184字 / 1画像

キカベン・読み放題

¥1,000 / 月
初月無料
このメンバーシップの詳細

この記事が気に入ったらサポートをしてみませんか?