倒立振子で学ぶ DQN (Deep Q Network)
強化学習の一手法であるQ-learning とディープニューラルネットを組み合わせた Deep Q Network、通称DQNを使って倒立振子の振り上げ問題を解決してみます。
ディープニューラルネットQは状態観測結果のシーケンスを入力すると、各行動の行動価値を出力するネットです。行動価値は、今回の場合は「入力された角度シーケンスの示す状況では、モータを右、左に回すのはそれぞれ、どれぐらいうれしいか」ということを示すベクタになります。
Best ERは小さな成功にとらわれすぎてハマる場合があると思います。あとは環境の変化にも十分対応できませんね。過去の栄光にとらわれてしまうので。なんだか先ほどの黄金時代の件といい、つい人生論に重ねたくなってしまいますが、まあ、タスクによる、ということですね。
人気ホテルが最大78%OFF
200社の予約サイトから料金を一括比較
最安値の宿泊プランをご案内
www.trivago.jp