Skip to content

DNET_ReinforcementLearning

nishi_74322014 edited this page Sep 11, 2026 · 1 revision

強化学習(Reinforcement Learning)

概要

一般的に、強化学習は、以下の2つのループで良い方策を編み出す。

  1. 状態を観測 → 行動を選択 → 環境から次の状態と報酬を得る(状態⇔行動ループ)
  2. 集めた経験データから価値を評価 → より良い行動を選択する方策を更新(データ収集⇔行動選択ループ)

この2つのループが同時に回ることで、
試行錯誤を通じて長期的に報酬を最大化する最適な行動ルールが生まれる。

詳細

強化学習深層強化学習がある。

強化学習

価値ベース

  • 多腕バンディット問題
  • 動的計画法
  • モンテカルロ法
  • TD法系
    • TD法
    • Q学習
    • SARSA

方策ベース

  • 方策勾配法

深層強化学習

価値ベース

  • DQN

方策ベース

  • Actor-Critic
  • A3C

参考

YouTube

AIcia Solid Project

再生リスト 強化学習の探検 - YouTube
https://www.youtube.com/playlist?list=PLhDAH9aTfnxI1OywfnxXCDTWGtYL2NxJR

データサイエンス研究所

再生リスト 強化学習 - YouTube
https://www.youtube.com/playlist?list=PL7BUpEjz_maQjfwIhAzkwxaLYIecfN7QP

ゼロから作るDeep Learning

サンプル

https://github.com/oreilly-japan/deep-learning-from-scratch-4

その他、参考


Tags: 移行, サービス, DX, AI, 強化学習, 開発基盤

NetDevInfraWiki

マイクロソフト系技術情報 Wiki
Open 棟梁 Wiki

(未着手)

開発基盤部会 Wiki

移行管理: DONETODO

Clone this wiki locally