【問63】DXパスポート試験 練習問題|強化学習の仕組みと報酬
AI 問3/20難易度B(標準)
問題文
ロボットが歩き方を試行錯誤し、うまく進めたときに高い報酬を得ることで、報酬を最大化する行動を学んでいく。この学習方式として適切なものはどれか。
- 1.教師あり学習
- 2.教師なし学習
- 3.転移学習
- 4.強化学習
解説
正解は4。強化学習は、学習の主体(エージェント)が環境の中で行動を選び、その結果として得られる報酬を手がかりに、試行錯誤を重ねながら、将来にわたる報酬の合計が最大になる行動の選び方を学ぶ方式である。正解のラベルを前もって与えるのではなく、行動の結果に応じた報酬が学習の手がかりになる点が特徴で、ロボットの制御やゲームの戦略の学習などに使われる。1は誤り。教師あり学習は、入力と正解のラベルの組から学ぶ方式である。2は誤り。教師なし学習は、正解も報酬も与えず、データの構造や似た傾向を見つける方式である。3は誤り。転移学習は、ある課題で学習済みのモデルの知識を、別の関連した課題に再利用する方法で、報酬を最大化する学習方式ではない。