G検定
【G検定】マルチエージェント強化学習(MARL)とは?協調と競合を学ぶAIをわかりやすく解説

サッカーは1人ではできません。味方と連携し、相手の作戦を読み合うからこそ難しく、面白いのです。AIの世界でも同じで、複数のAIエージェントが同じ環境で学び合う「マルチエージェント強化学習」は、1体だけの強化学習にはない独特の難しさと可能性を持っています。OpenAI FiveやAlphaStarといった有名AIの土台になった考え方です。

続きを読む
G検定
【G検定】ロジスティック回帰とは?名前は回帰でも分類のアルゴリズム!仕組みをやさしく解説

「回帰」という名前なのに、解くのは分類問題——ロジスティック回帰は、G検定で最も引っかけに使われやすいキーワードの1つです。線形回帰との関係、シグモイド関数の役割、ソフトマックス関数への拡張まで、名前の紛らわしさごと整理して解説します。

続きを読む
G検定
【G検定】報酬成形(Reward Shaping)とは?疎な報酬を補う中間報酬の設計をわかりやすく解説

「ゴールしたら100点、それ以外は0点」——このルールだけで複雑な課題を学ばせようとすると、エージェントは最初の1点にたどり着く前に迷子になってしまいます。報酬成形(Reward Shaping)は、最終目標までの道のりに「中間報酬」という道しるべを置いて学習を導く手法です。強化学習を実務に使ううえで避けて通れない、報酬設計の中心的なキーワードです。

続きを読む
G検定
【G検定】ランダムフォレストとは?決定木×バギングで精度を上げる仕組みを解説

1本の決定木は分かりやすい反面、過学習しやすいのが弱点です。それなら「たくさんの木を育てて多数決を取ればいい」——この発想を形にしたのがランダムフォレストです。名前のとおり、ランダムに作った木の「森」で予測します。

続きを読む
G検定
【G検定】ノイジーネットワークとは?重みにノイズを加えて探索するDQN改良をわかりやすく解説

強化学習のエージェントは、いま知っている最善手ばかり選んでいると、もっと良い手を見つけられません。かといってサイコロ任せのランダム行動ばかりでは学習が進まない——。この「探索と活用のジレンマ」に対して、ネットワークの重みそのものにノイズを仕込むという一風変わった答えを出したのがノイジーネットワークです。DQNの改良手法群の一つとして押さえておきたいキーワードです。

続きを読む