【G検定】報酬成形(Reward Shaping)とは?疎な報酬を補う中間報酬の設計をわかりやすく解説
2026年5月30日
「ゴールしたら100点、それ以外は0点」——このルールだけで複雑な課題を学ばせようとすると、エージェントは最初の1点にたどり着く前に迷子になってしまいます。報酬成形(Reward Shaping)は、最終目標までの道のりに「中間報酬」という道しるべを置いて学習を導く手法です。強化学習を実務に使ううえで避けて通れない、報酬設計の中心的なキーワードです。
【G検定】ランダムフォレストとは?決定木×バギングで精度を上げる仕組みを解説
2026年5月30日
1本の決定木は分かりやすい反面、過学習しやすいのが弱点です。それなら「たくさんの木を育てて多数決を取ればいい」——この発想を形にしたのがランダムフォレストです。名前のとおり、ランダムに作った木の「森」で予測します。
【G検定】ノイジーネットワークとは?重みにノイズを加えて探索するDQN改良をわかりやすく解説
2026年5月29日
強化学習のエージェントは、いま知っている最善手ばかり選んでいると、もっと良い手を見つけられません。かといってサイコロ任せのランダム行動ばかりでは学習が進まない——。この「探索と活用のジレンマ」に対して、ネットワークの重みそのものにノイズを仕込むという一風変わった答えを出したのがノイジーネットワークです。DQNの改良手法群の一つとして押さえておきたいキーワードです。
【G検定】マージン最大化とは?SVMの決定境界とハードマージン・ソフトマージンを解説
2026年5月29日
サポートベクターマシン(SVM)は、なぜ未知のデータにも強い分類ができるのか——その答えが「マージン最大化」です。境界線を「一番余裕を持って」引くというシンプルな発想と、ハードマージン・ソフトマージンの違いをやさしく解説します。
【G検定】ドメインランダマイゼーションとは?リアリティギャップを克服するsim2realの鍵を解説
2026年5月29日
シミュレーションの中では完璧に動くロボットが、現実世界に出した途端まったく動かない——。この「シミュレーションと現実のズレ」はリアリティギャップと呼ばれ、強化学習をロボットに応用するときの最大の壁です。ドメインランダマイゼーションは、シミュレーションをあえてランダムに変化させることでこの壁を乗り越える、発想の転換が光る手法です。
