【G検定】残差強化学習とは?既存の制御に「差分」だけ学習で上乗せする手法を解説
2026年5月28日
強化学習をゼロから始めると、まともに動くようになるまで膨大な試行錯誤が必要です。しかし、人間が設計したそこそこ動く制御がすでに手元にあるなら、その「足りない分」だけを学習すればよいのでは?——この発想を形にしたのが残差強化学習です。
【G検定】ブースティングとは?弱学習器を逐次強化する仕組みとAdaBoostを解説
2026年5月28日
ひとつ前のモデルが間違えた問題に印をつけ、次のモデルはその問題を重点的に学ぶ——弱いモデルの列が、誤りを引き継ぎながら1つの強いモデルへ育っていく。これがブースティングです。この記事では「逐次学習」「誤分類データへの重み付け」「弱学習器から強いモデルへ」というブースティング固有の駆動原理を軸に解説します。
【G検定】オフライン強化学習とは?過去データだけで方策を学ぶ手法と課題を解説
2026年5月28日
医療や自動運転で強化学習を使いたくても、「試しに失敗してみる」わけにはいきません。そこで、環境との新たな相互作用を一切行わず、過去に集めたデータだけで方策を学ぶのがオフライン強化学習です。安全にエッジの効いた方策を学べる一方、独特の落とし穴もあります。
【G検定】バギングとは?ブートストラップと多数決で過学習を抑える仕組みを解説
2026年5月28日
1人の専門家に全部を任せるより、少しずつ違う経験を積んだ専門家たちに独立に意見を出させて多数決を取る——これがバギングの発想です。アンサンブル学習の代表格で、ランダムフォレストの土台でもあります。この記事では「並列」「ブートストラップ」「多数決・平均」というバギング固有のメカニズムを掘り下げます。
【G検定】アルファスター(AlphaStar)とは?StarCraft IIを制したDeepMindのAIを解説
2026年5月28日
囲碁のAlphaGoで世界を驚かせたDeepMindが、次に挑んだのはリアルタイム戦略ゲーム『StarCraft II』でした。視界の外は見えず、リアルタイムで判断し続け、長期の戦略も要る——この難関でトッププレイヤ級の実力に到達したのがアルファスター(AlphaStar)です。
