G検定
【G検定】線形回帰とは?直線で予測する基本モデルとラッソ回帰・リッジ回帰を解説

散らばったデータ点に「最も当てはまる直線」を1本引く——線形回帰は、機械学習のあらゆる回帰手法の出発点です。シンプルですが、正則化を加えたラッソ回帰・リッジ回帰まで含めて、G検定で確実に問われる重要キーワードです。

続きを読む
G検定
【G検定】PPOとは?クリッピングで方策更新を安定させる強化学習アルゴリズムを解説

強化学習で方策を更新するとき、一度に大きく変えすぎると学習が壊れてしまう——。この問題を「更新幅のクリッピング」というシンプルな工夫で解決したのがPPOです。OpenAI FiveやChatGPTのRLHFにも使われた、現代強化学習の定番アルゴリズムです。

続きを読む
G検定
【G検定】サポートベクターマシン(SVM)とは?マージン最大化とカーネルトリックを解説

2つのグループを分ける線は無数に引けます。その中で「どちらのグループからも最も余裕をもって離れた線」を選ぶ——このシンプルで美しい発想がサポートベクターマシン(SVM)です。ディープラーニング以前の機械学習を代表する手法で、G検定ではマージン最大化・スラック変数・カーネルトリックの用語がまとめて問われます。

続きを読む
G検定
【G検定】OpenAI Fiveとは?Dota 2の世界王者を破った深層強化学習AIを解説

5人対5人で戦う複雑なオンラインゲーム『Dota 2』で、世界大会の優勝チームに勝利したAI——それがOpenAI Fiveです。囲碁やチェスとは次元の違う複雑さを持つゲームを深層強化学習で攻略した事例として、G検定の「深層強化学習」の応用例で登場します。

続きを読む
G検定
【G検定】DQNとは?経験再生とターゲットネットワークの2大工夫を徹底解説

「ゲーム画面を見ただけで、人間並みにゲームをプレイするAI」──深層強化学習ブームの火付け役となったのがDQN(Deep Q-Network)です。Q学習とディープラーニングの結婚、そしてそれを安定させた「経験再生」と「ターゲットネットワーク」という2大工夫を、順を追って理解しましょう。

続きを読む