G検定
【G検定】マージン最大化とは?SVMの決定境界とハードマージン・ソフトマージンを解説

サポートベクターマシン(SVM)は、なぜ未知のデータにも強い分類ができるのか——その答えが「マージン最大化」です。境界線を「一番余裕を持って」引くというシンプルな発想と、ハードマージン・ソフトマージンの違いをやさしく解説します。

続きを読む
G検定
【G検定】ドメインランダマイゼーションとは?リアリティギャップを克服するsim2realの鍵を解説

シミュレーションの中では完璧に動くロボットが、現実世界に出した途端まったく動かない——。この「シミュレーションと現実のズレ」はリアリティギャップと呼ばれ、強化学習をロボットに応用するときの最大の壁です。ドメインランダマイゼーションは、シミュレーションをあえてランダムに変化させることでこの壁を乗り越える、発想の転換が光る手法です。

続きを読む
G検定
【G検定】デュエリングネットワークとは?Q値を状態価値とアドバンテージに分解するDQN改良を解説

ゲームをプレイするAIの代名詞であるDQN(Deep Q-Network)には、実は「どの行動を選んでも大差ない場面でも、行動ごとにいちいち価値を学び直す」という無駄がありました。この無駄を、Q値を2つの部品に分解することで解消したのがデュエリングネットワークです。深層強化学習のDQN改良ファミリーの中でも、試験で仕組みを問われやすい代表格です。

続きを読む
G検定
【G検定】ベクトル自己回帰モデル(VAR)とは?複数の時系列を同時に扱う仕組みを解説

気温とアイスの売上、金利と株価——世の中の時系列データは、互いに影響し合いながら動いています。この「複数の時系列の絡み合い」をまとめて扱えるのが、ベクトル自己回帰モデル(VARモデル)です。

続きを読む
G検定
【G検定】ダブルDQNとは?Q値の過大評価を「選択と評価の分離」で抑える改良を解説

DQNには「自分の実力を高く見積もりすぎる」という癖があります。行動を選ぶときも評価するときも同じネットワークの「最大値」を使うため、たまたま高く出た推定誤差を拾い続けてしまうのです。この過大評価を、2つのネットワークの役割分担で抑えたのがダブルDQNです。

続きを読む