G検定
【G検定】ランダムフォレストとは?決定木×バギングで精度を上げる仕組みを解説

1本の決定木は分かりやすい反面、過学習しやすいのが弱点です。それなら「たくさんの木を育てて多数決を取ればいい」——この発想を形にしたのがランダムフォレストです。名前のとおり、ランダムに作った木の「森」で予測します。

続きを読む
G検定
【G検定】ノイジーネットワークとは?重みにノイズを加えて探索するDQN改良をわかりやすく解説

強化学習のエージェントは、いま知っている最善手ばかり選んでいると、もっと良い手を見つけられません。かといってサイコロ任せのランダム行動ばかりでは学習が進まない——。この「探索と活用のジレンマ」に対して、ネットワークの重みそのものにノイズを仕込むという一風変わった答えを出したのがノイジーネットワークです。DQNの改良手法群の一つとして押さえておきたいキーワードです。

続きを読む
G検定
【G検定】マージン最大化とは?SVMの決定境界とハードマージン・ソフトマージンを解説

サポートベクターマシン(SVM)は、なぜ未知のデータにも強い分類ができるのか——その答えが「マージン最大化」です。境界線を「一番余裕を持って」引くというシンプルな発想と、ハードマージン・ソフトマージンの違いをやさしく解説します。

続きを読む
G検定
【G検定】ドメインランダマイゼーションとは?リアリティギャップを克服するsim2realの鍵を解説

シミュレーションの中では完璧に動くロボットが、現実世界に出した途端まったく動かない——。この「シミュレーションと現実のズレ」はリアリティギャップと呼ばれ、強化学習をロボットに応用するときの最大の壁です。ドメインランダマイゼーションは、シミュレーションをあえてランダムに変化させることでこの壁を乗り越える、発想の転換が光る手法です。

続きを読む
G検定
【G検定】デュエリングネットワークとは?Q値を状態価値とアドバンテージに分解するDQN改良を解説

ゲームをプレイするAIの代名詞であるDQN(Deep Q-Network)には、実は「どの行動を選んでも大差ない場面でも、行動ごとにいちいち価値を学び直す」という無駄がありました。この無駄を、Q値を2つの部品に分解することで解消したのがデュエリングネットワークです。深層強化学習のDQN改良ファミリーの中でも、試験で仕組みを問われやすい代表格です。

続きを読む