G検定
【G検定】AdaDeltaとは?AdaGradの学習停滞を直し学習率設定を不要にした手法を解説

AdaGradの「学習が進むほど学習率が小さくなりすぎて止まる」という弱点を、過去の勾配を少しずつ「忘れる」ことで解決したのがAdaDeltaです。さらに、そもそも学習率をほとんど手動設定しなくてよいという独自の特長を持ちます。RMSPropと似た発想の兄弟手法として、系譜の中での位置づけを整理しましょう。

続きを読む
G検定
【G検定】最尤法とは?コイン投げの例で「もっともらしさ」を最大化する推定を解説

コインを10回投げて表が7回出たら、このコインの表が出る確率はいくつと見積もるのが自然でしょうか。直感どおり「0.7」と答えを出してくれるのが最尤法です。「観測されたデータが最も起こりやすくなるパラメータを選ぶ」という統計学の基本戦略で、深層学習の学習則にまでつながる重要概念を解説します。

続きを読む
G検定
【G検定】AdaBoundとは?AdamからSGDへ滑らかに移行する最適化アルゴリズムを解説

序盤はAdamのように速く、終盤はSGDのように堅実に——。2つの人気オプティマイザの「いいとこ取り」を目指したのがAdaBoundです。学習率に動的な上限と下限を設けるというシンプルな発想で、Adamの弱点だった学習率の暴れを抑え込みます。最適化手法の系譜の「合流点」として位置を押さえましょう。

続きを読む
G検定
【G検定】最頻値とは?平均値・中央値との違いと使いどころをやさしく解説

データの「代表的な値」を1つ挙げるなら平均値——とは限りません。年収のように極端な値を含むデータや、服のサイズのような集計では、「最も多く現れる値」=最頻値のほうが実態を表すことがあります。平均値・中央値と並ぶ第3の代表値の性質と使いどころを解説します。

続きを読む
G検定
【G検定】連鎖律とは?誤差逆伝播法を支える合成関数の微分ルールをわかりやすく解説

何十層も重なったニューラルネットワークの膨大な重みを、なぜ効率よく調整できるのか。その数学的な土台が、高校数学にも登場する合成関数の微分ルール「連鎖律(チェーンルール)」です。誤差逆伝播法は、この連鎖律をネットワーク全体に系統的に適用したものにほかなりません。

続きを読む