G検定
【G検定】割引率とは?強化学習で将来の報酬を割り引く理由をわかりやすく解説

強化学習のエージェントは「将来もらえる報酬の合計」を最大化しようとします。しかし、遠い将来の報酬を目先の報酬とまったく同じ重さで数えてよいのでしょうか。この疑問に答えるのが割引率です。この記事では、割引率の意味と、値の大小でエージェントの行動がどう変わるかを解説します。

続きを読む
G検定
【G検定】マルコフ決定過程(MDP)とは?マルコフ性と強化学習の定式化を解説

強化学習の教科書がQ学習や方策勾配法を語れるのは、その前提として問題を数学の土俵に載せる「型」があるからです。それがマルコフ決定過程(MDP)です。この記事では、鍵となる「マルコフ性」の意味から、MDPが強化学習をどう定式化するのかまでを解説します。

続きを読む
G検定
【G検定】Image Captioningとは?画像を自然言語で説明するAI技術をわかりやすく解説

犬の写真を入力すると「公園で遊ぶ茶色の犬」という文章が返ってくる——画像の内容を言葉で説明するこの技術がImage Captioning(画像キャプション生成)です。G検定のマルチモーダル分野では、逆方向のText-To-Imageとペアで問われる代表的タスクです。

続きを読む
G検定
【G検定】Flamingoとは?少数の例示で学ぶDeepMindの視覚言語モデルを解説

たった数個のお手本を見せるだけで、画像への質問応答もキャプション生成もこなしてしまう——それがDeepMindの視覚言語モデルFlamingoです。G検定では「few-shot learningに特化した視覚言語モデル」という一言の定義と、CLIPなど他のマルチモーダルモデルとの違いが問われます。

続きを読む
G検定
【G検定】方策勾配法とは?方策を直接学習するアプローチをわかりやすく解説

強化学習には「価値を学んで間接的に行動を決める」道と、「行動の選び方そのものを直接鍛える」道があります。方策勾配法は後者の代表で、ロボット制御のように選択肢が無数にある問題で真価を発揮します。価値ベースとの対比で理解していきましょう。

続きを読む