G検定
【G検定】word2vecとは?王−男性+女性=女王で有名な単語ベクトル化を解説

「王」−「男性」+「女性」=「女王」。単語の意味を足し算・引き算できるようにした技術として、自然言語処理の歴史に残るのがword2vecです。本記事では、単語をベクトルにするとは何か、CBOWとスキップグラムという2つの学習方式、そしてその後のモデルへの影響をやさしく解説します。

続きを読む
G検定
【G検定】TF-IDFとは?文書の中で重要な単語を見つける計算をわかりやすく解説

文書の中で「どの単語が重要か」を、出現回数だけで決めると「です」「ます」のようなありふれた語ばかりが上位に来てしまいます。この問題を賢く解決するのがTF-IDFです。本記事では、TFとIDFという2つの部品の意味と計算の考え方をやさしく解説します。

続きを読む
G検定
【G検定】PaLMとは?5,400億パラメータのGoogle大規模言語モデルを解説

GPT-3が口火を切った大規模言語モデル競争の中で、Googleが2022年に投入したのがPaLMです。本記事では、5,400億パラメータという規模の意味、PaLM 2への進化とGoogle製品への展開、そして後継Geminiへ続く流れをやさしく解説します。

続きを読む
G検定
【G検定】n-gramとは?テキストをN個ずつ区切る基本手法をわかりやすく解説

文章をコンピュータで扱う最も素朴で強力な方法のひとつが、「N個ずつ区切って数える」ことです。本記事では、自然言語処理の土台であるn-gramの考え方と、ユニグラム・バイグラム・トライグラムの違い、日本語処理での意外な便利さをやさしく解説します。

続きを読む
G検定
【G検定】GPT-nとは?次の単語を予測して文章を生む自己回帰モデルを解説

ChatGPTの頭文字にもなっている「GPT」。その正体は、ひたすら「次の単語」を予測するように訓練された言語モデルの系譜です。本記事では、GPT-nと総称されるモデル群の仕組みと、GPT-3で示された「大規模化の威力」をやさしく解説します。

続きを読む