G検定
【G検定】A-D変換とは?標本化・量子化・符号化の3ステップをわかりやすく解説

マイクで拾った人間の声は、連続的に変化するアナログ信号です。ところがコンピュータが扱えるのは0と1のデジタルデータだけ。この橋渡しをするのがA-D変換(アナログ-デジタル変換)です。音声認識の一番最初に必ず登場する、音声処理の入口となる処理です。

続きを読む
G検定
【G検定】大規模言語モデル(LLM)とは?GPT・BERTの仕組みと課題をわかりやすく解説

ChatGPTをはじめとする生成AIブームの中心にいるのが、大規模言語モデル(LLM)です。膨大なテキストデータで「言葉の確率」を学び切った巨大なニューラルネットワークは、翻訳・要約・対話といった多様なタスクを1つのモデルでこなします。この記事では、その仕組みと「大規模」の意味、そして残された課題を整理します。

続きを読む
G検定
【G検定】ワンホットベクトルとは?単語の数値化の出発点とその限界をわかりやすく解説

「犬」=[1, 0, 0]、「猫」=[0, 1, 0]、「鳥」=[0, 0, 1]。単語を数値にする最もシンプルな方法がワンホットベクトルです。仕組みは一目でわかるほど単純ですが、「なぜこれではダメで、分散表現が生まれたのか」という限界とセットで理解することが、自然言語処理の学習の出発点になります。

続きを読む
G検定
【G検定】文書要約とは?抽出型と抽象型の違い・BERTSUMやT5をわかりやすく解説

長いニュース記事の要点を3行で、会議の議事録を1段落で——文章から重要な情報を取り出して短くまとめる「要約」を機械にやらせる技術が文書要約です。要点を「抜き出す」抽出型と、内容を理解して「書き直す」抽象型という2つのアプローチの違いが、このキーワード最大のポイントです。

続きを読む
G検定
【G検定】分散表現とは?one-hot表現との違いと「意味をベクトルで持つ」考え方を解説

「犬」という単語の意味を、たった1つのスイッチのON/OFFではなく、数百個の数値の組み合わせに「分散」させて持たせる——これが分散表現の発想です。単語の意味をコンピュータが計算できる形にするこの考え方は、word2vecからBERTまで、現代の自然言語処理を貫く基本概念になっています。

続きを読む