G検定
【G検定】フォルマントとは?声道の共鳴が生む音声スペクトルのピークを解説

「あ」と「い」を、私たちはなぜ聞き分けられるのでしょうか。その答えの中心にあるのが、今回のキーワード「フォルマント」です。音声処理の分野で最も基本となる概念のひとつなので、仕組みからじっくり理解していきましょう。

続きを読む
G検定
【G検定】パルス符号変調(PCM)とは?標本化・量子化・符号化の3ステップを解説

マイクで拾った「音の波」を、コンピュータが扱える「0と1の列」に変える最も基本的な方法が、パルス符号変調(PCM)です。音声認識も音声合成も、すべてはこの変換から始まります。

続きを読む
G検定
【G検定】スペクトル包絡とは?声道の共鳴特性とケプストラム分析をわかりやすく解説

同じ「あ」を同じ高さで発音しても、誰の声かはすぐ分かります。この「声の音色」の正体が、スペクトルのなだらかな輪郭——スペクトル包絡です。音素の識別にも話者の特徴づけにも関わる、音声の特徴量を理解するうえで要となる概念を解説します。

続きを読む
G検定
【G検定】高速フーリエ変換(FFT)とは?音声を周波数成分に分解する仕組みを解説

音は空気の振動、つまり時間とともに変化する波です。この波に「どの高さの音がどれだけ含まれているか」を教えてくれるのがフーリエ変換で、それを現実的な計算時間で実行できるようにしたアルゴリズムが高速フーリエ変換(FFT)です。音声認識の特徴量抽出はここから始まります。

続きを読む
G検定
【G検定】隠れマルコフモデル(HMM)とは?音声認識を支えた確率モデルをわかりやすく解説

ディープラーニング以前の音声認識を数十年にわたって支えた主役が、隠れマルコフモデル(HMM)です。「見えない状態」を「見える観測データ」から確率的に推定するこのモデルは、話す速さも人によって違う音声という厄介な時系列データを見事に扱いました。歴史的な位置づけまで含めて理解しておきたい重要キーワードです。

続きを読む