G検定
【G検定】高速フーリエ変換(FFT)とは?音声を周波数成分に分解する仕組みを解説

音は空気の振動、つまり時間とともに変化する波です。この波に「どの高さの音がどれだけ含まれているか」を教えてくれるのがフーリエ変換で、それを現実的な計算時間で実行できるようにしたアルゴリズムが高速フーリエ変換(FFT)です。音声認識の特徴量抽出はここから始まります。

続きを読む
G検定
【G検定】隠れマルコフモデル(HMM)とは?音声認識を支えた確率モデルをわかりやすく解説

ディープラーニング以前の音声認識を数十年にわたって支えた主役が、隠れマルコフモデル(HMM)です。「見えない状態」を「見える観測データ」から確率的に推定するこのモデルは、話す速さも人によって違う音声という厄介な時系列データを見事に扱いました。歴史的な位置づけまで含めて理解しておきたい重要キーワードです。

続きを読む
G検定
【G検定】音素とは?意味を区別する最小の音の単位と音声認識での役割を解説

「きん(金)」と「ぎん(銀)」——たった1つの音の違いで意味がまるで変わります。この「意味を区別する最小の音の単位」が音素です。音声認識システムは音声をいったん音素に分解してから単語を組み立てるため、音素は音声処理の土台となる概念です。対になる用語「音韻」との違いも含めて整理しましょう。

続きを読む
G検定
【G検定】音声認識とは?HMMからディープラーニング・End-to-Endまでの仕組みを解説

「OK Google」「Hey Siri」と話しかけるだけで機械が言葉を文字に起こしてくれる——それが音声認識です。長年は隠れマルコフモデル(HMM)が主役でしたが、ディープラーニングの導入で精度が飛躍的に向上しました。この記事では処理の流れと、HMMからEnd-to-Endモデルへという技術の変遷を整理します。

続きを読む
G検定
【G検定】音声合成とは?波形接続・パラメトリック方式からWaveNetまでを解説

駅のアナウンス、カーナビの案内、スマホの読み上げ機能——私たちが毎日耳にする「機械の声」の多くは音声合成で作られています。録音を再生しているのではなく、テキストからその場で音声を生み出す技術です。ディープラーニングの登場で品質が一変した、音声処理の代表的な応用分野を見ていきましょう。

続きを読む