G検定
【G検定】データリーケージとは?モデル性能を過大評価させる情報の漏れをわかりやすく解説

「検証では精度95%だったのに、本番では全然当たらない」——機械学習の現場で繰り返し起こるこの怪現象の主犯格がデータリーケージです。本来予測時には手に入らないはずの情報が、こっそり学習に混入してしまう。本記事では、リーケージが起こる典型パターン(目的変数由来の特徴量・前処理での漏れ・時間の漏れ)と防ぎ方をやさしく解説します。

続きを読む
G検定
【G検定】サンプリング・バイアスとは?データの偏りがAIを狂わせる仕組みをわかりやすく解説

「たくさんデータを集めたのに、AIの予測が実際には全然当たらない」——その原因の定番が、集めたデータそのものの偏り、サンプリング・バイアスです。本記事では、データ収集から学習までの各段階でどのように偏りが入り込むのか、なぜモデルの信頼性を損なうのか、どう防ぐのかをやさしく解説します。

続きを読む
G検定
【G検定】カルバック・ライブラー情報量(KLダイバージェンス)とは?分布の差を測る指標を解説

「2つの確率分布はどれくらい似ているのか」を数値で表したい——そんなときに使われるのがカルバック・ライブラー情報量です。生成モデルやベイズ推論を学ぶうえで避けて通れない指標を、初心者向けにやさしく解説します。

続きを読む
G検定
【G検定】コーパスとは?自然言語処理を支える言語データベースをわかりやすく解説

機械翻訳も、かな漢字変換も、大規模言語モデルも、その土台には「大量の言語データの集まり」があります。それがコーパスです。本記事では、コーパスの定義と種類、日本語の代表例であるBCCWJ、AI開発でコーパスが果たす役割をやさしく解説します。

続きを読む
G検定
【G検定】Triplet Lossとは?アンカー・ポジティブ・ネガティブの3つ組で学ぶ距離学習を解説

顔認識システムはなぜ「初めて見る人の顔」でも同一人物かどうかを判定できるのでしょうか。その鍵が、データの3つ組で距離関係を学ぶTriplet Loss(トリプレット損失)です。この記事では3つ組の役割と、学習を左右する「トリプレットの選び方」まで解説します。

続きを読む