G検定
【G検定】YOLOとは?画像を一度見るだけでリアルタイム物体検出する仕組みを解説

YOLO(You Only Look Once)は、その名のとおり「画像を一度見るだけ」で物体の位置と種類を同時に予測する物体検出アルゴリズムです。この記事では、グリッド分割による予測の仕組み、バージョンの進化、SSDや2ステージ手法との違いを初心者向けに解説します。

続きを読む
G検定
【G検定】Wide ResNetとは?深さより「幅」で性能を高めたResNet改良版を解説

Wide ResNet(ワイドレズネット)は、「もっと深く」を追求してきたResNetに対して、「深さより幅(チャンネル数)を増やす」逆転の発想で高性能と計算効率を両立させた改良モデルです。この記事では、なぜ幅を広げると良いのか、ドロップアウトの役割とあわせて解説します。

続きを読む
G検定
【G検定】Vision Transformer(ViT)とは?画像をパッチ分割してTransformerで読む仕組み

Vision Transformer(ViT)は、自然言語処理で成功したTransformerを画像認識に持ち込んだモデルです。画像を「パッチ」に切り分けて単語のように扱うという発想の転換と、CNNとの使い分けのポイントを初心者向けに解説します。

続きを読む
G検定
【G検定】VGGとは?3×3フィルタを重ねて深くしたCNN(VGG16/VGG19)を解説

VGG(ブイジージー)は、オックスフォード大学の研究グループが開発した、3×3の小さなフィルタをひたすら積み重ねるシンプルな設計のCNNです。この記事では、VGG16/VGG19の構造の考え方と、ILSVRC 2014での実績、そして後続モデルへ残した影響を解説します。

続きを読む
G検定
【G検定】U-Netとは?スキップ接続で医用画像を切り分けるU字型モデルを解説

U-Net(ユーネット)は、生物医学画像のセグメンテーションのために生まれた、U字型のエンコーダ・デコーダ構造を持つCNNです。この記事では、U-Netの代名詞である「スキップ接続」の役割と、少ないデータでも高性能を出せる理由を初心者向けに解説します。

続きを読む