G検定
【G検定】Vision Transformer(ViT)とは?画像をパッチ分割してTransformerで読む仕組み

Vision Transformer(ViT)は、自然言語処理で成功したTransformerを画像認識に持ち込んだモデルです。画像を「パッチ」に切り分けて単語のように扱うという発想の転換と、CNNとの使い分けのポイントを初心者向けに解説します。

続きを読む
G検定
【G検定】VGGとは?3×3フィルタを重ねて深くしたCNN(VGG16/VGG19)を解説

VGG(ブイジージー)は、オックスフォード大学の研究グループが開発した、3×3の小さなフィルタをひたすら積み重ねるシンプルな設計のCNNです。この記事では、VGG16/VGG19の構造の考え方と、ILSVRC 2014での実績、そして後続モデルへ残した影響を解説します。

続きを読む
G検定
【G検定】U-Netとは?スキップ接続で医用画像を切り分けるU字型モデルを解説

U-Net(ユーネット)は、生物医学画像のセグメンテーションのために生まれた、U字型のエンコーダ・デコーダ構造を持つCNNです。この記事では、U-Netの代名詞である「スキップ接続」の役割と、少ないデータでも高性能を出せる理由を初心者向けに解説します。

続きを読む
G検定
【G検定】SSDとは?1ステージで位置とクラスを同時予測する物体検出手法を解説

SSD(Single Shot MultiBox Detector)は、1回のネットワーク処理で「物体がどこにあるか」と「それが何か」を同時に予測する物体検出手法です。この記事では、2段階の従来手法との違い、マルチスケール特徴マップとデフォルトボックスという2つの柱を初心者向けに解説します。

続きを読む
G検定
【G検定】SENetとは?チャネルの重要度を学ぶSEブロックの仕組みをわかりやすく解説

SENet(エスイーネット)は、CNNの特徴マップの「チャネルごとの重要度」を自動で学習して調整する、Squeeze-and-Excitation(SE)ブロックを導入した画像認識モデルです。この記事では、SEブロックの3ステップ(圧縮→重み計算→掛け合わせ)を順番に解説します。

続きを読む