【G検定】一般物体認識とは?画像分類・物体検出・セグメンテーションの3タスクを解説
2026年5月20日
一般物体認識は、画像に写る物体を見つけて「それが何か」を識別する技術の総称です。この記事では、ディープラーニング登場前後の技術の変化と、出力形式による3つのタスク分類(画像分類・物体検出・セマンティックセグメンテーション)を初心者向けに整理します。
【G検定】YOLOとは?画像を一度見るだけでリアルタイム物体検出する仕組みを解説
2026年5月20日
YOLO(You Only Look Once)は、その名のとおり「画像を一度見るだけ」で物体の位置と種類を同時に予測する物体検出アルゴリズムです。この記事では、グリッド分割による予測の仕組み、バージョンの進化、SSDや2ステージ手法との違いを初心者向けに解説します。
【G検定】Wide ResNetとは?深さより「幅」で性能を高めたResNet改良版を解説
2026年5月20日
Wide ResNet(ワイドレズネット)は、「もっと深く」を追求してきたResNetに対して、「深さより幅(チャンネル数)を増やす」逆転の発想で高性能と計算効率を両立させた改良モデルです。この記事では、なぜ幅を広げると良いのか、ドロップアウトの役割とあわせて解説します。
【G検定】Vision Transformer(ViT)とは?画像をパッチ分割してTransformerで読む仕組み
2026年5月20日
Vision Transformer(ViT)は、自然言語処理で成功したTransformerを画像認識に持ち込んだモデルです。画像を「パッチ」に切り分けて単語のように扱うという発想の転換と、CNNとの使い分けのポイントを初心者向けに解説します。
【G検定】VGGとは?3×3フィルタを重ねて深くしたCNN(VGG16/VGG19)を解説
2026年5月20日
VGG(ブイジージー)は、オックスフォード大学の研究グループが開発した、3×3の小さなフィルタをひたすら積み重ねるシンプルな設計のCNNです。この記事では、VGG16/VGG19の構造の考え方と、ILSVRC 2014での実績、そして後続モデルへ残した影響を解説します。
