【G検定】SSDとは?1ステージで位置とクラスを同時予測する物体検出手法を解説
2026年5月19日
SSD(Single Shot MultiBox Detector)は、1回のネットワーク処理で「物体がどこにあるか」と「それが何か」を同時に予測する物体検出手法です。この記事では、2段階の従来手法との違い、マルチスケール特徴マップとデフォルトボックスという2つの柱を初心者向けに解説します。
【G検定】SENetとは?チャネルの重要度を学ぶSEブロックの仕組みをわかりやすく解説
2026年5月19日
SENet(エスイーネット)は、CNNの特徴マップの「チャネルごとの重要度」を自動で学習して調整する、Squeeze-and-Excitation(SE)ブロックを導入した画像認識モデルです。この記事では、SEブロックの3ステップ(圧縮→重み計算→掛け合わせ)を順番に解説します。
【G検定】SegNetとは?プーリングインデックスで復元するセグメンテーションモデルを解説
2026年5月19日
SegNet(セグネット)は、画像の1ピクセルずつに「ここは道路」「ここは建物」とラベルを付けるセマンティックセグメンテーションのための代表的なモデルです。この記事では、エンコーダ・デコーダ構造と、SegNet最大の特徴である「プーリングインデックスの再利用」を初心者向けに解説します。
【G検定】PSPNetとは?ピラミッドプーリングで画像全体の文脈を捉える仕組みを解説
2026年5月19日
ピクセル単位で画像を塗り分けるセマンティックセグメンテーションでは、「そのピクセルの周りだけ」を見ていると誤答が生まれます。湖の上の白い領域はボートか建物か——答えは「湖の上にある」という画像全体の文脈が教えてくれます。この大域的な文脈を取り込む仕組み「ピラミッドプーリング」を核とするモデルがPSPNetです。
【G検定】OpenPoseとは?複数人の姿勢をリアルタイムで推定する技術を解説
2026年5月19日
普通のカメラ映像だけから、人の関節の位置を割り出して骨格を描き出す——姿勢推定と呼ばれるこのタスクを、複数人同時・リアルタイムで実現した代表的技術がOpenPoseです。特別なセンサーが不要という手軽さから、スポーツ分析からAI画像生成まで応用が広がっています。
