G検定
【G検定】インスタンスセグメンテーションとは?物体を1つずつ輪郭まで識別する技術を解説

インスタンスセグメンテーションは、画像に写る物体を「1つずつ個別に」区別しながら、その輪郭をピクセル単位で抽出する技術です。この記事では、セマンティックセグメンテーションや物体検出との違い、代表手法Mask R-CNNの位置づけを初心者向けに解説します。

続きを読む
G検定
【G検定】一般物体認識とは?画像分類・物体検出・セグメンテーションの3タスクを解説

一般物体認識は、画像に写る物体を見つけて「それが何か」を識別する技術の総称です。この記事では、ディープラーニング登場前後の技術の変化と、出力形式による3つのタスク分類(画像分類・物体検出・セマンティックセグメンテーション)を初心者向けに整理します。

続きを読む
G検定
【G検定】YOLOとは?画像を一度見るだけでリアルタイム物体検出する仕組みを解説

YOLO(You Only Look Once)は、その名のとおり「画像を一度見るだけ」で物体の位置と種類を同時に予測する物体検出アルゴリズムです。この記事では、グリッド分割による予測の仕組み、バージョンの進化、SSDや2ステージ手法との違いを初心者向けに解説します。

続きを読む
G検定
【G検定】Wide ResNetとは?深さより「幅」で性能を高めたResNet改良版を解説

Wide ResNet(ワイドレズネット)は、「もっと深く」を追求してきたResNetに対して、「深さより幅(チャンネル数)を増やす」逆転の発想で高性能と計算効率を両立させた改良モデルです。この記事では、なぜ幅を広げると良いのか、ドロップアウトの役割とあわせて解説します。

続きを読む
G検定
【G検定】Vision Transformer(ViT)とは?画像をパッチ分割してTransformerで読む仕組み

Vision Transformer(ViT)は、自然言語処理で成功したTransformerを画像認識に持ち込んだモデルです。画像を「パッチ」に切り分けて単語のように扱うという発想の転換と、CNNとの使い分けのポイントを初心者向けに解説します。

続きを読む