Tier 1: 世界のルールを不可逆に変えた原典アーキテクチャHF 35 votes
ResNet残差接続深層学習基盤

ResNet:残差接続による超多層ニューラルネットワークの学習

残差学習(x + F(x))により勾配消失を打破し、152層の超深層モデルでImageNet誤り率3.57%を達成

Deep Residual Learning for Image Recognition

論文の書誌情報と関連リンク

読み方の2つの軸

現在:しくみ × 全体像

語彙 使うことば・数式・例え方

直感数式なし
しくみ基礎的な数式
原論文原論文の表現

深さ 研究のどこまで読むか

核心肝だけ
全体像背景から評価
読み解く前提から限界

この2本は、本文下のスライダーからいつでも変更できます。

概要

画像を見分けるAIは、処理の層を増やすと学べる関係も増えるはずです。しかし著者らは、通常の層を深く重ねると、学習に使った画像でさえ誤りが増える場合を確認しました。ResNetは、何層かの処理を飛び越えて元の情報を出口へ足す「近道」を設けます。著者らは、この残差学習によって、通常モデルより深いネットワークを学習できると報告しました。

ResNetが扱ったのは、層を増やした画像モデルが浅いモデルより学習しにくくなる劣化問題です。入力をそのまま出口へ渡す近道を置き、通常の層には入力から変えるべき差分だけを学ばせます。変える必要がなければ差分を小さくすればよいため、元の情報を保つ働きを一から覚える必要がありません。著者らは、通常モデルと残差モデルを層数を変えて比較し、ImageNetやCIFAR-10で結果を報告しました。

層を増やした画像認識モデルは、表せる関係が増えるはずなのに、浅いモデルより学習データ上の誤りまで増えることがありました。著者らはこれを劣化問題と呼び、各まとまりの入力を出口へ直接足す近道を提案しました。処理全体を一から学ぶ代わりに、入力から変えるべき差分だけを学びます。通常の層と残差を使う層を同じ条件で比べ、層数、近道の形、画像データを変えながら、学習の進み方と分類・検出の成績を調べました。

ResNetは、層の学習対象を目的関数 H(x)\mathcal{H}(x) から入力との差分 F(x)=H(x)x\mathcal{F}(x) = \mathcal{H}(x) - x へと再定式化し、恒等ショートカット接続 H(x)=F(x)+x\mathcal{H}(x) = \mathcal{F}(x) + x を導入した畳み込みニューラルネットワークです。深層化に伴う最適化劣化問題を打破し、152層の超深層モデルにおいてImageNet Top-5誤り率3.57%(人間の参考値を上回る)を達成しました。

Heら(Microsoft Research)による『Deep Residual Learning for Image Recognition』(CVPR 2016 Best Paper)は、残差学習(Residual Learning)を導入することで深層ネットワークの最適化困難性(Degradation Problem)を解決した記念碑的論文です。

層を深くすると訓練誤差が悪化する現象に対し、恒等写像を学習することの難しさに着目。入力をスキップさせて出力に加算する H(x)=F(x)+x\mathcal{H}(x) = \mathcal{F}(x) + x を導入することで、最適化の初期状態を実質的な恒等写像とし、差分 F(x)\mathcal{F}(x) のみを微調整する枠組みを構築しました。

これにより、従来の限界(約20層)を桁違いに打破し、152層のResNetを構築。ILSVRC 2015において人間の参考値を上回るの3.57%のエラー率を叩き出して優勝し、COCOコンペティションを含む主要ビジョン競技を席巻しました。

何愷明ら(Microsoft Research)による『Deep Residual Learning for Image Recognition』(CVPR 2016 Best Paper)は、深層畳み込みニューラルネットワークにおける最適化の壁(Degradation Problem)を数学的・実験的に打破した重要な研究です。

本論文は、層を深くするほど訓練誤差が増大する劣化問題の原因を分析し、恒等写像(Identity Mapping)の学習困難性を特定。残差関数 F(x)=H(x)x\mathcal{F}(x) = \mathcal{H}(x) - x を学習対象とし、ショートカット接続 H(x)=F(x)+x\mathcal{H}(x) = \mathcal{F}(x) + x を導入することで、誤差逆伝播における勾配伝播経路を恒等項として保存する構造を確立しました。

これにより、VGGの8倍に達する152層のResNet-152の最適化に成功し、ILSVRC 2015でTop-5誤り率3.57%(人間の参考値を上回る)を達成。COCO検出・セグメンテーションを含む複数の主要競技で著者らが好成績を報告しました。学術引用数は20万件を超え、TransformerのResidual Streamを含む後続の多くの構成でも参照されています。

何愷明ら(Microsoft Research)による本論文は、深層畳み込みニューラルネットワークにおける最適化劣化問題を解決する『残差学習(Residual Learning)』を提案した原典です。入力をそのまま足し合わせるIdentityショートカット接続により、152層の超深層モデルを実現し、ILSVRC 2015画像分類タスクにおいて人間を超えるエラー率3.57%を達成して優勝しました。

2015年に発表された『Deep Residual Learning for Image Recognition』(He et al.)は、深層ニューラルネットワークの学習における『劣化問題(Degradation Problem)』を解決し、深層学習の歴史を決定づけた論文です。

ネットワークの深層化に伴い、過学習とは無関係に訓練誤差が増大する問題に対し、著者らは入力をそのまま次段へ渡す恒等ショートカット接続(Identity Shortcut)を導入。層が学習すべき対象を一からの写像 H(x)\mathcal{H}(x) ではなく、入力に対する残差 F(x)=H(x)x\mathcal{F}(x) = \mathcal{H}(x) - x へと再定式化しました。

この簡潔かつアーキテクチャにより、当時としては前代未聞の152層に達するResNet-152の学習に成功。ILSVRC 2015分類タスクでエラー率3.57%を記録して優勝したほか、COCOコンテストを含む主要ビジョン競技を独占しました。

何愷明ら(Microsoft Research)による『Deep Residual Learning for Image Recognition』(CVPR 2016 Best Paper)は、深層畳み込みニューラルネットワークにおける最適化劣化問題(Degradation Problem)を数学的・実験的に解決した不朽の原典です。

本論文は、層の深化に伴い過学習とは無関係に訓練誤差が増大する劣化問題の原因を分析。非線形変換層の積層によって恒等写像を近似することの困難性を突き止め、目的写像 H(x)\mathcal{H}(x) を直接学習する代わりに残差関数 F(x)=H(x)x\mathcal{F}(x) = \mathcal{H}(x) - x を学習対象とする残差学習フレームワークを提案しました。

入力をバイパスして出力に加算するIdentity Shortcut接続により、誤差逆伝播における勾配の恒等伝播経路(Gradient Highway)を確保。VGGの8倍に達する152層の超深層モデル『ResNet-152』の安定学習を成し遂げ、ILSVRC 2015分類タスクで人間評価(約5.1%)を超える誤り率3.57%を達成して上回ったと報告しました。引用数は20万件を突破し、現代深層学習の不可欠な共通基盤となっています。

著者をもっと詳しく知る(全4名)

論文と確認可能な公式情報に基づき、著者の所属と研究背景を掲載しています。

全著者と所属

  1. Kaiming He
    Microsoft Research
  2. Xiangyu Zhang
    Microsoft Research
  3. Shaoqing Ren
    Microsoft Research
  4. Jian Sun
    Microsoft Research

確認できた研究背景

Kaiming He
所属
: Microsoft Research
学歴
: 香港中文大学博士
主な関心
: 深層残差学習、自己教師あり学習 (MAE)
Xiangyu Zhang
所属
: Microsoft Research
学歴
: 西安交通大学
主な関心
: 高効率CNN、ニューラルアーキテクチャ探索
Shaoqing Ren
所属
: Microsoft Research
学歴
: 中国科学技術大学
主な関心
: Faster R-CNN、物体検出
Jian Sun
所属
: Microsoft Research
学歴
: 西安交通大学博士
主な関心
: 計算写真学、深層視覚認識

なぜ歴史的イノベーションなのか

『AIの脳の層をどこまでも深くできるようにした大発明』。昔のAIは層を20層以上重ねると情報が消えてバカになってしまう問題がありましたが、『元の入力をそのまま答えに足す(近道を作る)』という天才的なアイデアで150層以上の超深層モデルを実現しました。

Microsoft Researchのチームが開発。深層学習では層を深くするほど複雑な認識ができるはずなのに、実際には20層を超えると逆に性能が落ちる『劣化問題』に直面していました。ResNetは『差分(残差)だけを学習すればいい』という発想の転換でこの壁を突破しました。

CVPR 2016最優秀論文。ショートカット接続によって恒等写像(Identity Mapping)を直接通すことで、誤差逆伝播時の勾配が何層を経由しても直接入力側まで届くようになり、152層さらには1000層のネットワークの最適化を数学的に可能にしました。

H(x) = F(x) + x による残差学習の定式化。パラメータなしの恒等射影ショートカットにより、勾配消失を防ぎつつVGGの8倍に達する152層の深層CNNを安定して訓練。

ネットワークの劣化問題(過学習ではなく最適化困難)を解明。残差ブロック F(x) = H(x) - x を学習対象とすることで、未学習初期でも恒等写像として機能させ、ImageNetで誤り率3.57%の歴史的記録を樹立しました。

深層学習の最適化理論を不可逆転換した原典。ボトルネック構造(1x1, 3x3, 1x1 conv)とIdentity Shortcutの融合。誤差逆伝播において dLoss/dx = dLoss/dH * (dF/dx + 1) となり、勾配が直接前段へ流れるため勾配消失(Vanishing Gradient)が根本解決されます。

He et al. (2015)。深層ニューラルネットワークにおける残差学習フレームワークの提案。ILSVRC 2015分類タスクで1位(エラー率3.57%)を獲得。

残差関数の明示的な定式化。152層のResNetを構築し、VGGNetを凌駕する表現力と計算量の低減を両立。COCO物体検出・セグメンテーションでも圧勝。

深層残差学習の数学的・実験的完全分析。Identity Mappingの導入によりリッカチ方程式的な特異点近傍の勾配消失を回避し、損失地形(Loss Landscape)を凸関数状に滑らかにする機構を証明。

コミュニティの評価・歴史的インパクト(2件)
  • x + F(x) というたった1本の足し算バイパスが、100層を超える深層学習を可能にしたというエレガントさに誰もが脱帽した。

    原文を見る ↗
  • この残差接続がなければ、現代の1000億パラメータ級のTransformerも勾配消失で1層も学習できなかった。

    原文を見る ↗
この読み方に出てくる言葉(3語)
残差学習

入力を直接作り直す代わりに、入力から変えるべき差分を学ぶ方法。

劣化問題

層を増やしたのに、学習データ上の誤りまで増えてしまう問題。

ImageNet

多数の画像と分類ラベルを使う画像認識の評価データ。

どんな問いに向き合ったか

ネットワークの層数を増やすと、勾配消失・爆発により訓練誤差すら下がらなくなる『劣化問題(Degradation Problem)』が発生していた。

従来の方法と課題

正則化手法やバッチ正規化(BatchNorm)を用いて数十層の学習を試みるも、20〜30層程度で性能限界に達していた。

肝のアイデア

目標とする写像H(x)を直接学習するのではなく、残差 F(x) = H(x) - x を学習させ、出力を F(x) + x とする。

どういうしくみか

目的写像を H(x)\mathcal{H}(x) とするとき、残差写像を F(x):=H(x)x\mathcal{F}(x) := \mathcal{H}(x) - x と定義し、ブロック構造を以下のように定式化します:

y=F(x,{Wi})+x\mathbf{y} = \mathcal{F}(\mathbf{x}, \{W_i\}) + \mathbf{x}

ここで x\mathbf{x}y\mathbf{y} は入出力ベクトル、F\mathcal{F} は2層または3層の畳み込み層の写像です。F+x\mathcal{F} + \mathbf{x} の加算後にReLU関数を適用します。

50層以上の深層モデルでは、計算量を抑えるため3層ボトルネックブロックを採用:

1×11 \times 1 conv(次元削減: 256 -> 64)

3×33 \times 3 conv(空間畳み込み: 64 -> 64)

1×11 \times 1 conv(次元復元: 64 -> 256)

Identityショートカットはパラメータ不要でこのボトルネックを跨ぎます。

特徴マップの空間解像度が半分になりチャンネル数が2倍になる境界では、以下の2方式を検証:

(A) ゼロパディングによる次元拡張(パラメータゼロ)

(B) 1×11 \times 1 畳み込みによる線形射影ショートカット y=F(x,{Wi})+Wsx\mathbf{y} = \mathcal{F}(\mathbf{x}, \{W_i\}) + W_s \mathbf{x}

実験の結果、(B)がわずかに優れるものの、(A)でも非常に高い性能が得られ、本質はIdentity接続にあることが支持されました。

どう確かめたか

著者らは、152層のResNetアンサンブルによりImageNetテストセットで3.57%のトップ5誤り率を達成(人間の参考値を上回る・優勝)。COCO物体検出タスクにおいて前年チャンピオンに対し相対28%の精度向上を達成。CIFAR-10において100層および1000層のネットワークの最適化に成功

何が分かったか

その評価で著者らは、ILSVRC 2015分類タスクでTop-5誤り率3.57%(アンサンブル)を達成し優勝。単一モデル比較において、ResNet-152(Top-5: 4.49%)がVGG-16(7.4%)およびGoogLeNet(6.67%)を上回ったと報告。COCO 2015 Object DetectionにおいてmAP@[.5, .95] 37.3%(前年比28%向上)で優勝。CIFAR-10において110層および1202層のネットワークを学習し、110層で6.43%のエラー率を実証

どこまで使えるか

実証範囲はImageNet、CIFAR-10の画像分類と検出への転用です。残差接続の効果はブロック構成、正規化、最適化条件にも依存し、任意の深層モデルへの一般化は追加検証を要します。

限界と未解決の問い

1202層モデルでは訓練誤差はゼロに近いものの過学習によりテスト誤差が悪化(正則化の必要性)。特徴マップの解像度低下ポイントでの線形射影ショートカットのパラメータ増加。中間活性化保持による逆伝播時のGPUメモリ消費増大

層数が極端に増えるとメモリフットプリントが増大し、順伝播・逆伝播のバッファ管理が必要。残差接続自体の表現力(アンサンブルとしての挙動)に対する理論的解明は以後の後続研究に委ねられた

この研究から考える

ここからは、論文の結果を踏まえた編集上の考察です。

深いネットワークでの訓練誤差改善が別の構成でも再現するなら、表現力を増やすだけでなく恒等経路を保つことが最適化上の重要な設計になります。ただし、ブロック構成や正規化、画像データの条件が結果に関与するため、ショートカットだけの効果として一般化はできません。