ResNet:残差接続による超多層ニューラルネットワークの学習
残差学習(x + F(x))により勾配消失を打破し、152層の超深層モデルでImageNet誤り率3.57%を達成
Deep Residual Learning for Image Recognition
論文の書誌情報と関連リンク
- 発表日
- 掲載先
- CVPR 2016 (Best Paper) / Microsoft Research
読み方の2つの軸
現在:しくみ × 全体像
語彙 使うことば・数式・例え方
深さ 研究のどこまで読むか
この2本は、本文下のスライダーからいつでも変更できます。
概要
画像を見分けるAIは、処理の層を増やすと学べる関係も増えるはずです。しかし著者らは、通常の層を深く重ねると、学習に使った画像でさえ誤りが増える場合を確認しました。ResNetは、何層かの処理を飛び越えて元の情報を出口へ足す「近道」を設けます。著者らは、この残差学習によって、通常モデルより深いネットワークを学習できると報告しました。
ResNetが扱ったのは、層を増やした画像モデルが浅いモデルより学習しにくくなる劣化問題です。入力をそのまま出口へ渡す近道を置き、通常の層には入力から変えるべき差分だけを学ばせます。変える必要がなければ差分を小さくすればよいため、元の情報を保つ働きを一から覚える必要がありません。著者らは、通常モデルと残差モデルを層数を変えて比較し、ImageNetやCIFAR-10で結果を報告しました。
層を増やした画像認識モデルは、表せる関係が増えるはずなのに、浅いモデルより学習データ上の誤りまで増えることがありました。著者らはこれを劣化問題と呼び、各まとまりの入力を出口へ直接足す近道を提案しました。処理全体を一から学ぶ代わりに、入力から変えるべき差分だけを学びます。通常の層と残差を使う層を同じ条件で比べ、層数、近道の形、画像データを変えながら、学習の進み方と分類・検出の成績を調べました。
ResNetは、層の学習対象を目的関数 H(x) から入力との差分 F(x)=H(x)−x へと再定式化し、恒等ショートカット接続 H(x)=F(x)+x を導入した畳み込みニューラルネットワークです。深層化に伴う最適化劣化問題を打破し、152層の超深層モデルにおいてImageNet Top-5誤り率3.57%(人間の参考値を上回る)を達成しました。
Heら(Microsoft Research)による『Deep Residual Learning for Image Recognition』(CVPR 2016 Best Paper)は、残差学習(Residual Learning)を導入することで深層ネットワークの最適化困難性(Degradation Problem)を解決した記念碑的論文です。
層を深くすると訓練誤差が悪化する現象に対し、恒等写像を学習することの難しさに着目。入力をスキップさせて出力に加算する H(x)=F(x)+x を導入することで、最適化の初期状態を実質的な恒等写像とし、差分 F(x) のみを微調整する枠組みを構築しました。
これにより、従来の限界(約20層)を桁違いに打破し、152層のResNetを構築。ILSVRC 2015において人間の参考値を上回るの3.57%のエラー率を叩き出して優勝し、COCOコンペティションを含む主要ビジョン競技を席巻しました。
何愷明ら(Microsoft Research)による『Deep Residual Learning for Image Recognition』(CVPR 2016 Best Paper)は、深層畳み込みニューラルネットワークにおける最適化の壁(Degradation Problem)を数学的・実験的に打破した重要な研究です。
本論文は、層を深くするほど訓練誤差が増大する劣化問題の原因を分析し、恒等写像(Identity Mapping)の学習困難性を特定。残差関数 F(x)=H(x)−x を学習対象とし、ショートカット接続 H(x)=F(x)+x を導入することで、誤差逆伝播における勾配伝播経路を恒等項として保存する構造を確立しました。
これにより、VGGの8倍に達する152層のResNet-152の最適化に成功し、ILSVRC 2015でTop-5誤り率3.57%(人間の参考値を上回る)を達成。COCO検出・セグメンテーションを含む複数の主要競技で著者らが好成績を報告しました。学術引用数は20万件を超え、TransformerのResidual Streamを含む後続の多くの構成でも参照されています。
何愷明ら(Microsoft Research)による本論文は、深層畳み込みニューラルネットワークにおける最適化劣化問題を解決する『残差学習(Residual Learning)』を提案した原典です。入力をそのまま足し合わせるIdentityショートカット接続により、152層の超深層モデルを実現し、ILSVRC 2015画像分類タスクにおいて人間を超えるエラー率3.57%を達成して優勝しました。
2015年に発表された『Deep Residual Learning for Image Recognition』(He et al.)は、深層ニューラルネットワークの学習における『劣化問題(Degradation Problem)』を解決し、深層学習の歴史を決定づけた論文です。
ネットワークの深層化に伴い、過学習とは無関係に訓練誤差が増大する問題に対し、著者らは入力をそのまま次段へ渡す恒等ショートカット接続(Identity Shortcut)を導入。層が学習すべき対象を一からの写像 H(x) ではなく、入力に対する残差 F(x)=H(x)−x へと再定式化しました。
この簡潔かつアーキテクチャにより、当時としては前代未聞の152層に達するResNet-152の学習に成功。ILSVRC 2015分類タスクでエラー率3.57%を記録して優勝したほか、COCOコンテストを含む主要ビジョン競技を独占しました。
何愷明ら(Microsoft Research)による『Deep Residual Learning for Image Recognition』(CVPR 2016 Best Paper)は、深層畳み込みニューラルネットワークにおける最適化劣化問題(Degradation Problem)を数学的・実験的に解決した不朽の原典です。
本論文は、層の深化に伴い過学習とは無関係に訓練誤差が増大する劣化問題の原因を分析。非線形変換層の積層によって恒等写像を近似することの困難性を突き止め、目的写像 H(x) を直接学習する代わりに残差関数 F(x)=H(x)−x を学習対象とする残差学習フレームワークを提案しました。
入力をバイパスして出力に加算するIdentity Shortcut接続により、誤差逆伝播における勾配の恒等伝播経路(Gradient Highway)を確保。VGGの8倍に達する152層の超深層モデル『ResNet-152』の安定学習を成し遂げ、ILSVRC 2015分類タスクで人間評価(約5.1%)を超える誤り率3.57%を達成して上回ったと報告しました。引用数は20万件を突破し、現代深層学習の不可欠な共通基盤となっています。
著者をもっと詳しく知る(全4名)
論文と確認可能な公式情報に基づき、著者の所属と研究背景を掲載しています。
全著者と所属
- Kaiming HeMicrosoft Research
- Xiangyu ZhangMicrosoft Research
- Shaoqing RenMicrosoft Research
- Jian SunMicrosoft Research
確認できた研究背景
- 所属
- : Microsoft Research
- 学歴
- : 香港中文大学博士
- 主な関心
- : 深層残差学習、自己教師あり学習 (MAE)
- 所属
- : Microsoft Research
- 学歴
- : 西安交通大学
- 主な関心
- : 高効率CNN、ニューラルアーキテクチャ探索
- 所属
- : Microsoft Research
- 学歴
- : 中国科学技術大学
- 主な関心
- : Faster R-CNN、物体検出
- 所属
- : Microsoft Research
- 学歴
- : 西安交通大学博士
- 主な関心
- : 計算写真学、深層視覚認識
なぜ歴史的イノベーションなのか
『AIの脳の層をどこまでも深くできるようにした大発明』。昔のAIは層を20層以上重ねると情報が消えてバカになってしまう問題がありましたが、『元の入力をそのまま答えに足す(近道を作る)』という天才的なアイデアで150層以上の超深層モデルを実現しました。
Microsoft Researchのチームが開発。深層学習では層を深くするほど複雑な認識ができるはずなのに、実際には20層を超えると逆に性能が落ちる『劣化問題』に直面していました。ResNetは『差分(残差)だけを学習すればいい』という発想の転換でこの壁を突破しました。
CVPR 2016最優秀論文。ショートカット接続によって恒等写像(Identity Mapping)を直接通すことで、誤差逆伝播時の勾配が何層を経由しても直接入力側まで届くようになり、152層さらには1000層のネットワークの最適化を数学的に可能にしました。
H(x) = F(x) + x による残差学習の定式化。パラメータなしの恒等射影ショートカットにより、勾配消失を防ぎつつVGGの8倍に達する152層の深層CNNを安定して訓練。
ネットワークの劣化問題(過学習ではなく最適化困難)を解明。残差ブロック F(x) = H(x) - x を学習対象とすることで、未学習初期でも恒等写像として機能させ、ImageNetで誤り率3.57%の歴史的記録を樹立しました。
深層学習の最適化理論を不可逆転換した原典。ボトルネック構造(1x1, 3x3, 1x1 conv)とIdentity Shortcutの融合。誤差逆伝播において dLoss/dx = dLoss/dH * (dF/dx + 1) となり、勾配が直接前段へ流れるため勾配消失(Vanishing Gradient)が根本解決されます。
He et al. (2015)。深層ニューラルネットワークにおける残差学習フレームワークの提案。ILSVRC 2015分類タスクで1位(エラー率3.57%)を獲得。
残差関数の明示的な定式化。152層のResNetを構築し、VGGNetを凌駕する表現力と計算量の低減を両立。COCO物体検出・セグメンテーションでも圧勝。
深層残差学習の数学的・実験的完全分析。Identity Mappingの導入によりリッカチ方程式的な特異点近傍の勾配消失を回避し、損失地形(Loss Landscape)を凸関数状に滑らかにする機構を証明。
コミュニティの評価・歴史的インパクト(2件)
- 原文を見る ↗
x + F(x) というたった1本の足し算バイパスが、100層を超える深層学習を可能にしたというエレガントさに誰もが脱帽した。
- 原文を見る ↗
この残差接続がなければ、現代の1000億パラメータ級のTransformerも勾配消失で1層も学習できなかった。
この読み方に出てくる言葉(2語)
- 劣化問題
層を増やしたのに、学習データ上の誤りまで増えてしまう問題。
- ImageNet
多数の画像と分類ラベルを使う画像認識の評価データ。
どんな問いに向き合ったか
ネットワークの層数を増やすと、勾配消失・爆発により訓練誤差すら下がらなくなる『劣化問題(Degradation Problem)』が発生していた。
肝のアイデア
目標とする写像H(x)を直接学習するのではなく、残差 F(x) = H(x) - x を学習させ、出力を F(x) + x とする。
どう確かめ、何が分かったか
著者らはILSVRC 2015で、複数モデルを合わせた分類のトップ5誤り率3.57%を報告しました。また、ImageNetとCOCOの分類・検出・位置特定・領域分けを含む5部門で1位を報告しています。
注意すべきこと
層数が極端に増えるとメモリフットプリントが増大し、順伝播・逆伝播のバッファ管理が必要
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
著者らの実験は、層を増やすだけで学びにくくなる問題に対し、元の情報をそのまま通す近道が役立つことを示しました。別の種類の課題でも同じ傾向が出るなら、複雑な処理を足す前に情報を保つ道を設ける考え方が使えます。ただし、ここでの中心的な証拠は画像認識の設定に基づきます。
この読み方に出てくる言葉(3語)
- 残差学習
入力を直接作り直す代わりに、入力から変えるべき差分を学ぶ方法。
- ショートカット接続
いくつかの処理を飛び越えて、入力を後ろへ直接渡す経路。
- 劣化問題
層を増やしたのに、学習データ上の誤りまで増えてしまう問題。
どんな問いに向き合ったか
ネットワークの層数を増やすと、勾配消失・爆発により訓練誤差すら下がらなくなる『劣化問題(Degradation Problem)』が発生していた。
従来の方法と課題
正則化手法やバッチ正規化(BatchNorm)を用いて数十層の学習を試みるも、20〜30層程度で性能限界に達していた。
肝のアイデア
目標とする写像H(x)を直接学習するのではなく、残差 F(x) = H(x) - x を学習させ、出力を F(x) + x とする。
どういうしくみか
ResNetの仕組みは、驚くほどシンプルで美しい数式で表されます。
従来のネットワークは、入力 対応する値 に対して、目的の出力 対応する値 そのものを何層かの畳み込み層で一から作り出そうとしていました。しかし、何層もの複雑な非線形変換を経て「元の入力をそのまま保つ(恒等写像)」ような重みを見つけることは、数学的に非常に困難でした。
研究チームは、層が学習すべき目的を「残差関数 対応する値」へと書き換えました。そして、実際の出力を以下のように構成したのです:
対応する値
構造としては、畳み込み層を2〜3層通る経路の横に、入力をそのままバイパスして出口で足し合わせる「近道(ショートカット接続)」を通すだけです。
この設計では、もしある層が「これ以上何も学習する必要がない(恒等写像で十分)」と判断した場合、畳み込み層の重みをすべてゼロに近づけるだけで、自然と 対応する値 となり、出力はそのまま入力 対応する値 と一致することです。つまり、ネットワークは「悪化するリスクなしに、必要な差分だけを安全に追加学習できる」ようになったのです。
さらに、誤差逆伝播(学習時の答え合わせ)の際にも、勾配がショートカットを通じて減衰することなく入力側まで直接伝わるため、何十層・何百層重ねても学習信号が直接伝わる経路も残ります。
どう確かめたか
著者らは、152層のResNetアンサンブルによりImageNetテストセットで3.57%のトップ5誤り率を達成(人間の参考値を上回る・優勝)。COCO物体検出タスクにおいて前年チャンピオンに対し相対28%の精度向上を達成。CIFAR-10において100層および1000層のネットワークの調整に成功
何が分かったか
その評価で著者らは、ImageNetコンテスト(ILSVRC 2015)の画像分類タスクでエラー率3.57%を達成して優勝(前年のGoogLeNet 6.67%、人間評価の約5%を大きく上回る結果)。ImageNetの検出タスク、位置特定タスク、COCOデータセットの物体検出タスク、セグメンテーションタスクの主要5部門すべてで1位を獲得。CIFAR-10データセットにおいて、100層および1000層を超える超深層モデルの安定学習を実証。152層のResNet-152は、わずか16層のVGG-16よりも計算量(FLOPs)が少ない高効率性を支持
どこまで使えるか
論文が直接確かめた中心は画像分類と物体検出です。近道の接続は深いモデルを学びやすくしましたが、あらゆる種類のデータや学習方法で同じ効果が出ると示したわけではありません。
限界と未解決の問い
層の有効活用率(冗長性): 後の研究(Stochastic Depthなど)によって、100層以上のResNetの多くのブロックは実際にはごくわずかな差分しか計算しておらず、一部の層をランダムに間引いても性能が落ちないという「層の冗長性」が指摘されました。解像度変更時のパディング/射影コスト: 特徴マップのサイズやチャンネル数が変わるダウンサンプリング層では、純粋な足し算ができず、1x1畳み込みによる射影ショートカット(パラメータ追加)が必要になります。超多層化によるメモリ消費: 誤差逆伝播のために各層の中間活性化(Activation)をすべてGPUメモリに保持する必要があるため、訓練時のメモリ消費が非常に大きくなります。層数が極端に増えるとメモリフットプリントが増大し、順伝播・逆伝播のバッファ管理が必要。残差接続自体の表現力(アンサンブルとしての挙動)に対する理論的解明は以後の後続研究に委ねられた
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
著者らの実験は、層を増やすだけで学びにくくなる問題に対し、元の情報をそのまま通す近道が役立つことを示しました。別の種類の課題でも同じ傾向が出るなら、複雑な処理を足す前に情報を保つ道を設ける考え方が使えます。ただし、ここでの中心的な証拠は画像認識の設定に基づきます。
この読み方に出てくる言葉(4語)
- 残差学習
入力を直接作り直す代わりに、入力から変えるべき差分を学ぶ方法。
- ショートカット接続
いくつかの処理を飛び越えて、入力を後ろへ直接渡す経路。
- 劣化問題
層を増やしたのに、学習データ上の誤りまで増えてしまう問題。
- ImageNet
多数の画像と分類ラベルを使う画像認識の評価データ。
問題設定と前提
層を増やせば、浅いモデルと同じ働きをする層を追加するだけでも、少なくとも学習データ上の成績は悪くならないはずです。ところが著者らの比較では、56層の通常モデルは20層のモデルより学習データ上の誤りも多くなりました。これは答えを丸暗記しすぎる問題ではありません。著者らは、深いモデルが「何も変えずに情報を通す」単純な働きさえ学びにくいことを劣化問題として扱いました。 深いモデルには浅いモデルを含むだけの余地がある、という考えが出発点です。追加した層が入力をそのまま返せれば、浅いモデルと同じ働きは残せます。それでも実際の学習で成績が悪化したため、モデルが表せないのではなく、使える調整値を学習手順が見つけにくいことが問題だと考えました。
関連研究の中での位置づけ
当時は、学習の合図が途中で弱くなる問題に対して、各層へ届く値を整える方法が使われていました。それでも、通常の層を重ねたモデルでは、深くするほど学習データ上の誤りが増える場合がありました。著者らは同じ条件の20層と56層を比べ、この現象が単に未知の画像へ対応できないためではなく、学習そのものの難しさにあると切り分けました。 それ以前にも、層を飛び越す接続や、複数の段階へ学習の目標を置く方法はありました。この論文の焦点は、追加の予測器を置くことではなく、各まとまりへ入力を直接足す単純な形で深い画像モデルを比較することです。著者らは、層数以外をそろえた通常モデルも用意し、深さだけを増やしたときの悪化と、残差化したときの変化を分けて見ました。
提案手法の全体像
提案の中心は、何層かの処理の横に、入力をそのまま出口へ渡す近道を置くことです。通常の道は完成した出力を一から作るのではなく、入力から変えるべき差分だけを学びます。出口で入力と差分を足すため、変更が不要なら差分をゼロに近づければよく、「何もしない働き」を複雑な層だけで覚える必要がありません。 たとえば、写真から得た特徴を次の二層で変えるとします。通常の道が出す差分をゼロに近づければ、近道を通った元の特徴がそのまま出口へ届きます。差分が必要な場所だけ通常の道が値を加えるため、各まとまりは前の表現を壊さずに修正できます。この説明は仕組みを考える助けにはなりますが、実験結果の原因すべてを証明するものではありません。
定式化と設計判断
一つのまとまりには、画像の特徴を変える通常の道と、入力をそのまま出口へ渡す近道があります。出口では二つを足します。変える必要がなければ通常の道が小さな差分だけを出せばよいため、元の情報を保つ働きを一から覚える必要がありません。50層以上のモデルでは、特徴の数をいったん減らしてから処理し、元の数へ戻す三段構成も使い、計算量を抑えました。 18層と34層では、同じ大きさの特徴を扱う二つの処理を一組にしました。50層、101層、152層では、計算が増えすぎないよう三つの処理を一組にします。最初に特徴の数を4分の1ほどへ減らし、中央で画像内の近い場所の関係を調べ、最後に元の数へ戻してから入力と足します。入力と出口の形が違う境目では、そのまま足す方法と、短い追加処理で形を合わせる方法を試しました。
学習・推論・実験条件
著者らは18、34、50、101、152層のモデルを構成しました。18層と34層では二つの画像処理層を一まとまりにし、50層以上では計算量を抑えるため、特徴の数を減らす処理、画像の特徴を調べる処理、特徴の数を戻す処理の三段構成を使いました。画像の大きさや特徴数が変わる境目では、入力の形を合わせる近道も比較しました。ImageNetでは画像分類に加えて物体の位置や種類を調べ、CIFAR-10ではさらに深い110層と1202層も試しました。 ImageNetのモデルでは、はじめに大きめの画像処理を行い、その後は画像の縦横を半分にする段階ごとに特徴数を増やしました。各処理の後には値の偏りを整える仕組みを置きました。比較する通常モデルにも同じ層数と処理量に近い構成を用意し、近道の有無を主な違いにしました。CIFAR-10では小さな画像に合わせた構成を使い、20、32、44、56、110層を同じ系列で比較しました。1202層も試し、非常に深い場合の限界を確認しました。
評価設計
劣化問題の確認では、通常の18層と34層、通常の20層と56層を同じデータと学習条件で比べ、未知の画像だけでなく学習画像の誤りも調べました。提案の効果は、通常モデルと残差モデルの差、層数を増やしたときの変化、近道で形を合わせる方法の違いから評価しました。最終的な画像分類はImageNetのトップ5誤り率、物体検出はmAPなど、各競技で定められた指標を使っています。人間の参考値との比較はImageNetの特定条件に限られ、人一般の視覚能力との比較ではありません。 分類の成績だけを見ると、モデルが深いために良くなったのか、学習がうまく進んだためなのか区別しにくくなります。そこで著者らは、学習に使った画像での誤りと、評価用画像での誤りを両方示しました。通常の深いモデルで両方が悪化し、残差モデルでは学習側の誤りから改善するかを確認しています。物体検出では、学習済みResNetを別の検出方法へ組み込み、画像全体の分類だけに限られないかも調べました。
何が分かったか
著者らは、通常の34層モデルでは18層より誤りが増えた一方、残差を使う34層モデルは18層より改善したと報告しました。ImageNetでは単一のResNet-152がトップ5誤り率4.49%、複数モデルを合わせた結果が3.57%でした。ILSVRC 2015の分類、検出、位置特定と、COCO 2015の検出、領域分けで1位を報告しています。また、ResNet-152の計算量は11.3 GFLOPsで、資料にあるVGG-16の15.3 GFLOPsより少ないとされています。これらは著者らが各評価設定で報告した値です。 CIFAR-10では、残差モデルの誤り率が20層の8.75%から32層7.51%、44層7.17%、56層6.97%、110層6.43%へ下がったと報告されています。一方で1202層は学習画像へほぼ合わせられたものの、評価画像では110層より少し悪くなりました。この負の結果は、近道があれば層を無制限に増やしてよい、という結論を支持しません。ImageNetとCIFAR-10では画像の大きさやモデル構成が異なるため、数値は同じ尺度として直接比較できません。
アブレーションと失敗例
深さだけを増やした通常モデルと、近道を加えた残差モデルの比較では、残差化した側で学習データ上の誤りが下がりました。形が変わる境目では、値を足して形を合わせる方法と、1×1の処理で形を変える方法を比較し、後者が少し良い一方、前者でも効果が得られました。CIFAR-10の1202層モデルは学習データにはよく合いましたが、110層モデルより未知の画像でわずかに悪化し、深さを増やせば常に良くなるわけではないことも示しています。 通常の深いモデルが学習画像でも悪化した比較は、過学習だけでは説明できないという根拠になります。近道を加えた比較では、層を増やした側の学習誤差が下がり、劣化問題が緩和されました。ただし、著者らの構成では値を整える処理も併用しています。残差接続だけを取り出し、あらゆる条件で同じ因果関係が成り立つとまでは言えません。1202層の結果は、学習可能であることと未知の画像で良いことが別だと示します。
別の解釈と評価上の注意
改善にはショートカット接続だけでなく、バッチ正規化や訓練設定も関与します。比較実験は残差化の効果を支持しますが、後世の全アーキテクチャへ同じ説明をそのまま適用はできません。 深い残差モデルの改善は、近道が学習の合図を伝えやすくしたためとも、各まとまりが小さな修正だけを覚えやすくなったためとも解釈できます。また、三段構成によって計算量を抑え、より深い比較が可能になった影響もあります。この論文の比較は残差化の有効性を支持しますが、これらの説明のうち一つだけを確定してはいません。
限界と未解決の問い
中心となる実験は画像分類と物体検出であり、別の種類のデータでも同じ利点が出るかはこの論文だけでは分かりません。層を増やすと、学習途中の値を保存するメモリと計算時間は増えます。入力と出力の形が違う場所では単純な足し算だけでは済まず、形を合わせる処理が必要です。また、実験は近道の効果を支持しますが、なぜ学習が容易になるかを一つの原因だけで確定したものではありません。 競技での順位や人間の参考値は、決められた画像と採点方法での結果です。一般の視覚判断全体を上回ったという意味ではありません。複数モデルを組み合わせた3.57%と、単一モデルの4.49%も条件が違うため分けて読む必要があります。後年の引用数や他分野での利用は歴史的な広がりを示しますが、原論文の実験結果そのものを強める証拠ではありません。
残された問い
残差接続の効果が画像以外や異なる正規化条件でも同じか。深さ、幅、接続方法の寄与をどう分けるかが残ります。 近道の位置、足し方、値を整える順序を変えたとき、学びやすさはどう変わるのでしょうか。画像以外の入力や、層より幅を増やす構成でも同じ利点があるかは別に試す必要があります。また、学習できる最大の深さではなく、計算量と未知のデータでの成績を合わせて考えた適切な深さを選ぶ方法も課題です。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
著者らの実験は、層を増やすだけで学びにくくなる問題に対し、元の情報をそのまま通す近道が役立つことを示しました。別の種類の課題でも同じ傾向が出るなら、複雑な処理を足す前に情報を保つ道を設ける考え方が使えます。ただし、ここでの中心的な証拠は画像認識の設定に基づきます。
この読み方に出てくる言葉(2語)
- ショートカット接続
いくつかの処理を飛び越えて、入力を後ろへ直接渡す経路。
- 劣化問題
層を増やしたのに、学習データ上の誤りまで増えてしまう問題。
どんな問いに向き合ったか
ネットワークの層数を増やすと、勾配消失・爆発により訓練誤差すら下がらなくなる『劣化問題(Degradation Problem)』が発生していた。
肝のアイデア
目標とする写像H(x)を直接学習するのではなく、残差 F(x) = H(x) - x を学習させ、出力を F(x) + x とする。
どう確かめ、何が分かったか
著者らは、ILSVRC 2015分類タスクでTop-5エラー率3.57%(優勝)。ImageNet検出・局在化、COCO検出・セグメンテーションの全5冠を制覇。152層のResNet-152(11.3 GFLOPs)が16層のVGG-16(15.3 GFLOPs)より軽量であることを実証
注意すべきこと
層数が極端に増えるとメモリフットプリントが増大し、順伝播・逆伝播のバッファ管理が必要
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
深いネットワークでの訓練誤差改善が別の構成でも再現するなら、表現力を増やすだけでなく恒等経路を保つことが最適化上の重要な設計になります。ただし、ブロック構成や正規化、画像データの条件が結果に関与するため、ショートカットだけの効果として一般化はできません。
この読み方に出てくる言葉(3語)
- 残差学習
入力を直接作り直す代わりに、入力から変えるべき差分を学ぶ方法。
- 劣化問題
層を増やしたのに、学習データ上の誤りまで増えてしまう問題。
- ImageNet
多数の画像と分類ラベルを使う画像認識の評価データ。
どんな問いに向き合ったか
ネットワークの層数を増やすと、勾配消失・爆発により訓練誤差すら下がらなくなる『劣化問題(Degradation Problem)』が発生していた。
従来の方法と課題
正則化手法やバッチ正規化(BatchNorm)を用いて数十層の学習を試みるも、20〜30層程度で性能限界に達していた。
肝のアイデア
目標とする写像H(x)を直接学習するのではなく、残差 F(x) = H(x) - x を学習させ、出力を F(x) + x とする。
どういうしくみか
目的写像を H(x) とするとき、残差写像を F(x):=H(x)−x と定義し、ブロック構造を以下のように定式化します:
ここで x と y は入出力ベクトル、F は2層または3層の畳み込み層の写像です。F+x の加算後にReLU関数を適用します。
50層以上の深層モデルでは、計算量を抑えるため3層ボトルネックブロックを採用:
1×1 conv(次元削減: 256 -> 64)
3×3 conv(空間畳み込み: 64 -> 64)
1×1 conv(次元復元: 64 -> 256)
Identityショートカットはパラメータ不要でこのボトルネックを跨ぎます。
特徴マップの空間解像度が半分になりチャンネル数が2倍になる境界では、以下の2方式を検証:
(A) ゼロパディングによる次元拡張(パラメータゼロ)
(B) 1×1 畳み込みによる線形射影ショートカット y=F(x,{Wi})+Wsx
実験の結果、(B)がわずかに優れるものの、(A)でも非常に高い性能が得られ、本質はIdentity接続にあることが支持されました。
どう確かめたか
著者らは、152層のResNetアンサンブルによりImageNetテストセットで3.57%のトップ5誤り率を達成(人間の参考値を上回る・優勝)。COCO物体検出タスクにおいて前年チャンピオンに対し相対28%の精度向上を達成。CIFAR-10において100層および1000層のネットワークの最適化に成功
何が分かったか
その評価で著者らは、ILSVRC 2015分類タスクでTop-5誤り率3.57%(アンサンブル)を達成し優勝。単一モデル比較において、ResNet-152(Top-5: 4.49%)がVGG-16(7.4%)およびGoogLeNet(6.67%)を上回ったと報告。COCO 2015 Object DetectionにおいてmAP@[.5, .95] 37.3%(前年比28%向上)で優勝。CIFAR-10において110層および1202層のネットワークを学習し、110層で6.43%のエラー率を実証
どこまで使えるか
実証範囲はImageNet、CIFAR-10の画像分類と検出への転用です。残差接続の効果はブロック構成、正規化、最適化条件にも依存し、任意の深層モデルへの一般化は追加検証を要します。
限界と未解決の問い
1202層モデルでは訓練誤差はゼロに近いものの過学習によりテスト誤差が悪化(正則化の必要性)。特徴マップの解像度低下ポイントでの線形射影ショートカットのパラメータ増加。中間活性化保持による逆伝播時のGPUメモリ消費増大
層数が極端に増えるとメモリフットプリントが増大し、順伝播・逆伝播のバッファ管理が必要。残差接続自体の表現力(アンサンブルとしての挙動)に対する理論的解明は以後の後続研究に委ねられた
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
深いネットワークでの訓練誤差改善が別の構成でも再現するなら、表現力を増やすだけでなく恒等経路を保つことが最適化上の重要な設計になります。ただし、ブロック構成や正規化、画像データの条件が結果に関与するため、ショートカットだけの効果として一般化はできません。
この読み方に出てくる言葉(4語)
- 残差学習
入力を直接作り直す代わりに、入力から変えるべき差分を学ぶ方法。
- ショートカット接続
いくつかの処理を飛び越えて、入力を後ろへ直接渡す経路。
- 劣化問題
層を増やしたのに、学習データ上の誤りまで増えてしまう問題。
- ImageNet
多数の画像と分類ラベルを使う画像認識の評価データ。
問題設定と前提
ネットワークの層数を増やすと、勾配消失・爆発により訓練誤差すら下がらなくなる『劣化問題(Degradation Problem)』が発生していた。
関連研究の中での位置づけ
正則化手法やバッチ正規化(BatchNorm)を用いて数十層の学習を試みるも、20〜30層程度で性能限界に達していた。
提案手法の全体像
目標とする写像H(x)を直接学習するのではなく、残差 F(x) = H(x) - x を学習させ、出力を F(x) + x とする。
定式化と設計判断
深層モデル H が浅いモデル Hshallow に恒等写像層を付加したものである場合、深いモデルの訓練誤差は浅いモデルの訓練誤差の上界となるはずです:
しかし現実のSGDでは層が深くなるほど訓練損失が悪化しました。これは、複数の非線形重み層 σ(W2σ(W1x)) を用いて恒等関数 I(x)=x を学習することが、パラメータ空間の非凸性により非常に困難であることを意味します。
残差ブロックは以下のように定義されます:
任意の深い層 L と浅い層 l に対し、再帰的に展開すると:
損失 E に対する浅い層 xl の勾配は連鎖律により:
括弧内の単位行列項 I の存在により、中間の重み勾配 ∂x∂F の値に関わらず、最深層の勾配 ∂xL∂E が直接任意の浅い層 xl へ減衰せずに伝播します。
BasicBlock(18/34層): 3×3 conv (weight) -> BN -> ReLU -> 3×3 conv -> BN -> (+) -> ReLU
BottleneckBlock(50/101/152層): 1×1 conv (次元圧縮) -> 3×3 conv -> 1×1 conv (次元復元) -> (+) -> ReLU
ResNet-152は50個のBottleneckBlockを積層し、合計152層・パラメータ数約60.2M・計算量11.3 GFLOPsを実現。VGG-16(138Mパラメータ、15.3 GFLOPs)と比較して半分以下のパラメータと計算量で表現力を達成しました。
Identity Shortcut Connection: パラメータ追加も計算複雑度の増大もなしに、入力をそのまま加算。残差ブロック設計: 重み層(Conv)→ ReLU → 重み層(Conv)とショートカット加算 → ReLU。Bottleneck Architecture: 50層以上のモデルにおいて、1x1畳み込みで次元削減→3x3畳み込み→1x1で次元復元の3層構造。Batch Normalizationの徹底配置: 重み畳み込み直後・活性化前にBatchNormを挟み内部共変量シフトを抑制
学習・推論・実験条件
Identity Shortcut Connection: パラメータ追加も計算複雑度の増大もなしに、入力をそのまま加算。残差ブロック設計: 重み層(Conv)→ ReLU → 重み層(Conv)とショートカット加算 → ReLU。Bottleneck Architecture: 50層以上のモデルにおいて、1x1畳み込みで次元削減→3x3畳み込み→1x1で次元復元の3層構造。Batch Normalizationの徹底配置: 重み畳み込み直後・活性化前にBatchNormを挟み内部共変量シフトを抑制
評価設計
著者らは、152層のResNetアンサンブルによりImageNetテストセットで3.57%のトップ5誤り率を達成(人間の参考値を上回る・優勝)。COCO物体検出タスクにおいて前年チャンピオンに対し相対28%の精度向上を達成。CIFAR-10において100層および1000層のネットワークの最適化に成功
ILSVRC 2015 分類タスク: 単一モデルTop-5エラー率4.49%、アンサンブルで3.57%を達成し優勝(人間水準約5.1%を突破)。ILSVRC 2015 物体検出(Faster R-CNN統合): mAP 62.1%で1位(前年比16%向上)。ILSVRC 2015 局在化タスク: エラー率9.0%で1位。MS COCO 2015 物体検出タスク: mAP@[.5, .95]で37.3%を記録し優勝(先行SOTA比28%向上)。MS COCO 2015 セグメンテーション: mAP@[.5, .95] 28.2%で優勝。CIFAR-10実験: 20層(エラー率8.75%)、32層(7.51%)、44層(7.17%)、56層(6.97%)、110層(6.43%)と深さに比例して単調に性能が向上することを実証
何が分かったか
その条件で著者らは、ILSVRC 2015 分類タスク: 単一モデルTop-5エラー率4.49%、アンサンブルで3.57%を達成し優勝(人間水準約5.1%を突破)。ILSVRC 2015 物体検出(Faster R-CNN統合): mAP 62.1%で1位(前年比16%向上)。ILSVRC 2015 局在化タスク: エラー率9.0%で1位。MS COCO 2015 物体検出タスク: mAP@[.5, .95]で37.3%を記録し優勝(先行SOTA比28%向上)。MS COCO 2015 セグメンテーション: mAP@[.5, .95] 28.2%で優勝。CIFAR-10実験: 20層(エラー率8.75%)、32層(7.51%)、44層(7.17%)、56層(6.97%)、110層(6.43%)と深さに比例して単調に性能が向上することを実証
152層のResNetアンサンブルによりImageNetテストセットで3.57%のトップ5誤り率を達成(人間の参考値を上回る・優勝)。COCO物体検出タスクにおいて前年チャンピオンに対し相対28%の精度向上を達成。CIFAR-10において100層および1000層のネットワークの最適化に成功
アブレーションと失敗例
既存資料で報告された失敗や切り分けの範囲は次の通りです。層の有効深度とアンサンブル性: 後続研究により、残差ネットワーク内の各ブロックは個別に小さな更新を行っており、実質的には多数の浅い経路のアンサンブルとして機能していることが指摘された(Veit et al., 2016)。射影ショートカット(Projection Shortcut)の局所的コスト: ストライド2で解像度を半減させるブロックにおいて、チャンネル次元を整合させるための1x1畳み込み(Option B)が必要となる。勾配爆発/消失の排除ではない: 活性化関数(ReLU)の配置やBatch Normalizationの順序に依然として依存しており、後に「Pre-activation ResNet」(He et al., ECCV 2016)へと改良される余地を残していた
別の解釈と評価上の注意
改善にはショートカット接続だけでなく、バッチ正規化や訓練設定も関与します。比較実験は残差化の効果を支持しますが、後世の全アーキテクチャへ同じ説明をそのまま適用はできません。
限界と未解決の問い
層の有効深度とアンサンブル性: 後続研究により、残差ネットワーク内の各ブロックは個別に小さな更新を行っており、実質的には多数の浅い経路のアンサンブルとして機能していることが指摘された(Veit et al., 2016)。射影ショートカット(Projection Shortcut)の局所的コスト: ストライド2で解像度を半減させるブロックにおいて、チャンネル次元を整合させるための1x1畳み込み(Option B)が必要となる。勾配爆発/消失の排除ではない: 活性化関数(ReLU)の配置やBatch Normalizationの順序に依然として依存しており、後に「Pre-activation ResNet」(He et al., ECCV 2016)へと改良される余地を残していた
層数が極端に増えるとメモリフットプリントが増大し、順伝播・逆伝播のバッファ管理が必要。残差接続自体の表現力(アンサンブルとしての挙動)に対する理論的解明は以後の後続研究に委ねられた
残された問い
残差接続の効果が画像以外や異なる正規化条件でも同じか。深さ、幅、接続方法の寄与をどう分けるかが残ります。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
深いネットワークでの訓練誤差改善が別の構成でも再現するなら、表現力を増やすだけでなく恒等経路を保つことが最適化上の重要な設計になります。ただし、ブロック構成や正規化、画像データの条件が結果に関与するため、ショートカットだけの効果として一般化はできません。
この読み方に出てくる言葉(2語)
- 残差学習
入力を直接作り直す代わりに、入力から変えるべき差分を学ぶ方法。
- ショートカット接続
いくつかの処理を飛び越えて、入力を後ろへ直接渡す経路。
どんな問いに向き合ったか
ネットワークの層数を増やすと、勾配消失・爆発により訓練誤差すら下がらなくなる『劣化問題(Degradation Problem)』が発生していた。
肝のアイデア
目標とする写像H(x)を直接学習するのではなく、残差 F(x) = H(x) - x を学習させ、出力を F(x) + x とする。
どう確かめ、何が分かったか
著者らは、ILSVRC 2015画像分類Top-5誤り率3.57%(優勝)。ImageNetおよびCOCOコンペティションの全5部門制覇。CIFAR-10で100層超の安定学習を実証
注意すべきこと
層数が極端に増えるとメモリフットプリントが増大し、順伝播・逆伝播のバッファ管理が必要
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
ImageNet/CIFAR-10での深さ比較とアブレーションは、残差パラメータ化が劣化問題を緩和することを支持する。異なるアーキテクチャでも再現するなら恒等経路を最適化の基準として扱えるが、評価は画像認識と当該訓練設定に依存し、勾配伝播の説明だけで全効果を同定したものではない。
この読み方に出てくる言葉(3語)
- 残差学習
入力を直接作り直す代わりに、入力から変えるべき差分を学ぶ方法。
- ショートカット接続
いくつかの処理を飛び越えて、入力を後ろへ直接渡す経路。
- 劣化問題
層を増やしたのに、学習データ上の誤りまで増えてしまう問題。
どんな問いに向き合ったか
ネットワークの層数を増やすと、勾配消失・爆発により訓練誤差すら下がらなくなる『劣化問題(Degradation Problem)』が発生していた。
従来の方法と課題
正則化手法やバッチ正規化(BatchNorm)を用いて数十層の学習を試みるも、20〜30層程度で性能限界に達していた。
肝のアイデア
目標とする写像H(x)を直接学習するのではなく、残差 F(x) = H(x) - x を学習させ、出力を F(x) + x とする。
どういうしくみか
残差ブロックの定式化
残差ブロックは y=F(x,{Wi})+x として定義されます。x と y は入出力ベクトル、F は畳み込み層と活性化関数の合成写像です。ショートカット接続は追加パラメータや乗算を一切必要とせず、要素ごとの加算のみで完結します。
ボトルネック構造
深層モデル(ResNet-50/101/152)では、1x1、3x3、1x1の畳み込みからなるボトルネックブロックを導入。1x1畳み込みで次元を圧縮してから3x3畳み込みを行い、再び1x1畳み込みで次元を復元することで、計算量を抑制しながら表現力を極大化しました。
勾配伝播の安定化
Identity Shortcutにより、逆伝播時に誤差信号が直接任意の浅い層へ減衰なく伝播。100層を超える深層モデルでも勾配消失が回避されます。
どう確かめたか
著者らは、152層のResNetアンサンブルによりImageNetテストセットで3.57%のトップ5誤り率を達成(人間の参考値を上回る・優勝)。COCO物体検出タスクにおいて前年チャンピオンに対し相対28%の精度向上を達成。CIFAR-10において100層および1000層のネットワークの最適化に成功
何が分かったか
その評価で著者らは、ILSVRC 2015分類タスクでTop-5誤り率3.57%(人間の参考値を上回る)で優勝。COCO 2015検出タスクでmAP@[.5, .95] 37.3%を達成(前年比28%向上)。CIFAR-10において110層および1202層のネットワークを学習し、深さに応じた性能向上を実証
どこまで使えるか
結論はImageNet/CIFAR-10 classificationとdetection transfer、および当該training recipeに依存する。identity shortcutの寄与は支持されるが、正規化やblock designを越えた普遍的効果までは同定していない。
限界と未解決の問い
ダウンサンプリング境界における射影ショートカットの局所的パラメータ追加。中間活性化キャッシュによる訓練時メモリフットプリントの増大。各ブロックが寄与する表現の冗長性
層数が極端に増えるとメモリフットプリントが増大し、順伝播・逆伝播のバッファ管理が必要。残差接続自体の表現力(アンサンブルとしての挙動)に対する理論的解明は以後の後続研究に委ねられた
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
ImageNet/CIFAR-10での深さ比較とアブレーションは、残差パラメータ化が劣化問題を緩和することを支持する。異なるアーキテクチャでも再現するなら恒等経路を最適化の基準として扱えるが、評価は画像認識と当該訓練設定に依存し、勾配伝播の説明だけで全効果を同定したものではない。
この読み方に出てくる言葉(3語)
- 残差学習
入力を直接作り直す代わりに、入力から変えるべき差分を学ぶ方法。
- 劣化問題
層を増やしたのに、学習データ上の誤りまで増えてしまう問題。
- ImageNet
多数の画像と分類ラベルを使う画像認識の評価データ。
問題設定と前提
ネットワークの層数を増やすと、勾配消失・爆発により訓練誤差すら下がらなくなる『劣化問題(Degradation Problem)』が発生していた。
関連研究の中での位置づけ
正則化手法やバッチ正規化(BatchNorm)を用いて数十層の学習を試みるも、20〜30層程度で性能限界に達していた。
提案手法の全体像
目標とする写像H(x)を直接学習するのではなく、残差 F(x) = H(x) - x を学習させ、出力を F(x) + x とする。
定式化と設計判断
深層モデル H が浅いモデルに恒等層を付加したものである場合、理論上の最適化解空間において深いモデルの訓練損失は浅いモデル以下でなければなりません。しかし従来のSGDでは深層化に伴い訓練損失が悪化しました。これは、多層の非線形変換 σ(W2σ(W1x)) によって恒等関数 I(x)=x を学習することが、非凸最適化において非常に困難であることを報告しています。
残差ブロックは以下のように定式化されます:
これを任意の深い層 L まで再帰展開すると:
損失 E の浅い層 xl に対する勾配は:
単位行列項 I の存在により、中間の重み勾配が微小であっても、勾配 ∂xL∂E が減衰することなく直接浅い層 xl へ届きます。
計算量増大を抑制するため、50層以上のモデルでは3層構成のボトルネックブロックを導入:
1×1 conv(チャンネル次元圧縮: 4倍削減)
3×3 conv(空間特徴抽出)
1×1 conv(チャンネル次元復元: 4倍拡大)
ResNet-152(11.3 GFLOPs)は、わずか16層のVGG-16(15.3 GFLOPs)より軽量でありながら、表現力を達成しました。
Identity Shortcut Connection: パラメータ追加も計算複雑度の増大もなしに、入力をそのまま加算。残差ブロック設計: 重み層(Conv)→ ReLU → 重み層(Conv)とショートカット加算 → ReLU。Bottleneck Architecture: 50層以上のモデルにおいて、1x1畳み込みで次元削減→3x3畳み込み→1x1で次元復元の3層構造。Batch Normalizationの徹底配置: 重み畳み込み直後・活性化前にBatchNormを挟み内部共変量シフトを抑制
学習・推論・実験条件
Identity Shortcut Connection: パラメータ追加も計算複雑度の増大もなしに、入力をそのまま加算。残差ブロック設計: 重み層(Conv)→ ReLU → 重み層(Conv)とショートカット加算 → ReLU。Bottleneck Architecture: 50層以上のモデルにおいて、1x1畳み込みで次元削減→3x3畳み込み→1x1で次元復元の3層構造。Batch Normalizationの徹底配置: 重み畳み込み直後・活性化前にBatchNormを挟み内部共変量シフトを抑制
評価設計
著者らは、152層のResNetアンサンブルによりImageNetテストセットで3.57%のトップ5誤り率を達成(人間の参考値を上回る・優勝)。COCO物体検出タスクにおいて前年チャンピオンに対し相対28%の精度向上を達成。CIFAR-10において100層および1000層のネットワークの最適化に成功
ILSVRC 2015 分類タスク: 単一モデルTop-5エラー率4.49%、アンサンブルで3.57%を達成し優勝(人間水準約5.1%を突破)。ILSVRC 2015 物体検出(Faster R-CNN統合): mAP 62.1%で1位(前年比16%向上)。ILSVRC 2015 局在化タスク: エラー率9.0%で1位。MS COCO 2015 物体検出タスク: mAP@[.5, .95]で37.3%を記録し優勝(先行SOTA比28%向上)。MS COCO 2015 セグメンテーション: mAP@[.5, .95] 28.2%で優勝。CIFAR-10実験: 20層から110層(エラー率6.43%)まで深さに比例した安定的な性能向上を実証
何が分かったか
その条件で著者らは、ILSVRC 2015 分類タスク: 単一モデルTop-5エラー率4.49%、アンサンブルで3.57%を達成し優勝(人間水準約5.1%を突破)。ILSVRC 2015 物体検出(Faster R-CNN統合): mAP 62.1%で1位(前年比16%向上)。ILSVRC 2015 局在化タスク: エラー率9.0%で1位。MS COCO 2015 物体検出タスク: mAP@[.5, .95]で37.3%を記録し優勝(先行SOTA比28%向上)。MS COCO 2015 セグメンテーション: mAP@[.5, .95] 28.2%で優勝。CIFAR-10実験: 20層から110層(エラー率6.43%)まで深さに比例した安定的な性能向上を実証
152層のResNetアンサンブルによりImageNetテストセットで3.57%のトップ5誤り率を達成(人間の参考値を上回る・優勝)。COCO物体検出タスクにおいて前年チャンピオンに対し相対28%の精度向上を達成。CIFAR-10において100層および1000層のネットワークの最適化に成功
アブレーションと失敗例
既存資料で報告された失敗や切り分けの範囲は次の通りです。層の表現冗長性: 多数の層が微小な差分のみを担っており、実質的な浅い経路のアンサンブルとして振る舞う性質(Veit et al., 2016)。射影ショートカットの局所的コスト: 解像度ダウンサンプリング境界における1x1畳み込み(Option B)のパラメータ増加。訓練時GPUメモリの大量消費: 152層分の中間特徴マップ保持に伴うメモリ負荷
別の解釈と評価上の注意
改善にはショートカット接続だけでなく、バッチ正規化や訓練設定も関与します。比較実験は残差化の効果を支持しますが、後世の全アーキテクチャへ同じ説明をそのまま適用はできません。
限界と未解決の問い
層の表現冗長性: 多数の層が微小な差分のみを担っており、実質的な浅い経路のアンサンブルとして振る舞う性質(Veit et al., 2016)。射影ショートカットの局所的コスト: 解像度ダウンサンプリング境界における1x1畳み込み(Option B)のパラメータ増加。訓練時GPUメモリの大量消費: 152層分の中間特徴マップ保持に伴うメモリ負荷
層数が極端に増えるとメモリフットプリントが増大し、順伝播・逆伝播のバッファ管理が必要。残差接続自体の表現力(アンサンブルとしての挙動)に対する理論的解明は以後の後続研究に委ねられた
残された問い
残差接続の効果が画像以外や異なる正規化条件でも同じか。深さ、幅、接続方法の寄与をどう分けるかが残ります。
この研究から考える
ここからは、論文の結果を踏まえた編集上の考察です。
ImageNet/CIFAR-10での深さ比較とアブレーションは、残差パラメータ化が劣化問題を緩和することを支持する。異なるアーキテクチャでも再現するなら恒等経路を最適化の基準として扱えるが、評価は画像認識と当該訓練設定に依存し、勾配伝播の説明だけで全効果を同定したものではない。