Tier 1: 世界のルールを不可逆に変えた原典画像生成HF 380 votes
画像生成拡散モデル潜在空間

潜在空間拡散モデル(LDM):知覚的圧縮による高解像度画像合成

事前学習済みオートエンコーダの低次元潜在空間で拡散プロセスを動作させ、Cross-Attentionでテキスト条件づけを行うことで画像生成AIの民主化を達成

High-Resolution Image Synthesis with Latent Diffusion Models

論文の書誌情報と関連リンク

読み方の2つの軸

現在:しくみ × 全体像

語彙 使うことば・数式・例え方

直感数式なし
しくみ基礎的な数式
原論文原論文の表現

深さ 研究のどこまで読むか

核心肝だけ
全体像背景から評価
読み解く前提から限界

この2本は、本文下のスライダーからいつでも変更できます。

概要

高解像度画像を画素のまま少しずつ作ると計算が重くなります。LDMは先に画像を小さな特徴表現へ圧縮し、その中でノイズ除去を行い、最後に画像へ戻します。文章などの条件も途中で参照できます。 研究の問い、方法、主結果、主要な注意点に絞ります。

高解像度画像を画素のまま少しずつ作ると計算が重くなります。LDMは先に画像を小さな特徴表現へ圧縮し、その中でノイズ除去を行い、最後に画像へ戻します。文章などの条件も途中で参照できます。 背景から評価方法、使える範囲まで順に見ます。

高解像度画像を画素のまま少しずつ作ると計算が重くなります。LDMは先に画像を小さな特徴表現へ圧縮し、その中でノイズ除去を行い、最後に画像へ戻します。文章などの条件も途中で参照できます。 前提や評価の弱点、まだ答えのない点まで丁寧に確かめます。

Latent Diffusion Modelsは、学習済みオートエンコーダの潜在空間で拡散モデルを学習し、Cross-Attentionでテキストや配置などの条件を統合します。原論文は圧縮率と再構成品質、生成品質、計算量の関係を評価しています。 研究課題、中心機構、代表結果、主要な制約を要約します。

Latent Diffusion Modelsは、学習済みオートエンコーダの潜在空間で拡散モデルを学習し、Cross-Attentionでテキストや配置などの条件を統合します。原論文は圧縮率と再構成品質、生成品質、計算量の関係を評価しています。 先行法との差、処理の流れ、評価条件、適用範囲まで確認します。

Latent Diffusion Modelsは、学習済みオートエンコーダの潜在空間で拡散モデルを学習し、Cross-Attentionでテキストや配置などの条件を統合します。原論文は圧縮率と再構成品質、生成品質、計算量の関係を評価しています。 設計上の仮定、実験条件、別の解釈、未解決点まで検討します。

LDMは正則化オートエンコーダで得た潜在表現上にdenoising diffusion objectiveを置き、cross-attentionを条件付けの共通インターフェースとして用います。原論文は複数の圧縮率と画像合成タスクを比較しています。 research question、method、headline result、principal caveatを原論文用語で整理します。

LDMは正則化オートエンコーダで得た潜在表現上にdenoising diffusion objectiveを置き、cross-attentionを条件付けの共通インターフェースとして用います。原論文は複数の圧縮率と画像合成タスクを比較しています。 prior work、formulation、evaluation protocol、scopeを追います。

LDMは正則化オートエンコーダで得た潜在表現上にdenoising diffusion objectiveを置き、cross-attentionを条件付けの共通インターフェースとして用います。原論文は複数の圧縮率と画像合成タスクを比較しています。 assumption、ablationの有無、external validity、open questionまで精査します。

Robin RombachLMU Munich / Stability AI / Black Forest Labs
Björn OmmerLMU Munich
著者をもっと詳しく知る

論文と確認可能な公式情報に基づき、著者の所属と研究背景を掲載しています。

所属
: LMU Munich / Stability AI / Black Forest Labs
学歴
: LMU Munich 博士(Björn Ommer研究室)
経歴
: LMU Munich、Stability AI、Black Forest Labs (FLUX) 共同創業者
研究の系譜
: Björn Ommer
代表的な論文
: VQGAN、Latent Diffusion Models、Stable Diffusion、FLUX.1
関連情報
: Stable Diffusionの筆頭開発者であり、画像生成AIの世界的普及を牽引したBlack Forest Labsの共同創業者
所属
: LMU Munich
学歴
: ETH Zurich 博士、Heidelberg University 教授
経歴
: Heidelberg University、LMU Munich 教授
研究の系譜
: Joachim M. Buhmann(ETH Zurich)
代表的な論文
: Taming Transformers (VQGAN)、Latent Diffusion Models
関連情報
: CompVis研究室を率いてVQGANおよびLDMの基礎理論を確立

なぜ歴史的イノベーションなのか

拡散プロセスを低次元潜在空間に移行しコンシューマGPUでの高解像度生成を可能にしたStable Diffusionの原典

拡散プロセスを低次元潜在空間に移行しコンシューマGPUでの高解像度生成を可能にしたStable Diffusionの原典

拡散プロセスを低次元潜在空間に移行しコンシューマGPUでの高解像度生成を可能にしたStable Diffusionの原典

拡散プロセスを低次元潜在空間に移行しコンシューマGPUでの高解像度生成を可能にしたStable Diffusionの原典

拡散プロセスを低次元潜在空間に移行しコンシューマGPUでの高解像度生成を可能にしたStable Diffusionの原典

拡散プロセスを低次元潜在空間に移行しコンシューマGPUでの高解像度生成を可能にしたStable Diffusionの原典

拡散プロセスを低次元潜在空間に移行しコンシューマGPUでの高解像度生成を可能にしたStable Diffusionの原典

拡散プロセスを低次元潜在空間に移行しコンシューマGPUでの高解像度生成を可能にしたStable Diffusionの原典

拡散プロセスを低次元潜在空間に移行しコンシューマGPUでの高解像度生成を可能にしたStable Diffusionの原典

コミュニティの評価・歴史的インパクト(1件)
  • 事前学習済みオートエンコーダの低次元潜在空間で拡散プロセスを動作させ、Cross-Attentionでテキスト条件づけを行うことで画像生成AIの民主化を達成

    原文を見る ↗
この読み方に出てくる言葉(6語)
潜在空間

画像をそのままの画素ではなく、重要な特徴へ圧縮して表す空間。 この論文では処理の流れの中で役割を区別して扱う。

拡散モデル

ノイズから少しずつ画像を復元する生成モデル。 この論文では処理の流れの中で役割を区別して扱う。

オートエンコーダ

入力を圧縮表現へ変換し、そこから元に近い形へ戻すモデル。 この論文では処理の流れの中で役割を区別して扱う。

Cross-Attention

画像側の特徴が、文章など別の入力のどこを参照するかを決める仕組み。 この論文では処理の流れの中で役割を区別して扱う。

FID

生成画像の分布が実画像の分布にどれほど近いかを見る指標。低いほど近い。 この論文では処理の流れの中で役割を区別して扱う。

U-Net

細かさの異なる特徴を行き来しながら画像を処理するネットワーク。 この論文では処理の流れの中で役割を区別して扱う。

どんな問いに向き合ったか

従来の拡散モデル(DDPM等)はピクセル空間(画素単位)でノイズ除去を反復するため、高解像度画像の学習と生成に数百GPU日の大きな計算リソースと遅い推論時間を要していた。

この問いに対し、提案手法と比較手法を同じ評価条件で比べる。

従来の方法と課題

画素空間での直接的な拡散モデル(DDPM、IDDPM)、または敵対的生成ネットワーク(StyleGAN)による学習不安定性と多様性不足。

提案の差分は、この先行手法の制約に対して読む必要がある。

肝のアイデア

Latent Diffusion Modelsは、学習済みオートエンコーダの潜在空間で拡散モデルを学習し、Cross-Attentionでテキストや配置などの条件を統合します。原論文は圧縮率と再構成品質、生成品質、計算量の関係を評価しています。

この中心アイデアを、先行法との差と評価結果を分けて確認する。

どういうしくみか

KL/VQオートエンコーダ、U-Net拡散モデル、Cross-Attention、CLIPテキストエンコーダ。

中心となる流れは次の通り。

  1. 1. 正則化オートエンコーダ(KL正則化またはVQ正則化)により、高解像度画像 xRH×W×3x \in \mathbb{R}^{H \times W \times 3} を低次元潜在変数 z=E(x)Rh×w×cz = \mathcal{E}(x) \in \mathbb{R}^{h \times w \times c}(圧縮率 f=H/h=8f = H/h = 8 等)へ射影
  2. 2. 潜在空間内で前方向拡散プロセス(ガウスノイズ付加)および逆方向ノイズ予測U-Netを学習
  3. 3. U-Netの中間層にCross-Attention層を導入し、CLIP等のドメイン専用エンコーダで処理されたテキストプロンプト yy の埋め込み τθ(y)\tau_\theta(y) を注入
  4. 4. 生成時は潜在空間内でノイズから z0z_0 をサンプリングし、デコーダ x=D(z0)x = \mathcal{D}(z_0) により高解像度画像へと復元。

どう確かめたか

原論文に記録された評価結果は次の通り。

  1. MS-COCOテキスト条件付き画像合成においてFIDスコア10.56を達成し従来のGANや自己回帰モデルを上回り(指標はMS-COCO FID、値は10.56、比較対象はPrior Pixel DMs / GANs)。これは著者報告の結果として読む必要がある。

評価では、記載された比較対象と指標を固定したうえで提案手法との差を確認している。

何が分かったか

著者らが報告した主な結果は次の通り。

  1. MS-COCOで最先端のFIDスコアを獲得
  2. 広い範囲の画像生成AIブームの原動力。

これらは原論文の著者報告であり、比較対象、データ、指標をそろえた範囲で解釈する。

どこまで使えるか

この論文が直接確かめた範囲は、記載されたデータセット、比較対象、指標、計算条件に限られる。別の用途へ広げる場合は、同じ効果が保たれるかを改めて測る必要がある。

限界と未解決の問い

確認すべき限界は次の通り。

  1. オートエンコーダのボトルネックによる手指や文字の崩れ
  2. ネガティブプロンプトやCFGパラメータへの依存性。

評価対象と異なるデータ、規模、計算条件へ結論を広げるには追加検証が必要になる。

この研究から考える

ここからは、論文の結果を踏まえた編集上の考察です。

著者らは、画素空間ではなく潜在空間で拡散過程を動かし、MS-COCOを含む評価で生成品質と計算効率の両立を報告しています。圧縮後も知覚上重要な情報が残る条件なら、生成処理の計算をより意味的な部分へ集中できます。採用を決める際は、論文と同じ指標だけでなく、対象データと計算条件でも比較したいところです。圧縮器が失った細部は後段で戻せず、画像生成には反復サンプリングの時間も残ります。