Tier 2: 現代の標準技術アーキテクチャHF 210 votes
位置埋め込みRoPETransformer

RoFormer:回転位置埋め込み(RoPE)によるTransformerの強化

複素数平面での回転行列を用い、絶対位置埋め込みをアテンション内積の相対位置関係へと自然に変換する現代LLMのデファクトスタンダード

RoFormer: Enhanced Transformer with Rotary Position Embedding

論文の書誌情報と関連リンク

読み方の2つの軸

現在:しくみ × 全体像

語彙 使うことば・数式・例え方

直感数式なし
しくみ基礎的な数式
原論文原論文の表現

深さ 研究のどこまで読むか

核心肝だけ
全体像背景から評価
読み解く前提から限界

この2本は、本文下のスライダーからいつでも変更できます。

概要

RoPEは、文章中の位置に応じて単語の内部表現を回転させ、二つの単語がどれだけ離れているかを注意機構へ伝える方法です。

従来の位置情報には、各場所の番号を足す方法と、二語の距離を直接使う方法がありました。RoPEは位置ごとの回転を使い、扱いやすい絶対位置から相対的な距離が表れるようにします。

RoFormer論文は、位置に応じた回転を注意機構へ組み込み、単語間の距離を内積に反映させます。複数の文章理解課題で比較する一方、学習時より長い文章への広がりは別途検証が必要です。

RoPEは、queryとkeyの各2次元部分空間へ位置依存の回転を適用し、内積を相対位置差の関数にする位置表現です。

RoFormerは、絶対位置で定義した直交回転をself-attentionへ適用し、追加の学習パラメータなしで相対位置を表します。著者らは分類、照応、言語モデル課題で既存位置表現と比較しました。

RoPEの焦点は、回転行列の内積が位置差だけに依存する定式化、長距離で内積が減衰する性質、線形attentionとの組合せです。実験範囲を越えた長さへの外挿は原論文の結果と分けて考えます。

RoFormerはRotary Position Embeddingをself-attentionへ導入し、absolute position encodingからrelative dependencyを得ます。

RoPEはquery/keyの2次元成分にposition-dependent rotation matrixを作用させ、attention scoreをrelative offsetに依存させます。著者らは複数のNLP benchmarkでabsolute・relative encodingと比較します。

本論文はRoPEの複素数表現、block-diagonal rotation、relative-position property、decay characteristicを定式化します。RoFormerの比較結果と、未学習長への外挿について原論文が直接示す範囲を区別します。

Jianlin SuZhuiyi Technology
著者をもっと詳しく知る

論文と確認可能な公式情報に基づき、著者の所属と研究背景を掲載しています。

Jianlin Su
所属
: Zhuiyi Technology
学歴
: 中国の著名な独立AI研究者(ブログ『科学空間』主宰)。
研究の系譜
: 数学的直観に基づき、RoPEをはじめとする数々のエレガントな数理的改良を提案。
代表的な論文
: RoPEの数学的定式化およびRoFormerの実装

なぜ歴史的イノベーションなのか

Su Jianlin氏のブログから発信され、オープンソースLLMブーム(LLaMA以降)によって一躍世界のデファクトスタンダードに登り詰めました。

Su Jianlin氏のブログから発信され、オープンソースLLMブーム(LLaMA以降)によって一躍世界のデファクトスタンダードに登り詰めました。

Su Jianlin氏のブログから発信され、オープンソースLLMブーム(LLaMA以降)によって一躍世界のデファクトスタンダードに登り詰めました。

Su Jianlin氏のブログから発信され、オープンソースLLMブーム(LLaMA以降)によって一躍世界のデファクトスタンダードに登り詰めました。

Su Jianlin氏のブログから発信され、オープンソースLLMブーム(LLaMA以降)によって一躍世界のデファクトスタンダードに登り詰めました。

Su Jianlin氏のブログから発信され、オープンソースLLMブーム(LLaMA以降)によって一躍世界のデファクトスタンダードに登り詰めました。

Su Jianlin氏のブログから発信され、オープンソースLLMブーム(LLaMA以降)によって一躍世界のデファクトスタンダードに登り詰めました。

Su Jianlin氏のブログから発信され、オープンソースLLMブーム(LLaMA以降)によって一躍世界のデファクトスタンダードに登り詰めました。

Su Jianlin氏のブログから発信され、オープンソースLLMブーム(LLaMA以降)によって一躍世界のデファクトスタンダードに登り詰めました。

コミュニティの評価・歴史的インパクト(1件)
  • 回転行列の内積というエレガントな数学的着想が、計算効率と長系列外挿性の両立において完璧な解答だった。

    原文を見る ↗
この読み方に出てくる言葉(6語)
自己注意

各トークンが系列内のほかのトークンを重み付きで参照する機構。

推論

学習済みモデルから出力を生成する処理。

計算量

処理に必要な演算資源の量。

トークン

言語モデルが入出力を扱う離散的な単位。

ベンチマーク

モデル性能を比較する標準化された評価課題。

Transformer

注意機構を中心に系列を処理するニューラルネットワーク。

どんな問いに向き合ったか

推論時のKVキャッシュ構造を乱すことなく相対位置関係をモデル化できるため、現代のデコーダ専用LLMの広く使われるスタンダードとして定着しました。

従来の方法と課題

この研究が比べた従来案と課題は、提案の説明では次のように位置づけられています。

推論時のKVキャッシュ構造を乱すことなく相対位置関係をモデル化できるため、現代のデコーダ専用LLMの広く使われるスタンダードとして定着しました。

肝のアイデア

・絶対位置の直交回転による相対位置内積の厳密な定式化

・メモリ消費ゼロ、計算量 O(d)O(d) の高効率な要素積カーネル構成

どういうしくみか

効率的な構成アルゴリズム:

  1. 要素積による回転計算: 行列積を用いず、RΘ,mx=xcos(mΘ)+x~sin(mΘ)R_{\Theta, m} x = x \odot \cos(m\Theta) + \tilde{x} \odot \sin(m\Theta)(ここで x~=[x1,x0,x3,x2,]\tilde{x} = [-x_1, x_0, -x_3, x_2, \dots])として O(d)O(d) で直接計算。
  2. 周波数配置: 低周波から高周波までの帯域を指数的に割り振り、近傍の構文関係から長距離のトピック関係までを多角的に表現。
  3. アテンション統合: FlashAttention等の融合カーネル内でQ/K生成直後にインプレース適用可能。

どう確かめたか

著者報告の結果は次の評価条件に基づきます。

何が分かったか

著者報告の結果は次の評価条件に基づきます。

・後続のNTK-aware RoPEスケーリングやYaRNにより、コンテキスト長を容易に32k〜128kへ拡張可能であることを実証

どこまで使えるか

この結果が直接支えるのは、論文が評価した課題と比較条件です。別の用途へ広げる場合は、同じ傾向が保たれるかを改めて測る必要があります。

・長距離におけるアテンション重みの理論的減衰特性(Long-term Decay)の実証

限界と未解決の問い

・コンテキスト長を拡張する際、高周波帯域の位相情報が圧縮されることで局所的な単語順序の識別能が低下するトレードオフがある。

・Valueベクトルには位置情報が付与されないため、位置に依存した表現の直接的な変換はFFNの非線形性に依存する。

この研究から考える

ここからは、論文の結果を踏まえた編集上の考察です。

RoFormerは複数の文章理解課題で既存の位置表現を上回る結果を報告しました。この観察が自分のデータと計算条件でも保たれるなら、位置の差を注意機構の内積へ組み込む設計は、位置表現の比較候補になります。注意計算の二乗コストは残り、学習時より長い系列への外挿は別の検証が必要ですので、同じbaselineとmetricでの比較が前提です。