Tier 2: 現代の標準技術自律エージェント・ツール活用HF 295 votes
AIエージェントReActツール利用

ReAct:言語モデルにおける推論(Reasoning)と行動(Acting)の相乗的結合

「思考(Thought)」と「行動(Action/Observation)」のループ構造により、幻覚を抑え外部ツールと対話する現代AIエージェントの基盤パラダイムを確立

ReAct: Synergizing Reasoning and Acting in Language Models

論文の書誌情報と関連リンク

読み方の2つの軸

現在:しくみ × 全体像

語彙 使うことば・数式・例え方

直感数式なし
しくみ基礎的な数式
原論文原論文の表現

深さ 研究のどこまで読むか

核心肝だけ
全体像背景から評価
読み解く前提から限界

この2本は、本文下のスライダーからいつでも変更できます。

概要

ReActは、AIが考えを言葉にし、検索などの行動を行い、その結果を読んで次へ進む方法です。考えるだけ、動くだけという二つの弱点を組み合わせで補います。

ReActは「考える・行動する・観察する」を交互に繰り返します。著者らは、質問応答と対話型の意思決定課題で、考えるだけの方法や行動だけの方法と比較しました。

ReAct論文は、内部の推論と外部環境への行動を一つの流れに並べます。知識を探す課題と、環境内で目標を達成する課題の両方を調べ、検索失敗や長い履歴による制約も示します。

ReActは、言語モデルのreasoning traceと外部environment actionを交互に生成し、観察結果を次の推論へ戻す枠組みです。

ReActはThought–Action–Observationの軌跡をfew-shot promptで生成します。HotpotQA・FEVERの知識課題とALFWorld・WebShopの意思決定課題で、CoTやAct-onlyなどと比較されました。

ReActは、内部推論による計画と外部観察による事実接地を同じ生成軌跡に置きます。深掘りでは、タスク別の比較、軌跡の解釈可能性、検索エラー、ループ、コンテキスト消費を分けて検討します。

ReActは、reasoning tracesとtask-specific actionsをinterleaveするlanguage-agent prompting methodです。

ReActは、thoughtがaction selectionを導き、environment observationが後続thoughtを更新するtrajectoryを生成します。knowledge-intensive QAとinteractive decision makingでCoT、Act-only等と比較します。

本論文はReAct trajectoryをthought、action、observationの系列として扱い、HotpotQA、FEVER、ALFWorld、WebShopで検証します。評価では成功率だけでなく、根拠追跡と失敗軌跡の解釈にも注意が必要です。

Shunyu YaoPrinceton University
Karthik NarasimhanPrinceton University
著者をもっと詳しく知る

論文と確認可能な公式情報に基づき、著者の所属と研究背景を掲載しています。

Shunyu Yao
所属
: Princeton University
学歴
: Princeton University博士課程(当時)。自律AIエージェントと推論構造の世界的先駆者。
研究の系譜
: Karthik Narasimhan研究室出身。ReAct, Tree of Thoughts, SWE-bench等の著者。
代表的な論文
: ReActフレームワークの設計とHotpotQA/ALFWorldにおける実証
Karthik Narasimhan
所属
: Princeton University
学歴
: Princeton University准教授。自然言語処理と強化学習の交差領域を牽引。
研究の系譜
: テキストベースゲームや環境相互作用型言語モデルのパイオニア。
代表的な論文
: 研究指導およびエージェント決定理論の体系化

なぜ歴史的イノベーションなのか

LangChain等のエージェントフレームワークがReActをコア実行ループとして採用したことで世界中に普及し、現代のAIエージェント開発の標準教本となりました。

LangChain等のエージェントフレームワークがReActをコア実行ループとして採用したことで世界中に普及し、現代のAIエージェント開発の標準教本となりました。

LangChain等のエージェントフレームワークがReActをコア実行ループとして採用したことで世界中に普及し、現代のAIエージェント開発の標準教本となりました。

LangChain等のエージェントフレームワークがReActをコア実行ループとして採用したことで世界中に普及し、現代のAIエージェント開発の標準教本となりました。

LangChain等のエージェントフレームワークがReActをコア実行ループとして採用したことで世界中に普及し、現代のAIエージェント開発の標準教本となりました。

LangChain等のエージェントフレームワークがReActをコア実行ループとして採用したことで世界中に普及し、現代のAIエージェント開発の標準教本となりました。

LangChain等のエージェントフレームワークがReActをコア実行ループとして採用したことで世界中に普及し、現代のAIエージェント開発の標準教本となりました。

LangChain等のエージェントフレームワークがReActをコア実行ループとして採用したことで世界中に普及し、現代のAIエージェント開発の標準教本となりました。

LangChain等のエージェントフレームワークがReActをコア実行ループとして採用したことで世界中に普及し、現代のAIエージェント開発の標準教本となりました。

コミュニティの評価・歴史的インパクト(1件)
  • 思考を挟むことで行動の無駄打ちが消え、行動を挟むことで思考の幻覚が消える。この相乗効果の発見は天才的。

    原文を見る ↗
この読み方に出てくる言葉(4語)
推論

学習済みモデルから出力を生成する処理。

トークン

言語モデルが入出力を扱う離散的な単位。

ベンチマーク

モデル性能を比較する標準化された評価課題。

エージェント

推論と外部環境への行動を交互に行うシステム。

どんな問いに向き合ったか

既存の資料には、この項目を個別に判断できるだけの記述がありません。

従来の方法と課題

この研究が比べた従来案と課題は、提案の説明では次のように位置づけられています。

肝のアイデア

・思考と行動のデュアル空間における自己回帰的軌跡(Trajectory)生成

・外部知識ベースへのオンデマンドアクセスによるハルシネーションの構造的抑止

どういうしくみか

エージェント状態遷移:状態 st=(x,a1,o1,,at1,ot1)s_t = (x, a_1, o_1, \dots, a_{t-1}, o_{t-1}) に対し、ポリシー π(atst)\pi(a_t | s_t) を展開。ReActでは行動空間 A=AenvLthought\mathcal{A} = \mathcal{A}_{env} \cup \mathcal{L}_{thought} と拡張。思考 rtLthoughtr_t \in \mathcal{L}_{thought} は環境状態を遷移させず、推論トレースとしてコンテキストを更新。行動 atAenva_t \in \mathcal{A}_{env}(Search, Lookup, Finish等)が環境APIを駆動し観測 oto_t を取得します。

どう確かめたか

著者報告の結果は次の評価条件に基づきます。

・HotpotQAにおいて、Act-only(25.7%)やCoT(29.4%)に対し、ReAct + CoT統合で35.1%の正解率を達成

・Fever事実検証タスクにおいて、虚偽の主張に対する誤検証率が従来の1/3に激減

何が分かったか

著者報告の結果は次の評価条件に基づきます。

・ALFWorldにおいて、目標達成成功率がAct-onlyの45%から71%へと急上昇

どこまで使えるか

この結果が直接支えるのは、論文が評価した課題と比較条件です。別の用途へ広げる場合は、同じ傾向が保たれるかを改めて測る必要があります。

・タスク分解、例外処理、サブゴール適応を自律的にこなすプロンプト設計

限界と未解決の問い

・観察トークン(Webページ全文等)の肥大化によるコンテキスト長の圧迫

・検索クエリ生成の失敗時に軌道修正できず誤った確信を強めるリスク

この研究から考える

ここからは、論文の結果を踏まえた編集上の考察です。

ReActは質問応答と環境内の意思決定で、思考だけ・行動だけの比較手法を上回る結果を報告しました。この観察が自分のデータと計算条件でも保たれるなら、外部情報が必要な課題では、推論と行動を交互にすることが有力な比較軸になります。検索失敗や行動ループが起きるため、外部環境の品質と停止条件に依存しますので、同じbaselineとmetricでの比較が前提です。