AI Scientistコーディングエージェント自律研究ワークスペース

Dr. Claw:CLIエージェントを束ねて監査可能な研究ループを実現するAI Scientistワークスペース

分断されたターミナルやチャットを統合し、人間が追試・復元可能なAI研究基盤をオープンソースで実現

Dr. Claw: An AI Scientist Workspace for Vibe Research

論文の書誌情報と関連リンク

読み方の2つの軸

現在:しくみ × 全体像

語彙 使うことば・数式・例え方

直感数式なし
しくみ基礎的な数式
原論文原論文の表現

深さ 研究のどこまで読むか

核心肝だけ
全体像背景から評価
読み解く前提から限界

この2本は、本文下のスライダーからいつでも変更できます。

概要

AIに研究やプログラミングを任せるとき、途中で失敗すると最初からやり直しになったり、なぜその変更をしたのか分からなくなる問題がありました。Dr. Clawは、普段使っているコーディングAIを包み込み、実験の履歴や判断の理由をすべてノートのように記録してくれる新しい研究用作業スペースです。

Claude Codeなどの最新AIツールを使えば、パソコン上で自動的にプログラムを書いて実験を進められるようになりました。しかし実際には、チャットツール、コード画面、コマンド画面、論文の執筆画面などを行き来しなければならず、作業がバラバラになってしまいます。また、AIが途中でコードを壊してしまった場合に、元の正しい状態へ戻すのが非常に困難でした。

Dr. Clawは、新しく別のAIを作るのではなく、今ある優秀なコーディングAIをそのまま活かし、研究全体をひとつの机の上で管理するという発想で作られたオープンソースの作業環境です。研究の計画、コードの実行、データの保存、理由のメモをひとまとめに管理します。

言語モデルを備えたコマンドライン型コーディングAIは、数千行のコードを読み書きし、長時間にわたって実験を実行できるようになりました。しかし、実際の学術研究は単にコードを書くだけではありません。先行研究の調査、仮説の設定、実験環境の構築、試行錯誤のデバッグ、グラフ作成、論文執筆といった多様なフェーズが複雑に絡み合っています。現在、研究者はターミナル、VS Codeなどのエディタ、ブラウザ上のチャットツール、LaTeX執筆環境を絶え間なく往復しており、その過程でなぜこのハイパーパラメータを選んだのか、どのスクリプトが結果を生んだのかという意思決定の文脈が散逸してしまいます。

Dr. Clawはこの課題を根本から解決するために設計された、オープンソースのAI Scientistワークスペースです。本システムの最大の特徴は、新しい自律エージェントを一から開発するのではなく、すでに開発者が信頼している既存のCLIエージェント(Claude CodeやGemini CLIなど)をそのままバックエンド実行器として採用し、その外側に強固なオーケストレーション(調停・管理)層を構築した点にあります。研究プロセスを4つの永続的な状態オブジェクトとして管理することで、人間がいつでも介入でき、実験の全容を第三者が追試・監査できる体制を整えました。

CLIコーディングエージェント(Claude Code等)を前提に、研究プロセスの分断と監査証跡の欠落を解決するオープンソースワークスペース『Dr. Claw』を提案。4つの永続状態オブジェクト(Task Graph, Artifact Store, Decision Log, Execution Trace)により、Plan-Execute-Verify-Write-backループを統制します。

大規模言語モデルを用いた自律エージェント研究において、多くのプロジェクトはモデルの単体知能の向上に注力してきました。しかし、実際のエンドツーエンド研究を遂行する上での最大の障壁は、ターミナル、IDE、文献検索、実験管理ツールの間でのコンテキストスイッチと、実験プロセス全体の監査可能性(Auditability)の欠如です。

本論文が提案するDr. Clawは、既存のコーディングエージェント実行器(Claude Code, Gemini CLI, Codex等)をラップし、ControllableかつAuditableなHuman-in-the-loopワークフローを実現する統合ワークスペースです。研究の進捗を単なるファイル群として放置せず、タスク依存グラフや意思決定ログなどの構造化された状態オブジェクトとして永続化します。同一のバックエンド実行器を固定した実験により、Dr. Clawのオーケストレーション層が研究プロセスの網羅性を高め、障害発生時の非破壊リカバリを可能にすることを報告しました。

自律型AIエージェントによる学術研究の自動化(AI Scientist)は大きな注目を集めていますが、既存研究の多くはチャットUIによる単発的なコード生成か、ブラックボックスな自動ループに偏っていました。現実の研究開発では、予期せぬ実行時エラー、ライブラリのバージョン競合、仮説の修正などが発生するため、人間の適切な介入と、過去の試行錯誤を正確に辿れる監査可能性が不可欠です。

EMNLP 2026に採択された『Dr. Claw』は、この課題に対してシステム論的アプローチをとるオープンソースワークスペースです。新しいLLMバックボーンを定義するのではなく、すでに開発現場で定着しつつあるCLIコーディングエージェント(Claude Code, Gemini CLI, Codex等)をExecution Layerとして位置づけ、その上位にOrchestration Layerを配置しました。研究プロセスを状態遷移モデル State_{t+1} = f(State_t, Action_t, Obs_t) として定式化し、4つの永続状態オブジェクト(Task Graph, Artifact Store, Decision Log, Execution Trace)によってに追跡可能とすることで、研究の網羅性と再現性を向上させています。

CLIコーディングエージェントの普及に伴う研究プロセスの分断と監査不可能性に対処するため、既存の実行器をラップして4つの永続状態オブジェクト(Task Graph, Artifact Store, Decision Log, Execution Trace)を管理するワークスペース『Dr. Claw』を提案。EMNLP 2026 System Demonstrations採択。

近年の大規模言語モデル(LLM)に基づくCLIコーディングエージェント(Claude Code, Gemini CLI等)は、自律的なファイル編集や長期セッションの維持を可能にしました。しかし、エンドツーエンドの学術研究プロセスにおいては、チャットツール、エディタ、ターミナル、執筆環境の間で文脈が激しく分断され、研究プロセスの監査証跡(Audit trail)が消失する深刻な問題が存在します。

本論文は、新たな自律エージェントモデルを一から定義するのではなく、既存のコーディングエージェント実行器を上位からラップする統合オープンソースワークスペース『Dr. Claw』を提案します。システムは研究プロセスを有向タスクグラフ、成果物ストア、意思決定ログ、実行トレースという4つの永続状態オブジェクトとしてモデル化し、人間による制御と監査が可能なHuman-in-the-loop環境を提供します。同一のバックエンド実行器を用いた比較実験により、本オーケストレーション層が研究の網羅性向上と非破壊リカバリを両立することを報告しました。

学術研究の全自動化を目指すAI Scientist研究が活発化する中、実用上の最大のボトルネックはツール間のコンテキスト断絶とプロセスの再現不能性にあります。CLIコーディングエージェントはコード実装能力を示しますが、試行錯誤の過程でコードベースが不可逆的に破壊されたり、なぜ特定のパラメータや設計が選ばれたのかというメタ判断が記録されないため、生成物の学術的検証が非常に困難でした。

EMNLP 2026 System Demonstrationsに採択された本論文は、この課題を解決するオープンソースワークスペース『Dr. Claw』を報告しています。本システムは、新たなエージェントアルゴリズムを提案するのではなく、既存の確立されたCLIエージェント実行器をExecution Layerとしてそのまま活用し、その上位にOrchestration Layerを導入することで、人間中心の制御可能性と監査可能性を示しました。研究活動を4つの永続状態オブジェクト(Task Graph, Artifact Store, Decision Log, Execution Trace)として厳密に構造化し、反復的なPlan–Execute–Verify–Write-backループを適用することで、研究の網羅性と耐障害性を高めています。

著者をもっと詳しく知る(全5名)

論文と確認可能な公式情報に基づき、著者の所属と研究背景を掲載しています。

全著者と所属

  1. リーハイ大学 (Lehigh University)
  2. イリノイ大学シカゴ校 (UIC)
  3. ペンシルベニア大学 (UPenn)
  4. イリノイ大学シカゴ校 (UIC)
  5. リーハイ大学 (Lehigh University)

確認できた研究背景

所属
: リーハイ大学 (Lehigh University)
学歴
: リーハイ大学 大学院生
研究の系譜
: Lichao Sun
主な関心
: 自律エージェント、AI Scientist、ソフトウェア工学
代表的な論文
: Agentic Workspaces (2025)
関連情報
: Dr. Claw の設計・実装を主導
所属
: イリノイ大学シカゴ校 (UIC)
学歴
: イリノイ大学シカゴ校 大学院生
研究の系譜
: Philip S. Yu
主な関心
: 機械学習、エージェントシステム
所属
: ペンシルベニア大学 (UPenn)
学歴
: ペンシルベニア大学 研究員
主な関心
: 自然言語処理、システム検証
所属
: イリノイ大学シカゴ校 (UIC)
学歴
: イリノイ大学シカゴ校 殊勲教授、ACM / IEEE フェロー
経歴
: IBM T.J. Watson Research Center
主な関心
: データマイニング、基盤モデル応用、情報検索
代表的な論文
: Mining Data Streams、Graph Neural Networks
関連情報
: データ科学・言語エージェント研究を長年指導
所属
: リーハイ大学 (Lehigh University)
学歴
: リーハイ大学 助教
経歴
: イリノイ大学シカゴ校
研究の系譜
: Philip S. Yu
主な関心
: 信頼性AI、大規模言語モデルの安全性、自律エージェント
代表的な論文
: Trustworthy LLMs (2024)
関連情報
: OpenLAIR リサーチラボを主宰し本プロジェクトを総括

なぜ注目されているか

GitHubで1,000件以上のスターを獲得。AIに研究のコードを書かせるとき、途中で失敗してもやり直せて、どの指示で何が変わったかを全部記録してくれる新しい研究ツールが注目されています。

GitHub Stars 1,000超、EMNLP 2026採択。最新のコーディングAIを使いながら、人間が途中で確認・修正でき、実験の全履歴が残るオープンソースの研究ワークスペース『Dr. Claw』が話題です。

GitHub 1,093 stars、HF 173 upvotes。CLIエージェント時代の課題であるツールの分散と再現性の消失を、4つの永続状態オブジェクト(タスクグラフ、成果物、判断ログ、トレース)で解決する設計がコミュニティで強く支持されています。

EMNLP 2026採択、GitHub 1,093 stars。Claude Code等のCLI実行器をラップし、タスクグラフ・意思決定ログ・再利用可能スキルで研究プロセスを監査可能にするオープンソース基盤です。

取得時点でGitHub 1,093 starsを記録。自律研究エージェントの分断を解決するため、タスク依存グラフ・成果物ストア・判断ログ・実行トレースの4層管理を導入。同一バックエンド比較で研究網羅性の向上を実証しています。

EMNLP 2026採択の注目作。単独エージェントではなくオーケストレーション層としてのDr. Clawを提案。状態遷移モデルと非破壊的リカバリ機構により、CLIエージェント単体と比べて監査証跡を維持しつつ研究網羅性を高めています。

EMNLP 2026 System Demonstrations採択論文。既存CLIコーディングエージェントをラップし、4つの永続状態オブジェクトで研究の監査性と非破壊復旧を担保するDr. Clawの提案です。

EMNLP 2026採択、GitHub 1,093 stars。既存エージェントを固定した同一バックエンド評価において、タスクグラフやスキルライブラリによるオーケストレーション層が研究プロセスの網羅性と監査性を向上させることを報告しています。

EMNLP 2026採択の実証報告。相互運用性に欠けるCLIエージェント群に対し、4つの永続状態オブジェクトとPlan-Execute-Verify-Write-backループを定義。3条件の人間評価実験でコンテキストスイッチ削減と研究完全性の両立を立証しています。

コミュニティで話されている点(2件)
  • ブラックボックスな完全自動化ではなく、人間の介入と監査性を保ちながら失敗から非破壊で復旧できるワークスペース構造が高く評価された。

    原文を見る ↗
  • Claude CodeやGemini CLIなどの強力なCLIツールをそのまま流用し、タスクグラフと意思決定ログで統制する現実的なアプローチが共感を呼んだ。

    原文を見る ↗
議論全体へのリンク
この読み方に出てくる言葉(3語)
ワークスペース

調査、実験、記録をひと続きに扱う作業場所。

再現性

同じ手順をたどったとき、結果を確かめ直せる性質。

監査

何をしたかという記録を後から確認する概念。

どんな問いに向き合ったか

Claude Codeなどの最新CLIコーディングエージェントは長時間のファイル読み書きが可能になったが、実際のエンドツーエンド研究はチャット、IDE、ターミナル、論文執筆環境に分断され、なぜその変更を行ったのかという意思決定の監査証跡が失われ、失敗時に安全に過去の状態へ復帰できない。

従来の方法と課題

多くの先行研究はに自律した新しいAI Scientistエージェントを一から構築しようとしたが、これらはブラックボックス化しやすく、人間が途中介入したり、既存のCLIエージェントエコシステムを活用することが困難だった。

肝のアイデア

新たな自律エージェントをゼロから作らず、既存のCLIエージェント実行器をタスクグラフ、成果物ストア、意思決定ログ、実行トレースという4つの永続状態オブジェクトで包み込み、人間とAIが協調する監査可能・復元可能な統合ワークスペース(Dr. Claw)を提供する。

どういうしくみか

Dr. Clawのコアメカニズムは以下の設計に基づきます:

  • Task Graph: 依存関係を持つ研究タスクの有向非巡回グラフ(DAG)。
  • Artifact Store: コード、中間データ、図表、レポートなどの成果物のバージョン管理ストア。
  • Decision Log: 人間の意図、制約、設計判断をタイムスタンプ付きで記録する追跡ログ。
  • Execution Trace: シェルコマンドやスクリプト実行の詳細なログストリーム。

Plan(目標からサブタスク展開)→ Execute(CLIエージェントによるコード生成・実行)→ Verify(期待される出力やテストの検証)→ Write-back(状態の確定とログ記録)を反復します。

AIがコード破壊や無限ループに陥った際、過去のチェックポイントからTask GraphとArtifact Storeを復元し、人間のフィードバックを注入して再実行できます。

どう確かめたか

著者らは、同一のバックエンド実行器(Codex gpt-5.4)を固定したオープンエンド研究評価において、素のCLIエージェント単体よりも高い研究網羅性スコアを達成した。実験中のエラーや想定外の挙動に対し、過去のタスクグラフと成果物ストアから非破壊的に実行状態を復元できることを実証した。人間参加のレトロスペクティブ実験(3条件比較)において、ツール間の行き来に伴うコンテキストスイッチの削減と作業継続性の改善を確認した

何が分かったか

その評価で著者らは、同一のバックエンド実行器(Codex gpt-5.4)を固定したオープンエンド研究評価において、素のCLIエージェント単体よりも高い研究網羅性スコアを達成した。実験中のエラーや想定外の挙動に対し、過去のタスクグラフと成果物ストアから非破壊的に実行状態を復元できることを実証した。人間参加のレトロスペクティブ実験(3条件比較)において、ツール間の行き来に伴うコンテキストスイッチの削減と作業継続性の改善を確認した

どこまで使えるか

対象は、CLIエージェントの実行過程を永続状態として追跡し、人間が途中介入する研究ワークフローです。評価は事例中心であり、領域を越えた生産性や科学的妥当性の改善は結論の範囲外です。

限界と未解決の問い

状態オブジェクトの管理、ディスクへのシリアライズ、検証ゲートの実行により、素のCLI実行に対して時間的オーバーヘッドが生じます。研究網羅性(Research Completeness)の評価は必要な実験項目や報告要素が網羅されているかの計測であり、科学的仮説や実験結果の学術的正しさを保証するものではありません。バックエンドのLLMエージェントが持つ推論能力やコーディングのバグ発生率に性能が制約されます。状態オブジェクトの永続化と依存解決を行うオーケストレーション層の介在により、素のCLI直接実行に比べてわずかな実行時間オーバーヘッドが存在する。本評価で測定している研究網羅性はコンポーネントの充足度を測るものであり、得られた科学的結論の学術的妥当性や新規性そのものを自動保証するものではない。バックエンドとして呼び出す外部LLMエージェント自体のコーディング能力や推論限界、APIレート制限に依存する

この研究から考える

ここからは、論文の結果を踏まえた編集上の考察です。

報告されたワークフローが異なる研究課題でも機能するなら、研究エージェントの評価軸は最終結果だけでなく、途中状態の追跡可能性や人間が介入できる境界も含むべきです。ただし、事例中心の評価から一般的な生産性や正確性までは導けず、比較実験が必要です。