意思決定モデル構造化出力確率校正

Jevとは何か:話すAIではなく、ソフトウェアの中で決めるAI

型付きの選択肢と確率を並列に返すJevは、言語モデルとは異なる自動化の入口になりうるか

Introducing System One Models & Jev

技術発表の出典と確認状況

発表者
TypeSafe AI
発表日
確認状況
発表者による報告

論文・モデル重み・学習データ・詳細な学習条件は未公開です。性能値は発表者による報告で、独立検証済みではありません。(2026年9月17日時点)

読み方の2つの軸

現在:しくみ × 全体像

語彙 使うことば・数式・例え方

直感数式なし
しくみ基礎的な数式
発表資料公開資料の表現

深さ 研究のどこまで読むか

核心肝だけ
全体像背景から評価
読み解く前提から限界

この2本は、本文下のスライダーからいつでも変更できます。

概要

Jevは、文章を書く代わりに、用意された候補から答えを選び、その確からしさを返すAIです。プログラムの中で素早く何度も判断する用途を狙いますが、速さや正確さの評価はまだ主に開発元の報告です。

Jevは、自由な文章を一語ずつ作るのではなく、先に決めた選択肢と確率をまとめて返すAIです。分類や確認を大量に行うソフトウェアを狙い、TypeSafe AIは大幅な高速化と低価格を報告しています。ただし比較は自社設計で、仕組みや学習内容の多くは未公開です。

Jevは、ソフトウェア内の判断を自由文生成から切り離し、決められた選択肢と確率だけを返すモデルです。狭い役割によって高速化と扱いやすさを狙いますが、公開資料は製品発表の段階であり、学習方法や第三者評価は不足しています。重要なのは、型の保証と判断の正しさを混同しないことです。

Jevは、autoregressiveな文字列生成を行わず、事前定義したChoice・Score・Booleanと確率を並列に返す意思決定モデルです。TypeSafe AIは大きな速度・費用差を報告しますが、評価と学習詳細は未公開で独立検証されていません。

Jevは、共有状態に対する複数のtyped questionを一度に評価し、Choice・Score・Booleanと確率を返すSystem One Modelです。文字列生成と出力検証を省く設計は分類・ルーティングに適します。TypeSafe AIのworkflow evalは大きな速度・費用差を示しますが、参照回答や課題作成に偏りがあり、モデル詳細も非公開です。

Jevは、unstructured stateを受け取り、事前定義された複数のtyped questionsに対する確率をparallel samplingする意思決定モデルとして発表されました。RLCDによるcalibrationと文字列非生成が差別化点です。公開workflow evalでは速度・費用のPareto優位を主張しますが、reference distribution、task construction、非公開のtraining detailsが結論を制限します。

Jevは、autoregressive string generationを放棄し、typed probabilistic decisionsをparallelに返すSystem One Modelとして発表されました。workflow evalのspeed/cost優位はTypeSafe AIによる報告であり、architectureとtraining protocolは未公開です。

TypeSafe AIはJevを、state-conditioned typed questionsに対するprobabilityをparallel samplingするSystem One Modelと位置づけます。RLCDはepistemically honest calibrationを目的とするとされます。workflow evalはPareto優位を示す一方、reference answerがfrontier model ensembleで、task authorshipとmodel authorshipが分離されていません。

Jevはmachine-native intelligenceを、unstructured stateから有限または順序付きtyped outputへのconditional distributionとして再定義するClosed Researchです。発表者はRLCDとparallel samplerによるcalibration・efficiencyを主張しますが、公開情報はAPI semanticsとissuer-run workflow evalに限られます。model internals、training distribution、objective、standard calibration metricsがないため、現段階で検証できるのはinterfaceとservice availabilityが中心です。

Diogo AlmeidaTypeSafe AI(創業者)
発表者をもっと詳しく知る

公式発表と確認可能な公式情報に基づき、発表者の所属と研究背景を掲載しています。

所属
: TypeSafe AI(創業者)
経歴
: OpenAIで指示追従と言語モデルの対話能力に関する研究開発に参加したと本人が説明
主な関心
: ソフトウェア向け意思決定モデル、確率校正、AI自動化

なぜ注目されているか

文章を書くAIではなく、決められた候補から素早く選ぶAIとして発表され、すぐにVercel経由でも試せるようになったため注目されています。性能比較はまだ発表者によるものです。

Jevは、チャットのように文章を作る代わりに、ソフトウェアがそのまま使える選択肢と確率を返します。発表直後にVercel AI Gatewayへ追加された一方、速さや安さの大きな数字は第三者が再現した結果ではありません。

『会話が得意なAI』とは別に、『プログラムの中で小さな判断を大量に行うAI』を作る提案として話題です。利用経路は公開されましたが、学習方法や公平な比較に必要な情報はまだ十分ではありません。

型付きChoice・Score・Booleanと確率を並列に返す評価モデルとして発表され、Vercel AI Gatewayにも追加されました。速度と費用の優位はTypeSafe AIによる報告です。

Jevは、共有状態に対する複数の型付き質問を一度に評価するソフトウェア向けモデルとして注目されています。提供は確認できますが、193.6倍高速・444.6倍安価という最大値は発表者設計のworkflow evalに基づきます。

自由生成を避けて型付き確率判断に特化する設計、RLCD、並列サンプリングが技術的な焦点です。一方、モデル構造・学習データ・公開ベンチマークは未開示で、現状のPareto比較は独立検証されていません。

Jevはtyped probabilistic decisionsをparallel samplingで返すSystem One Modelとして公開されました。報告値はissuer-reportedで、再現可能な技術報告は未公開です。

System One tasks向けのRLCD、typed output、parallel samplerという設計主張が注目点です。workflow evalでは外部モデルの平均予測を参照分布としますが、評価作成者と発表者が同一組織である点が残ります。

Jevは文字列生成を捨て、事前定義したChoice・Score・Booleanの同時確率評価へ問題を制限します。速度・費用のfrontierは興味深いものの、architecture、training corpus、calibration指標、public benchmarkが未開示で、第三者評価が必要です。

この読み方に出てくる言葉(5語)
System One task

発表者が、速く反復できる構造化判断を指すために使う呼称。

公開資料では

分類、採点、真偽判断などを含みます。

RLCD

Reinforcement Learning for Calibrated Decisionsの略。

公開資料では

確率が正解頻度に対応する判断を学ぶ方法として紹介されますが詳細は非公開です。

workflow eval

複数の判断を含む同じ処理グラフをモデル間で比較する評価。

公開資料では

外部モデルの平均予測を参照にします。

Pareto frontier

品質を上げると費用が増える関係で、他に一方的に劣らない点の集合。

公開資料では

知能指標と速度・費用の比較に使われます。

cardinality

選択肢の個数。

公開資料では

JevのChoiceは最大255候補と説明されています。

どんな問いに向き合ったか

一般LLMの柔軟なstring outputは、人との対話には有用でも、機械による反復判断ではparse、validation、retry、出力課金を生みます。用途を構造化判断へ限定すれば、より効率的なモデルを作れるかが中心です。

従来の方法と課題

JSON modeやfunction callingはLLMの生成過程を残したまま形式を制約します。Jevは文字列生成器ではなく、質問ごとの確率評価器として設計した点を差分とします。

肝のアイデア

入力はstateとquestionsです。質問はChoice、順序付きScore、Booleanとして宣言され、Jevは型付き回答と確率を返します。複数質問を一回の要求で扱います。

どういうしくみか

発表資料はnew architecture、parallel sampler、RLCDを挙げます。アプリケーションは確率閾値で自動処理とレビューを分岐できます。ただしネットワーク構造や学習目的の形式は確認できません。

どう確かめたか

四つのworkflowで全モデルに同じ処理を与え、GPT-6 AstraとFable 5.1の平均予測を参照にします。LLM側にはTypeSafe互換のstructured decision wrapperを使います。

何が分かったか

TypeSafe AIは最大193.6倍の速度差と444.6倍の費用差、70〜500msの応答時間を報告します。同社は最大値が実運用利得の高い側であることも明記しています。

どこまで使えるか

agent routing、継続・停止、priority scoring、guardrail、データ抽出のように候補が定義できる処理に適します。自由文や未知の候補を発見する課題は対象外です。

限界と未解決の問い

課題作成者がモデル提供者と同じで、参照分布も外部モデル依存です。型エラー0%は構造上の値で経験的正確さではありません。公開重み、学習データ、標準benchmark、独立calibration測定が不足します。

この研究から考える

ここからは、公開された情報を踏まえた編集上の考察です。

Jevの仮説は、モデル性能だけでなく問題のAPI化によって検証すべきです。同じ業務ログでLLM structured output、専用分類器、Jevを比較し、誤判定・棄却・人手確認を含む総費用を見る必要があります。