状態を理解する
チケット、Agentの実行履歴、商品レコード、ゲーム状態など、自然言語や構造化テキストを解釈します。
System Oneは、非構造化なアプリケーション状態を型付きの回答と確率に変換する、TypeSafeのAIモデルクラスです。Jevはその最初の実装であり、アプリケーションコード内で使う限定的な判断コンポーネントです。
本ページは独立した開発者向けガイドです。製品仕様と性能に関する記述はTypeSafeの資料に基づきます。本番導入前に、ご自身のデータでJevを検証してください。
state → decisions「二重請求されました。今日中に解決してほしいです。」
if (confidence < threshold) → reviewSystem Oneモデルは入力の意味を読み取りますが、会話を続けたり文章を作ったりはしません。質問と許可する回答形式を先に宣言すると、プログラムが検査して扱える範囲内の判断を返します。
チケット、Agentの実行履歴、商品レコード、ゲーム状態など、自然言語や構造化テキストを解釈します。
呼び出し前に回答空間を定義します。モデルは選択肢を選ぶ、尺度上で評価する、または真偽命題を判定します。
各回答には確率が付きます。ChoiceとScoreは分布を要約したconfidenceも返し、明確な結果と曖昧な結果を区別できます。
しきい値、ポリシーチェック、副作用、再試行、フォールバック、人による確認は通常のコードが担います。
Jevは1回のモデル呼び出しを複数の判断シグナルに変えます。開発者にとって有用な単位は会話ターンではなく、モデルとアプリケーションの間の小さな型付き契約です。
判断に必要な情報を送ります。Jevは現在、文字列、JSONオブジェクト、テキスト配列など、テキスト形式の入力を受け付けます。
顧客メッセージ + アカウント情報質問に名前を付け、primitiveを選び、許可する選択肢や尺度を記述します。複数の独立した質問を1回のリクエストに含められます。
担当部署 · 緊急度 · 不満度各質問に型付き回答と確率を返します。ChoiceとScoreには別途confidenceも含まれます。
請求担当 · 0.93 · 高confidenceモデル出力を決定的な検査と組み合わせます。低リスクで明確なら実行し、曖昧または高影響なら人や推論モデルへ渡します。
振り分け · 再質問 · 確認 · 停止billing定義済みの選択肢から1つを選び、各選択肢の確率を返します。
1.43 / 2説明付きの順序尺度上に入力を配置します。結果は2段階の間になることもあります。
0.95真偽命題を評価し、「はい」である確率を返します。
生成モデルは人向けの柔軟な文字列生成に優れます。TypeSafeは、ソフトウェアにはコードに組み込め、繰り返し実行でき、不確実性を示し、制御フローを可視化できる、より限定的な知能が必要だと考えています。
生成結果は文章、コード、JSON、拒否、または不正な形式になり得ます。実行前に解析、検証、復旧が必要です。
バックグラウンドで使う場合、プログラムは結果候補と、それぞれが許可する操作を事前に把握する必要があります。
確率分布があれば、明確なケースを自動処理し、曖昧なケースを安全な経路に回せます。
複雑な処理を焦点の定まった意味判断に分け、1つの巨大なプロンプトに隠さず決定的なロジックで組み合わせます。
頻繁に発生し、乱雑な入力の理解が必要で、アプリケーションが既に実行方法を知る少数のアクションにつながるタスクが有力です。
チケットを分類し、意図・緊急度・顧客感情を判定し、不確実なケースを確認へ回します。
請求、技術、アカウント、それとも別件か?
モデルやツールの選択、検索の要否、結果の完全性、実行予定のツール呼び出しを判断します。
Agentは続行、再試行、エスカレーションのどれを選ぶか?
候補と検索、プロフィール、ポリシー、文脈との一致度を評価し、ビジネスルールと組み合わせます。
この候補は依頼にどれほど関連するか?
明示的な基準でメッセージ、生成結果、履歴、コード変更を評価し、高リスクの結果は決定的なゲートで止めます。
定めたルールに違反しているか?
ゲーム、シミュレーション、UI、デバイス自動化で許可された行動を選び、長い文章生成を避けます。
現在の状態で最適な許可済み行動は?
大量のレコードをカテゴリ、スコア、フラグ、特徴量に変換し、後段の集計や確認に使います。
このレコードのカテゴリとリスク水準は?
選択肢が既知で、入力の意味が複雑、判断が反復され、遅延が重要で、各結果に明確な処理やフォールバックを用意できる場合。
独創的な文章やコード、深い多段推論、広い調査、説明、多モーダル入力、または結果候補を事前定義できないタスク。
どちらも言語を理解でき、LLMも構造化出力で形式を制約できます。根本的な違いはモデルが何を生成するよう設計され、周囲のソフトウェアがどう使うかです。
| 比較項目 | Jev / System One | 一般的な生成LLM |
|---|---|---|
| 主な仕事 | 定義済みの結果を評価 | 続きを生成、または回答 |
| ネイティブ出力 | 型付きの選択、スコア、「はい」の確率 | 文章、コード、JSONなどのtoken列 |
| 回答空間 | 呼び出し前に宣言 | schemaで最終形式を制約しても本質的に開放 |
| 不確実性 | 各回答に確率、ChoiceとScoreにはconfidence | token確率や自己申告confidenceはあり得るが、通常はタスク較正済みの判断シグナルではない |
| サンプリング | TypeSafeによれば質問と出力を並列評価 | 通常はtokenごとに順次生成 |
| 得意分野 | 高頻度の意味分岐、採点、ルーティング、検査 | 文章、対話、コーディング、統合、開放的推論 |
| 主な失敗 | 型は正しいが意味判断が誤る | 誤り、形式不正、根拠不足、タスク逸脱 |
| システム内の役割 | 可視なコード内の限定判断コンポーネント | 柔軟な生成・推論器。より大きなオーケストレーションを伴うことが多い |
Jev以外のSystem Oneを検討する開発者向けに、Projectsページと同じコミュニティモジュールを掲載します。独自学習モデルと既存の重みを使うJev風インターフェースを分けています。
Jevに着想を得た、または同様の構造化された判断手法を探るコミュニティ製のモデルとインターフェース実験です。TypeSafeによるJevの公式版ではなく、上のGitHubプロジェクトランキングには含めていません。
Qwen3.5-9BJevに着想を得たLoRAアダプターと学習レシピ。選択式と真偽判定に対応し、テキストをローカルで処理します。
GitHubQwen3-0.6B判断用ヘッドを備えた小型モデル。学習コードと、行動選択を試せるゲームのデモを公開しています。
GitHubQwen3.5-2B定型質問ごとの確率分布を一度の処理で返すファインチューニングモデル。現行版は英語のみ対応です。
GitHubModernBERT 151M小型エンコーダーを使う判断モデル。重みとブラウザで動くWebGPUデモを公開しています。
GitHubQwen3.5-0.8B重み・学習コード・評価結果を公開する0.8Bのマルチモーダル判断モデル。テキストと画像を1回の順伝播で扱えます。重みは非商用研究向けです。
GitHubDiffusionGemma 26B-A4B既存のDiffusionGemmaモデルを使い、Jevに似たAPIで構造化された質問に回答します。新しいモデルの重みは公開していません。
GitHubOpen-model logits既存のオープンモデルで候補を採点し、Jevに似たインターフェースを提供します。新しいモデルの重みは公開していません。
GitHubSpark-X2.5-4BSpark-X2.5の回答ロジットを使う、ローカル動作のJev互換サーバー。複数の質問で状態のプリフィルを共有し、プレイグラウンドとベンチマークも備えます。
GitHubAny causal LLM因果言語モデルを学習なしで定型判断モデルに変換するツールキット。選択肢順序の偏り補正、任意のキャリブレーション、再現可能な評価に対応します。
GitHubQwen3.5 / DeBERTaQwenまたはDeBERTaを使うオフラインのJev互換サーバー。公式SDKとの互換性を確認し、JevBenchの結果も公開しています。
GitHubいずれもコミュニティによる独立した取り組みで、Jevの公式版ではありません。
このJev AI DevガイドはTypeSafeの枠組みを独自に整理したものです。API仕様、製品主張、評価方法、更新は公式資料で確認してください。
候補回答を定義し、代表例を集め、不確実な結果の扱いを決め、Jevを既存ルールやモデルと比較してください。影響の大きい判断を直接自動化しないでください。