オープンモデルの型付き読み出し
状態と、答えの範囲を決めた質問を定義します。AnyJevはカテゴリ選択の分布、Yes/Noの確率、順序付きスコアの期待値を返します。
AnyJevはNokia Applied Researchが公開したPythonツールキットです。因果言語モデルからChoice、Score、Noul形式の判断を読み出し、選択肢順の偏り補正と確率校正を加えます。
重要: AnyJevは新しい基盤モデルでも、TypeSafe Jevの重みを公開したものでも、Jevの公式製品でもありません。すでに運用しているモデルにJev型の判断インターフェースを加えるための独立した手法です。
anyjev(PyPI)state → typed decisions二重請求されています。今日中に対応してください。
result.level = "L0"出力例選んだ因果言語モデルはそのまま使い、範囲を限定した判断の読み出し方だけを変えます。単体の微調整済み分類器というより、意思決定レイヤーに近い位置づけです。
状態と、答えの範囲を決めた質問を定義します。AnyJevはカテゴリ選択の分布、Yes/Noの確率、順序付きスコアの期待値を返します。
回答tokenの生のlogitsは、ラベルや位置を好むことがあります。AnyJevは判断ごとに補正レベルを示すため、アプリ側で必要な水準を指定できます。
TypeSafeの非公開重み、学習データ、RLCD手法を公開・再現するプロジェクトではありません。リクエスト形式が似ていても、同じ挙動を意味しません。
L0は学習用ラベルを必要としません。上位レベルではラベル付き例を追加し、L2は基盤モデルを更新せず、質問専用の小さな出力ヘッドを学習します。
選択肢の位置やラベル嗜好は補正しません。
順序には強くなりますが、タスクに合わせた確率校正は未実施です。
確信度の推定は改善しますが、誤った順位は直しません。
モデルと質問ごとに専用で、ローカルの隠れ状態へアクセスする必要があります。
公開APIに沿った小さな例です。Qwenはローカルで動かし、AnyJevが選択肢を限定した2つの判断を読み出し、その後の処理は通常のコードが決めます。
pip install "anyjev[hf]"Python 3.10以降が必要です。初回実行時には、選択したオープンモデルもダウンロードされます。
Choice + Noulfrom anyjev import Decider, Question
from anyjev.backends.hf import HFBackend
decider = Decider(HFBackend("Qwen/Qwen3-8B"))
route = Question.choice(
"Which team should handle this?",
["billing", "technical", "sales", "other"],
name="route",
)
risky = Question.noul(
"Is this tool call destructive or irreversible?",
name="risky",
)
result = decider.decide(
{"message": "I was charged twice.", "tool_call": "refund"},
[route, risky],
)
result["route"].distribution
result["risky"].p_true
result.level # "L0"担当可能なチームを列挙し、予定しているツール呼び出しが破壊的かを質問します。
自由文は生成しません。結果には分布または確率と、使用したレベルが含まれます。
しきい値、要確認ケース、危険な副作用の停止はアプリケーションコードが担当します。
AnyJevはQwen3-8Bを300件のBANKING77テスト項目で評価した結果を公開しています。数値は開発者がリポジトリに公開したベンチマーク成果物に基づき、Jev AI Devでは独立再現していません。
| 指標 | 生のlogits | AnyJev L0 | AnyJev L1 |
|---|---|---|---|
| 選択肢を逆順にした際の回答変化率 | 0.230 | 0.073 | 0.077 |
| 精度 | 0.747 | 0.803 | 0.807 |
| 期待校正誤差 | 0.240 | 0.184 | 0.095 |
| 誤り率5%以下でのカバレッジ | 7.7% | 46.3% | 52.0% |
この評価では精度が0.747から0.807へ上昇しました。運用上より大きい変化は、誤り率5%以下でのカバレッジが生のlogitsの7.7%からL1校正後の52.0%へ増えた点です。小規模な評価のため、別の業務へそのまま当てはめることはできません。
ベンチマークとアブレーションを見るData Science in your pocketがAnyJev公開後に制作した短い紹介です。Nokia Applied Researchの公式デモでも、独立ベンチマークでもありません。
YouTubeで「How to convert any LLM into Jev AI?」を見るWquGuruは1台のMacBookと中国語のサポートチケット20件を使い、公式Jevと3つのオープンプロジェクトを比較しました。スレッドには動画、処理時間、各プロジェクトの精度が含まれます。
同じスレッドでは公式Jevが20/20、Layaが65%、djevが35%と報告されています。問題数が少なく、1台の端末で、構成も異なるため、統制されたベンチマークではなく初期のコミュニティ観測として扱う必要があります。
Xで比較と動画を見る“The latency is real. We went correctness first.”
Jiamu “Morris” Zhangは、初版では推論サービング経路をまだ最適化していないと説明しました。AnyJevは別のJevモデルではなく、チームがすでに運用しているモデルを判断レイヤーにする手法で、vLLM/SGLang対応の最適化が始まった段階だとしています。
開発者の返信を全文で読むMarkTechPostは型付き読み出し、L0/L1の違い、BANKING77の結果を要約しています。数値はプロジェクト自身の評価で、別個の再現実験ではありません。
証拠の範囲: Jev AI Devは投稿にこれらの記述があることを確認しましたが、コミュニティテストは再現していません。閲覧数や反応数は変動するため掲載していません。
型付き出力はインターフェース上の問題を減らしますが、判断の正しさ、安全性、別分布への移植性までは保証しません。
K個の選択肢を巡回するため、ラベルなし補正にはK回のprefillが必要です。推論コストと引き換えに順序安定性を得ます。
校正器とヘッドは特定のモデルと質問に属します。どちらかを変えたら、再構築または再検証が必要です。
現在のL2はローカルTransformersバックエンドを使います。vLLMやSGLangなどの配信エンジンはロードマップ段階です。
確率で重要な操作を制御する前に、代表データで精度、校正、順序感度、棄却方針を測定してください。
AnyJevは更新が速いプロジェクトです。導入前に最新リリース、対応バックエンド、制約を確認してください。
AnyJevは既存のオープン因果言語モデルを判断時に適応させる方法です。ほかにも専用学習モデル、ローカルランタイム、API互換実験があります。