独立プロジェクトガイド · 2026年9月25日確認

AnyJev オープンLLMを型付き意思決定モデルに変えます。

AnyJevはNokia Applied Researchが公開したPythonツールキットです。因果言語モデルからChoice、Score、Noul形式の判断を読み出し、選択肢順の偏り補正と確率校正を加えます。

重要: AnyJevは新しい基盤モデルでも、TypeSafe Jevの重みを公開したものでも、Jevの公式製品でもありません。すでに運用しているモデルにJev型の判断インターフェースを加えるための独立した手法です。

メンテナー
Nokia Applied Research
ライセンス
Apache-2.0
パッケージ
anyjev(PyPI)
成熟度
プレアルファ
AnyJev · L0state → typed decisions
状態

二重請求されています。今日中に対応してください。

choice · 振り分けどのチームが担当すべきですか?
請求0.81
技術0.09
営業0.04
その他0.06
result.level = "L0"出力例
押さえるべき違い

AnyJevはツールキットであり、別のモデル重みではありません。

選んだ因果言語モデルはそのまま使い、範囲を限定した判断の読み出し方だけを変えます。単体の微調整済み分類器というより、意思決定レイヤーに近い位置づけです。

できること

オープンモデルの型付き読み出し

状態と、答えの範囲を決めた質問を定義します。AnyJevはカテゴリ選択の分布、Yes/Noの確率、順序付きスコアの期待値を返します。

加わる機能

偏り補正と校正レベル

回答tokenの生のlogitsは、ラベルや位置を好むことがあります。AnyJevは判断ごとに補正レベルを示すため、アプリ側で必要な水準を指定できます。

違うもの

TypeSafe Jevのオープン版ではない

TypeSafeの非公開重み、学習データ、RLCD手法を公開・再現するプロジェクトではありません。リクエスト形式が似ていても、同じ挙動を意味しません。

Raw → L0 → L1 → L2

4つのレベルで、各判断に適用した補正方法を明確にします。

L0は学習用ラベルを必要としません。上位レベルではラベル付き例を追加し、L2は基盤モデルを更新せず、質問専用の小さな出力ヘッドを学習します。

Rawラベル不要

回答tokenのlogitsに限定softmaxを適用します。

選択肢の位置やラベル嗜好は補正しません。

L0ラベル不要

選択肢を巡回させ、推定したラベル事前分布を補正します。

順序には強くなりますが、タスクに合わせた確率校正は未実施です。

L1100~500件

特定のモデルと質問に温度校正を加えます。

確信度の推定は改善しますが、誤った順位は直しません。

L2100~300件

中間隠れ状態に閉形式の小さな出力ヘッドを当てはめます。

モデルと質問ごとに専用で、ローカルの隠れ状態へアクセスする必要があります。

ローカル運用の例

サポートチケットを振り分け、実行予定の操作を確認します。

公開APIに沿った小さな例です。Qwenはローカルで動かし、AnyJevが選択肢を限定した2つの判断を読み出し、その後の処理は通常のコードが決めます。

Transformersバックエンドをインストール
pip install "anyjev[hf]"

Python 3.10以降が必要です。初回実行時には、選択したオープンモデルもダウンロードされます。

PythonChoice + Noul
from anyjev import Decider, Question
from anyjev.backends.hf import HFBackend

decider = Decider(HFBackend("Qwen/Qwen3-8B"))

route = Question.choice(
    "Which team should handle this?",
    ["billing", "technical", "sales", "other"],
    name="route",
)
risky = Question.noul(
    "Is this tool call destructive or irreversible?",
    name="risky",
)

result = decider.decide(
    {"message": "I was charged twice.", "tool_call": "refund"},
    [route, risky],
)

result["route"].distribution
result["risky"].p_true
result.level  # "L0"
01

答えの範囲を決める

担当可能なチームを列挙し、予定しているツール呼び出しが破壊的かを質問します。

02

限定された分布を読む

自由文は生成しません。結果には分布または確率と、使用したレベルが含まれます。

03

ポリシーはコードに置く

しきい値、要確認ケース、危険な副作用の停止はアプリケーションコードが担当します。

プロジェクト公式ベンチマーク

注目点は精度だけでなく、安全に自動化できる範囲です。

AnyJevはQwen3-8Bを300件のBANKING77テスト項目で評価した結果を公開しています。数値は開発者がリポジトリに公開したベンチマーク成果物に基づき、Jev AI Devでは独立再現していません。

指標生のlogitsAnyJev L0AnyJev L1
選択肢を逆順にした際の回答変化率0.2300.0730.077
精度0.7470.8030.807
期待校正誤差0.2400.1840.095
誤り率5%以下でのカバレッジ7.7%46.3%52.0%

この評価では精度が0.747から0.807へ上昇しました。運用上より大きい変化は、誤り率5%以下でのカバレッジが生のlogitsの7.7%からL1校正後の52.0%へ増えた点です。小規模な評価のため、別の業務へそのまま当てはめることはできません。

ベンチマークとアブレーションを見る
コミュニティ動画 · 29秒

LLMをJev型の判断器にする仕組みを短時間で確認できます。

Data Science in your pocketがAnyJev公開後に制作した短い紹介です。Nokia Applied Researchの公式デモでも、独立ベンチマークでもありません。

YouTubeで「How to convert any LLM into Jev AI?」を見る
コミュニティ検証 · 2026年9月

20件のチケットで、精度と遅延のトレードオフが見えました。

WquGuruは1台のMacBookと中国語のサポートチケット20件を使い、公式Jevと3つのオープンプロジェクトを比較しました。スレッドには動画、処理時間、各プロジェクトの精度が含まれます。

@wquguru · 実機比較

Qwen3-4B版AnyJevは20件中19件に正解したと報告されています。

精度95%19 / 20件
遅延~4s1テストの報告値
件数20中国語サポートチケット

同じスレッドでは公式Jevが20/20、Layaが65%、djevが35%と報告されています。問題数が少なく、1台の端末で、構成も異なるため、統制されたベンチマークではなく初期のコミュニティ観測として扱う必要があります。

Xで比較と動画を見る
@MorrisMz81 · AnyJev開発者
“The latency is real. We went correctness first.”

Jiamu “Morris” Zhangは、初版では推論サービング経路をまだ最適化していないと説明しました。AnyJevは別のJevモデルではなく、チームがすでに運用しているモデルを判断レイヤーにする手法で、vLLM/SGLang対応の最適化が始まった段階だとしています。

開発者の返信を全文で読む
@Marktechpost · メディア解説

設計とコミット済みベンチマークの簡潔な紹介。

MarkTechPostは型付き読み出し、L0/L1の違い、BANKING77の結果を要約しています。数値はプロジェクト自身の評価で、別個の再現実験ではありません。

証拠の範囲: Jev AI Devは投稿にこれらの記述があることを確認しましたが、コミュニティテストは再現していません。閲覧数や反応数は変動するため掲載していません。

本番導入の前に

現行リリースで解決しないことも確認してください。

型付き出力はインターフェース上の問題を減らしますが、判断の正しさ、安全性、別分布への移植性までは保証しません。

01

選択肢が多いほどL0の計算量が増える

K個の選択肢を巡回するため、ラベルなし補正にはK回のprefillが必要です。推論コストと引き換えに順序安定性を得ます。

02

L1とL2には業務ラベルが必要

校正器とヘッドは特定のモデルと質問に属します。どちらかを変えたら、再構築または再検証が必要です。

03

L2には隠れ状態へのアクセスが必要

現在のL2はローカルTransformersバックエンドを使います。vLLMやSGLangなどの配信エンジンはロードマップ段階です。

04

公開値は受け入れ試験の代わりにならない

確率で重要な操作を制御する前に、代表データで精度、校正、順序感度、棄却方針を測定してください。

一次資料

プロジェクトの原典を確認してください。

AnyJevは更新が速いプロジェクトです。導入前に最新リリース、対応バックエンド、制約を確認してください。

エコシステムを見る

AnyJevをコミュニティの他のSystem Oneプロジェクトと比較できます。

AnyJevは既存のオープン因果言語モデルを判断時に適応させる方法です。ほかにも専用学習モデル、ローカルランタイム、API互換実験があります。

System Oneガイドを読む コミュニティプロジェクトを見る