獨立專案指南 · 2026 年 9 月 25 日檢視

AnyJev 讓開源 LLM 輸出型別化決策。

AnyJev 是 Nokia Applied Research 開源的 Python 工具包。它直接從因果語言模型讀取 Choice、Score 與 Noul 形式的決策,並提供選項順序去偏與機率校準。

請注意: AnyJev 不是新的基礎模型,也不是 TypeSafe Jev 權重的開源版本,更不是 Jev 官方產品。它提供一套方法,讓你正在執行的模型具備 Jev 風格的決策介面。

維護團隊
Nokia Applied Research
授權條款
Apache-2.0
安裝套件
anyjev(PyPI)
成熟度
早期預覽版
AnyJev · L0state → typed decisions
輸入狀態

我的帳戶被重複扣款,請今天協助處理。

choice · 分流應由哪個團隊處理?
帳務0.81
技術0.09
業務0.04
其他0.06
result.level = "L0"示意結果
關鍵差異

AnyJev 是工具包,不是另一套模型權重。

它保留你選擇的因果語言模型,只改變如何從模型讀取範圍明確的判斷。因此,它更像一層決策介面,而不是經過微調的獨立分類模型。

它是

開源模型的型別化讀取層

你先定義輸入狀態與一個或多個有限問題。AnyJev 會回傳分類選項的機率分布、是非問題的機率,或有序評分的期望值。

它加入

偏差修正與校準層級

原始答案 token 的 logits 可能偏好特定標籤或位置。AnyJev 會標示每項決策採用的修正層級,讓應用程式碼可以要求符合預期的證據等級。

它不是

TypeSafe Jev 的開源複製品

此專案沒有發布或重現 TypeSafe 的私有權重、訓練資料或 RLCD 方法。請求格式相似,不代表兩者行為等價。

Raw → L0 → L1 → L2

四個層級會標示每項決策採用了哪一級去偏或校準方式。

L0 確實不需要訓練資料。更高層級會加入標註樣本;L2 會針對特定問題擬合小型輸出頭,但不會更新基礎模型權重。

Raw不需標籤

對答案 token 的 logits 執行受限 softmax。

不修正選項位置或標籤偏好。

L0不需標籤

輪替選項順序,並修正估計出的標籤先驗。

順序較穩定,但機率尚未針對任務校準。

L1100–500 筆標籤

為特定模型與問題加入溫度校準。

可改善信心水準估計,但不會修正錯誤排序。

L2100–300 筆標籤

在中間隱藏狀態上擬合有閉式解的小型輸出頭。

僅適用特定模型與問題,並需存取本機隱藏狀態。

本機工作流程範例

替客服工單分流,並檢查準備執行的動作。

以下簡化範例沿用專案公開 API:Qwen 模型留在本機,AnyJev 讀取兩項範圍明確的判斷,後續動作仍由一般程式碼決定。

安裝 Transformers 後端
pip install "anyjev[hf]"

需要 Python 3.10 或更新版本。第一次實際執行時,也會下載你選擇的開源模型。

PythonChoice + Noul
from anyjev import Decider, Question
from anyjev.backends.hf import HFBackend

decider = Decider(HFBackend("Qwen/Qwen3-8B"))

route = Question.choice(
    "Which team should handle this?",
    ["billing", "technical", "sales", "other"],
    name="route",
)
risky = Question.noul(
    "Is this tool call destructive or irreversible?",
    name="risky",
)

result = decider.decide(
    {"message": "I was charged twice.", "tool_call": "refund"},
    [route, risky],
)

result["route"].distribution
result["risky"].p_true
result.level  # "L0"
01

定義答案範圍

應用先列出可處理的團隊,並詢問準備執行的工具呼叫是否具破壞性。

02

讀取有限分布

模型不會生成自由文字;結果包含機率分布或機率值,以及本次使用的層級。

03

把策略留在程式碼裡

程式碼負責設定門檻、將不確定案例交由人工處理,並在風險過高時阻止副作用。

上游基準測試

值得關注的不只準確率,還有能否更安全地自動處理。

AnyJev 公布了 Qwen3-8B 在 300 筆 BANKING77 測試資料上的結果。以下數字來自開發者提交至儲存庫的評測資料;Jev AI Dev 尚未獨立重跑這項模型評測。

指標原始 logitsAnyJev L0AnyJev L1
反轉選項後答案改變率0.2300.0730.077
準確率0.7470.8030.807
期望校準誤差0.2400.1840.095
錯誤率不超過 5% 時的涵蓋率7.7%46.3%52.0%

這組測試的準確率從 0.747 提升到 0.807。更顯著的實務變化,是錯誤率不超過 5% 時的涵蓋率:原始 logits 為 7.7%,L1 校準後為 52.0%。樣本量不大,不能直接套用到其他工作流程。

查看基準測試與消融實驗
社群影片 · 29 秒

快速了解如何把 LLM 變成 Jev 風格的決策器。

Data Science in your pocket 在 AnyJev 發布後製作了這段簡短介紹。這是第三方解讀,不是 Nokia Applied Research 官方示範,也不是獨立基準測試。

在 YouTube 觀看「How to convert any LLM into Jev AI?」
社群實測 · 2026 年 9 月

20 張工單的實測,呈現準確率與延遲之間的取捨。

WquGuru 在一台 MacBook 上,以 20 張中文客服工單比較官方 Jev 與三個開源專案。討論串包含影片、耗時及各專案準確率。

@wquguru · 實測比較

貼文顯示,搭配 Qwen3-4B 的 AnyJev 答對了 20 題中的 19 題。

準確率95%19 / 20 張工單
延遲~4s單次測試回報值
測試量20中文客服工單

同一討論串回報:官方 Jev 為 20/20、Laya 為 65%、djev 為 35%。這只能視為早期社群觀察,不能當作受控基準測試:題目很少、只有一台裝置,而且各專案使用不同模型設定。

在 X 查看比較與影片
@MorrisMz81 · AnyJev 作者
“The latency is real. We went correctness first.”

Jiamu “Morris” Zhang 表示,首版尚未調校推論服務路徑。AnyJev 的定位不是另一個 Jev 模型,而是把團隊已在執行的模型接成決策層;vLLM/SGLang 最佳化工作當時才剛開始。

閱讀作者完整回覆
@Marktechpost · 媒體概覽

簡要整理專案設計與已提交的基準測試。

MarkTechPost 概述型別化讀取、L0/L1 的差異和 BANKING77 結果。這些數字源自專案自己的評測,並非媒體另外重現。

證據邊界: Jev AI Dev 已確認這些貼文包含上述說法,但沒有重現這項社群測試。瀏覽與互動數字會持續變動,因此正文刻意不固定列出。

投入正式環境前

先了解目前版本沒有解決哪些問題。

型別化輸出解決的是介面問題,不會自動讓語意判斷變得正確、安全,也不保證能轉移到不同資料分布。

01

選項越多,L0 計算量越大

包含 K 個選項的 Choice 會循環輪替,因此零標籤修正需要 K 次 prefill。它用更多推論成本換取更穩定的選項順序。

02

L1 與 L2 需要工作流程標籤

校準器與讀取頭只適用特定模型和問題;任一項改變後,都應重新建立或驗證。

03

L2 需要存取隱藏狀態

目前 L2 路徑使用本機 Transformers 後端。vLLM、SGLang 等服務引擎仍列在專案路線圖中。

04

公開數字不能取代驗收測試

在機率值控制重要動作前,請用具代表性的資料衡量準確率、校準、順序敏感度與拒答策略。

第一手資料

回到專案來源核查。

AnyJev 仍在快速變動。正式接入前,請確認最新版本、可用後端與限制。

探索生態系

把 AnyJev 與其他社群 System One 專案放在一起比較。

AnyJev 的路線是在決策時調整現有開源因果語言模型。社群中也有專門訓練的模型、本機執行環境和相容 API 的實驗專案。

閱讀 System One 指南 瀏覽社群專案