開源模型的型別化讀取層
你先定義輸入狀態與一個或多個有限問題。AnyJev 會回傳分類選項的機率分布、是非問題的機率,或有序評分的期望值。
AnyJev 是 Nokia Applied Research 開源的 Python 工具包。它直接從因果語言模型讀取 Choice、Score 與 Noul 形式的決策,並提供選項順序去偏與機率校準。
請注意: AnyJev 不是新的基礎模型,也不是 TypeSafe Jev 權重的開源版本,更不是 Jev 官方產品。它提供一套方法,讓你正在執行的模型具備 Jev 風格的決策介面。
anyjev(PyPI)state → typed decisions我的帳戶被重複扣款,請今天協助處理。
result.level = "L0"示意結果它保留你選擇的因果語言模型,只改變如何從模型讀取範圍明確的判斷。因此,它更像一層決策介面,而不是經過微調的獨立分類模型。
你先定義輸入狀態與一個或多個有限問題。AnyJev 會回傳分類選項的機率分布、是非問題的機率,或有序評分的期望值。
原始答案 token 的 logits 可能偏好特定標籤或位置。AnyJev 會標示每項決策採用的修正層級,讓應用程式碼可以要求符合預期的證據等級。
此專案沒有發布或重現 TypeSafe 的私有權重、訓練資料或 RLCD 方法。請求格式相似,不代表兩者行為等價。
L0 確實不需要訓練資料。更高層級會加入標註樣本;L2 會針對特定問題擬合小型輸出頭,但不會更新基礎模型權重。
不修正選項位置或標籤偏好。
順序較穩定,但機率尚未針對任務校準。
可改善信心水準估計,但不會修正錯誤排序。
僅適用特定模型與問題,並需存取本機隱藏狀態。
以下簡化範例沿用專案公開 API:Qwen 模型留在本機,AnyJev 讀取兩項範圍明確的判斷,後續動作仍由一般程式碼決定。
pip install "anyjev[hf]"需要 Python 3.10 或更新版本。第一次實際執行時,也會下載你選擇的開源模型。
Choice + Noulfrom anyjev import Decider, Question
from anyjev.backends.hf import HFBackend
decider = Decider(HFBackend("Qwen/Qwen3-8B"))
route = Question.choice(
"Which team should handle this?",
["billing", "technical", "sales", "other"],
name="route",
)
risky = Question.noul(
"Is this tool call destructive or irreversible?",
name="risky",
)
result = decider.decide(
{"message": "I was charged twice.", "tool_call": "refund"},
[route, risky],
)
result["route"].distribution
result["risky"].p_true
result.level # "L0"應用先列出可處理的團隊,並詢問準備執行的工具呼叫是否具破壞性。
模型不會生成自由文字;結果包含機率分布或機率值,以及本次使用的層級。
程式碼負責設定門檻、將不確定案例交由人工處理,並在風險過高時阻止副作用。
AnyJev 公布了 Qwen3-8B 在 300 筆 BANKING77 測試資料上的結果。以下數字來自開發者提交至儲存庫的評測資料;Jev AI Dev 尚未獨立重跑這項模型評測。
| 指標 | 原始 logits | AnyJev L0 | AnyJev L1 |
|---|---|---|---|
| 反轉選項後答案改變率 | 0.230 | 0.073 | 0.077 |
| 準確率 | 0.747 | 0.803 | 0.807 |
| 期望校準誤差 | 0.240 | 0.184 | 0.095 |
| 錯誤率不超過 5% 時的涵蓋率 | 7.7% | 46.3% | 52.0% |
這組測試的準確率從 0.747 提升到 0.807。更顯著的實務變化,是錯誤率不超過 5% 時的涵蓋率:原始 logits 為 7.7%,L1 校準後為 52.0%。樣本量不大,不能直接套用到其他工作流程。
查看基準測試與消融實驗Data Science in your pocket 在 AnyJev 發布後製作了這段簡短介紹。這是第三方解讀,不是 Nokia Applied Research 官方示範,也不是獨立基準測試。
在 YouTube 觀看「How to convert any LLM into Jev AI?」WquGuru 在一台 MacBook 上,以 20 張中文客服工單比較官方 Jev 與三個開源專案。討論串包含影片、耗時及各專案準確率。
同一討論串回報:官方 Jev 為 20/20、Laya 為 65%、djev 為 35%。這只能視為早期社群觀察,不能當作受控基準測試:題目很少、只有一台裝置,而且各專案使用不同模型設定。
在 X 查看比較與影片證據邊界: Jev AI Dev 已確認這些貼文包含上述說法,但沒有重現這項社群測試。瀏覽與互動數字會持續變動,因此正文刻意不固定列出。
型別化輸出解決的是介面問題,不會自動讓語意判斷變得正確、安全,也不保證能轉移到不同資料分布。
包含 K 個選項的 Choice 會循環輪替,因此零標籤修正需要 K 次 prefill。它用更多推論成本換取更穩定的選項順序。
校準器與讀取頭只適用特定模型和問題;任一項改變後,都應重新建立或驗證。
目前 L2 路徑使用本機 Transformers 後端。vLLM、SGLang 等服務引擎仍列在專案路線圖中。
在機率值控制重要動作前,請用具代表性的資料衡量準確率、校準、順序敏感度與拒答策略。
AnyJev 仍在快速變動。正式接入前,請確認最新版本、可用後端與限制。
AnyJev 的路線是在決策時調整現有開源因果語言模型。社群中也有專門訓練的模型、本機執行環境和相容 API 的實驗專案。