Oberoende guide · Granskad 25 september 2026

AnyJev gör en öppen LLM till en typad beslutsmodell.

AnyJev är ett Python-verktyg med öppen källkod från Nokia Applied Research. Det läser Choice-, Score- och Noul-beslut från kausala språkmodeller och korrigerar bias från alternativens ordning samt kalibrerar sannolikheter.

Viktigt: AnyJev är inte en ny grundmodell, en öppen utgåva av TypeSafes Jev-vikter eller en officiell Jev-produkt. Det är ett oberoende sätt att bygga beslut i Jev-format ovanpå modeller som du själv kör.

Förvaltare
Nokia Applied Research
Licens
Apache-2.0
Paket
anyjev på PyPI
Status
Pre-alfa
AnyJev · L0state → typed decisions
kontext

Jag har debiterats två gånger. Lös det här i dag, tack.

choice · routningVilket team ska hantera ärendet?
fakturering0.81
teknik0.09
försäljning0.04
övrigt0.06
result.level = "L0"Illustrativt resultat
Den viktiga skillnaden

AnyJev är ett verktyg, inte ännu en uppsättning modellvikter.

Den valda kausala modellen behålls; det som ändras är hur ett avgränsat beslut läses ut. AnyJev liknar därför mer ett beslutslager än en fristående finjusterad klassificerare.

Det är

En typad avläsning för öppna modeller

Du definierar kontext och avgränsade frågor. AnyJev returnerar fördelningar för kategoriska val, en sannolikhet för ja/nej eller ett förväntat värde på en ordnad skala.

Det tillför

Nivåer för biaskorrigering och kalibrering

Rå logits för svarstoken kan gynna en etikett eller position. AnyJev visar vilken korrigeringsnivå som gav varje beslut, så att applikationen kan kräva rätt nivå.

Det är inte

En öppen kopia av TypeSafe Jev

Projektet publicerar eller återskapar inte TypeSafes privata vikter, träningsdata eller RLCD-metod. Liknande requestformat bevisar inte likvärdigt beteende.

Rå → L0 → L1 → L2

Fyra nivåer gör beslutsunderlaget tydligt.

L0 fungerar utan träning. Högre nivåer använder märkta exempel; L2 anpassar ett litet frågespecifikt huvud utan att ändra grundmodellens vikter.

RåInga etiketter

Läser en begränsad softmax över logits för svarstoken.

Ingen korrigering för alternativens position eller etikettpreferens.

L0Inga etiketter

Roterar alternativen och korrigerar en skattad etikett-prior.

Stabilare, men sannolikheterna är inte uppgiftskalibrerade.

L1100–500 etiketter

Lägger till temperaturkalibrering för en modell och fråga.

Förbättrar konfidensskattningen men rättar inte fel rangordning.

L2100–300 etiketter

Anpassar ett litet analytiskt huvud på ett mellanliggande dolt tillstånd.

Specifikt för modell och fråga; kräver lokal åtkomst till dolda tillstånd.

Exempel på lokalt arbetsflöde

Dirigera ett supportärende och kontrollera en föreslagen åtgärd.

Exemplet följer projektets publika API: en Qwen-modell stannar lokalt, AnyJev läser två avgränsade beslut och applikationskoden avgör nästa steg.

Installera Transformers-backend
pip install "anyjev[hf]"

Python 3.10 eller senare krävs. Den första riktiga körningen hämtar även den öppna modell du väljer.

PythonChoice + Noul
from anyjev import Decider, Question
from anyjev.backends.hf import HFBackend

decider = Decider(HFBackend("Qwen/Qwen3-8B"))

route = Question.choice(
    "Which team should handle this?",
    ["billing", "technical", "sales", "other"],
    name="route",
)
risky = Question.noul(
    "Is this tool call destructive or irreversible?",
    name="risky",
)

result = decider.decide(
    {"message": "I was charged twice.", "tool_call": "refund"},
    [route, risky],
)

result["route"].distribution
result["risky"].p_true
result.level  # "L0"
01

Definiera svarsrymden

Applikationen anger tillåtna team och frågar om det föreslagna verktygsanropet är riskabelt.

02

Läs avgränsade fördelningar

Inget fritextsvar genereras. Resultatet innehåller en fördelning eller sannolikhet och använd nivå.

03

Behåll policyn i kod

Koden sätter trösklar, skickar osäkra fall till granskning och stoppar sidoeffekter när risken är för hög.

Projektets benchmark

Huvudresultatet gäller säkrare automatisering, inte bara precision.

AnyJev redovisar följande Qwen3-8B-resultat på 300 BANKING77-testobjekt. Siffrorna kommer från artefakter som författarna har checkat in; Jev AI Dev har inte kört benchmarken oberoende.

MätvärdeRå logitsAnyJev L0AnyJev L1
Svar som ändras när alternativen vänds0.2300.0730.077
Precision0.7470.8030.807
Förväntat kalibreringsfel0.2400.1840.095
Täckning vid högst 5 % fel7.7%46.3%52.0%

Precisionen steg från 0,747 till 0,807. Den större operativa förändringen var täckning vid högst 5 % fel: 7,7 % för råa logits och 52,0 % efter L1-kalibrering. Skattningen bygger på ett litet testset och måste valideras för andra flöden.

Granska benchmark och ablationer
Communityvideo · 29 sekunder

Se snabbt hur en LLM blir en beslutsfattare i Jev-stil.

Data Science in your pocket publicerade denna korta introduktion efter att AnyJev kom. Det är en tredjepartsförklaring, inte en officiell Nokia Applied Research-demo eller oberoende benchmark.

Se ”How to convert any LLM into Jev AI?” på YouTube
Communitytest · September 2026

Ett test med 20 ärenden visade avvägningen mellan precision och svarstid.

WquGuru jämförde officiella Jev och tre öppna projekt på en MacBook med 20 kinesiska supportärenden. Tråden innehåller video, tider och precision per projekt.

@wquguru · Praktisk jämförelse

AnyJev med Qwen3-4B uppges ha svarat rätt på 19 av 20 ärenden.

Precision95%19 / 20 ärenden
Svarstid~4srapporterad per test
Testunderlag20kinesiska supportärenden

Samma tråd anger 20/20 för officiella Jev, 65 % för Laya och 35 % för djev. Se det som en tidig communityobservation, inte en kontrollerad benchmark: ett litet frågeset, en maskin och projektspecifika konfigurationer.

Visa jämförelse och video på X
@MorrisMz81 · AnyJev-författare
“The latency is real. We went correctness first.”

Jiamu ”Morris” Zhang sade att den första versionen inte hade optimerat serveringsflödet. Han beskrev AnyJev som en metod för modeller som teamet redan driftar och uppgav att optimering för vLLM/SGLang påbörjades.

Läs författarens fullständiga svar
@Marktechpost · Medieöversikt

En kort genomgång av projektet och dess incheckade benchmark.

MarkTechPost sammanfattar den typade avläsningen, skillnaden mellan L0/L1 och BANKING77-resultaten. Siffrorna kommer från projektets benchmark, inte en oberoende replikering.

Evidensgräns: Jev AI Dev har verifierat att inläggen innehåller påståendena men inte återskapat communitytestet. Visningar och interaktioner utelämnas eftersom de förändras över tid.

Före produktion

Känn till vad den nuvarande versionen inte löser.

Typad utdata tar bort ett integrationsproblem. Det gör inte automatiskt en semantisk bedömning korrekt, säker eller överförbar.

01

L0 använder mer beräkning vid många val

Ett val med K alternativ använder cykliska rotationer, så korrigering utan etiketter kräver K prefills. Mer inferens ger bättre stabilitet mot ordningsbias.

02

L1 och L2 kräver etiketter från arbetsflödet

Kalibrering och huvuden gäller en viss modell och fråga. De måste byggas om eller valideras när någon av dem ändras.

03

L2 kräver åtkomst till dolda tillstånd

Nuvarande L2-väg använder en lokal Transformers-backend. Servingmotorer som vLLM och SGLang finns på projektets färdplan.

04

Publicerade siffror är inte ditt acceptanstest

Mät precision, kalibrering, ordningskänslighet och avstående på representativa data innan en sannolikhet styr en viktig åtgärd.

Primärkällor

Kontrollera projektet vid källan.

AnyJev utvecklas snabbt. Kontrollera senaste version, backendstöd och begränsningar före användning.

Utforska ekosystemet

Jämför AnyJev med andra System One-communityprojekt.

AnyJev anpassar en öppen kausal LLM i beslutsögonblicket. Ekosystemet omfattar även specialtränade modeller, lokala runtimes och API-kompatibla experiment.

Läs System One-guiden Visa communityprojekt