Uafhængig guide · Gennemgået 25. september 2026

AnyJev gør en åben LLM til en typet beslutningsmodel.

AnyJev er et open source Python-værktøj fra Nokia Applied Research. Det læser Choice-, Score- og Noul-beslutninger fra kausale sprogmodeller og korrigerer bias fra valgmulighedernes rækkefølge samt kalibrerer sandsynligheder.

Vigtigt: AnyJev er ikke en ny grundmodel, en åben udgivelse af TypeSafes Jev-vægte eller et officielt Jev-produkt. Det er en uafhængig metode til at bygge beslutninger i Jev-format oven på modeller, du selv kører.

Vedligeholder
Nokia Applied Research
Licens
Apache-2.0
Pakke
anyjev på PyPI
Status
Præ-alfa
AnyJev · L0state → typed decisions
kontekst

Jeg er blevet opkrævet to gange. Løs det venligst i dag.

choice · routingHvilket team skal håndtere sagen?
fakturering0.81
teknisk0.09
salg0.04
andet0.06
result.level = "L0"Eksempel på output
Den vigtige forskel

AnyJev er et værktøj, ikke endnu et sæt modelvægte.

Den valgte kausale sprogmodel bevares; kun måden, en afgrænset beslutning aflæses på, ændres. Derfor minder AnyJev mere om et beslutningslag end en selvstændig, finjusteret klassifikator.

Det er

En typet aflæsning til åbne modeller

Du definerer en kontekst og afgrænsede spørgsmål. AnyJev returnerer fordelinger for kategoriske valg, en sandsynlighed for ja/nej eller en forventet værdi på en ordnet skala.

Det tilføjer

Niveauer for biaskorrektion og kalibrering

Rå logits for svartokens kan favorisere en etiket eller position. AnyJev viser korrektionsniveauet bag hver beslutning, så applikationen kan kræve det forventede niveau.

Det er ikke

En åben kopi af TypeSafe Jev

Projektet udgiver eller reproducerer ikke TypeSafes private vægte, træningsdata eller RLCD-metode. Samme requestform er ikke bevis for samme adfærd.

Rå → L0 → L1 → L2

Fire niveauer gør beslutningsgrundlaget tydeligt.

L0 fungerer uden træning. Højere niveauer bruger mærkede eksempler; L2 tilpasser et lille spørgsmålsspecifikt outputlag uden at ændre grundmodellens vægte.

RåIngen labels

Aflæser en begrænset softmax over svartoken-logits.

Ingen korrektion for position eller etiketpræference.

L0Ingen labels

Roterer valgene og korrigerer en estimeret etiket-prior.

Mere stabilt, men sandsynlighederne er ikke opgavekalibrerede.

L1100–500 labels

Tilføjer temperaturkalibrering for én model og ét spørgsmål.

Forbedrer sikkerhedsestimatet, men retter ikke en forkert rangering.

L2100–300 labels

Tilpasser et lille analytisk outputlag på en mellemliggende skjult tilstand.

Specifikt for model og spørgsmål; kræver lokal adgang til skjulte tilstande.

Lokalt workflow

Fordel en supportsag, og kontrollér en foreslået handling.

Eksemplet følger projektets offentlige API: En Qwen-model bliver lokal, AnyJev læser to afgrænsede beslutninger, og applikationskoden afgør næste skridt.

Installér Transformers-backenden
pip install "anyjev[hf]"

Kræver Python 3.10 eller nyere. Første rigtige kørsel henter også den valgte åbne model.

PythonChoice + Noul
from anyjev import Decider, Question
from anyjev.backends.hf import HFBackend

decider = Decider(HFBackend("Qwen/Qwen3-8B"))

route = Question.choice(
    "Which team should handle this?",
    ["billing", "technical", "sales", "other"],
    name="route",
)
risky = Question.noul(
    "Is this tool call destructive or irreversible?",
    name="risky",
)

result = decider.decide(
    {"message": "I was charged twice.", "tool_call": "refund"},
    [route, risky],
)

result["route"].distribution
result["risky"].p_true
result.level  # "L0"
01

Definér svarrummet

Applikationen navngiver de tilladte teams og spørger, om det foreslåede værktøjskald er risikabelt.

02

Læs afgrænsede fordelinger

Der genereres intet fritekstsvar. Resultatet indeholder en fordeling eller sandsynlighed og det anvendte niveau.

03

Behold politikken i kode

Koden sætter grænser, sender usikre sager til kontrol og forhindrer følgevirkninger, når risikoen er for høj.

Projektets benchmark

Hovedresultatet handler om sikrere automatisering, ikke kun præcision.

AnyJev rapporterer disse Qwen3-8B-resultater på 300 BANKING77-testemner. Tallene er forfatterrapporterede fra artefakter i repoet; Jev AI Dev har ikke kørt benchmarket uafhængigt.

MålepunktRå logitsAnyJev L0AnyJev L1
Svarskift efter omvendt valgrækkefølge0.2300.0730.077
Præcision0.7470.8030.807
Forventet kalibreringsfejl0.2400.1840.095
Dækning ved højst 5 % fejl7.7%46.3%52.0%

Præcisionen steg fra 0,747 til 0,807. Den største operationelle ændring var dækning ved højst 5 % fejl: 7,7 % for rå logits og 52,0 % efter L1-kalibrering. Estimatet bygger på et lille testsæt og kan ikke overføres uden validering.

Se benchmark og ablationer
Communityvideo · 29 sekunder

Se kort, hvordan en LLM bliver en Jev-lignende beslutningstager.

Data Science in your pocket udgav denne korte introduktion efter AnyJev. Det er en tredjepartsforklaring, ikke en officiel Nokia Applied Research-demo eller et uafhængigt benchmark.

Se ‘How to convert any LLM into Jev AI?’ på YouTube
Communitytest · September 2026

En test med 20 sager viste kompromiset mellem præcision og svartid.

WquGuru sammenlignede officiel Jev og tre åbne projekter på én MacBook med 20 kinesiske supportsager. Tråden indeholder video, tider og præcision pr. projekt.

@wquguru · Praktisk sammenligning

AnyJev med Qwen3-4B svarede angiveligt rigtigt på 19 af 20 sager.

Præcision95%19 / 20 sager
Svartid~4srapporteret pr. test
Testgrundlag20kinesiske supportsager

Samme tråd rapporterer 20/20 for officiel Jev, 65 % for Laya og 35 % for djev. Betragt det som en tidlig communityobservation, ikke et kontrolleret benchmark: ét lille spørgsmålssæt, én maskine og projektspecifikke konfigurationer.

Se sammenligning og video på X
@MorrisMz81 · AnyJev-forfatter
“The latency is real. We went correctness first.”

Jiamu ‘Morris’ Zhang sagde, at første version endnu ikke havde optimeret serveringsvejen. Han beskrev AnyJev som en metode til modeller, teamet allerede driver, og fortalte, at vLLM/SGLang-optimering var påbegyndt.

Læs hele forfatterens svar
@Marktechpost · Medieoverblik

En kort gennemgang af projektet og dets gemte benchmark.

MarkTechPost opsummerer den typede aflæsning, forskellen på L0/L1 og BANKING77-resultaterne. Tallene stammer fra projektets eget benchmark, ikke en uafhængig gentagelse.

Evidensgrænse: Jev AI Dev har bekræftet, at opslagene indeholder udsagnene, men har ikke gentaget communitytesten. Visninger og reaktioner er udeladt, fordi de ændrer sig.

Før produktion

Kend begrænsningerne i den aktuelle version.

Typet output fjerner ét integrationsproblem. Det gør ikke automatisk en semantisk vurdering korrekt, sikker eller overførbar.

01

L0 bruger mere compute ved mange valg

Et valg med K muligheder bruger cykliske rotationer, så korrektionen uden labels kræver K prefills. Mere inferens køber bedre stabilitet over for rækkefølge.

02

L1 og L2 kræver labels fra workflowet

Kalibrering og outputlag gælder en bestemt model og et bestemt spørgsmål. De skal genopbygges eller valideres, når en af delene ændres.

03

L2 kræver adgang til skjulte tilstande

Den aktuelle L2-vej bruger en lokal Transformers-backend. Serveringsmotorer som vLLM og SGLang står på projektets udviklingsplan.

04

Udgivne tal er ikke din accepttest

Mål præcision, kalibrering, rækkefølgefølsomhed og afståelse på repræsentative data, før en sandsynlighed styrer en vigtig handling.

Primære kilder

Tjek projektet ved kilden.

AnyJev udvikler sig hurtigt. Kontrollér seneste version, backends og begrænsninger før brug.

Udforsk økosystemet

Sammenlign AnyJev med andre System One-communityprojekter.

AnyJev tilpasser en åben kausal LLM i beslutningsøjeblikket. Økosystemet rummer også specialtrænede modeller, lokale runtimes og API-kompatible eksperimenter.

Læs System One-guiden Se communityprojekter