Uavhengig veiledning · Gjennomgått 25. september 2026

AnyJev gjør en åpen LLM til en typet beslutningsmodell.

AnyJev er et Python-verktøy med åpen kildekode fra Nokia Applied Research. Det leser Choice-, Score- og Noul-beslutninger fra kausale språkmodeller og korrigerer skjevhet fra rekkefølgen på alternativer samt kalibrerer sannsynligheter.

Viktig: AnyJev er ikke en ny grunnmodell, en åpen utgave av TypeSafes Jev-vekter eller et offisielt Jev-produkt. Det er en uavhengig måte å bygge beslutninger i Jev-format på modeller du kjører selv.

Vedlikeholder
Nokia Applied Research
Lisens
Apache-2.0
Pakke
anyjev på PyPI
Status
Pre-alfa
AnyJev · L0state → typed decisions
kontekst

Jeg ble belastet to ganger. Vennligst løs dette i dag.

choice · rutingHvilket team bør håndtere saken?
fakturering0.81
teknisk0.09
salg0.04
annet0.06
result.level = "L0"Eksempel på resultat
Det viktige skillet

AnyJev er et verktøy, ikke enda et sett modellvekter.

Den valgte kausale modellen beholdes; det som endres, er hvordan en avgrenset beslutning leses ut. AnyJev ligner derfor mer på et beslutningslag enn en selvstendig finjustert klassifikator.

Dette er det

En typet avlesning for åpne modeller

Du definerer kontekst og avgrensede spørsmål. AnyJev returnerer fordelinger for kategoriske valg, sannsynlighet for ja/nei eller forventet verdi på en ordnet skala.

Dette tilfører det

Nivåer for skjevhetskorrigering og kalibrering

Rå logiter for svartokener kan favorisere en etikett eller posisjon. AnyJev viser hvilket korrigeringsnivå som ga beslutningen, slik at applikasjonen kan kreve riktig nivå.

Dette er det ikke

En åpen kopi av TypeSafe Jev

Prosjektet publiserer eller gjenskaper ikke TypeSafes private vekter, treningsdata eller RLCD-metode. Lik request-form betyr ikke lik oppførsel.

Rå → L0 → L1 → L2

Fire nivåer gjør beslutningsgrunnlaget tydelig.

L0 virker uten trening. Høyere nivåer bruker merkede eksempler; L2 tilpasser et lite spørsmålsspesifikt utgangslag uten å endre grunnmodellens vekter.

RåIngen etiketter

Leser en begrenset softmax over logiter for svartokener.

Ingen korrigering for alternativposisjon eller etikettpreferanse.

L0Ingen etiketter

Roterer alternativene og korrigerer en estimert etikett-prior.

Mer stabilt, men sannsynlighetene er ikke oppgavekalibrert.

L1100–500 etiketter

Legger til temperaturkalibrering for én modell og ett spørsmål.

Gir bedre konfidensestimater, men retter ikke feil rangering.

L2100–300 etiketter

Tilpasser et lite analytisk utgangslag på en mellomliggende skjult tilstand.

Spesifikt for modell og spørsmål; krever lokal tilgang til skjulte tilstander.

Eksempel på lokal arbeidsflyt

Fordel en supportsak og kontroller en foreslått handling.

Eksemplet følger den offentlige API-en: En Qwen-modell blir lokal, AnyJev leser to beslutninger med avgrenset svarrom, og applikasjonskoden avgjør neste steg.

Installer Transformers-backend
pip install "anyjev[hf]"

Krever Python 3.10 eller nyere. Første virkelige kjøring laster også ned den valgte åpne modellen.

PythonChoice + Noul
from anyjev import Decider, Question
from anyjev.backends.hf import HFBackend

decider = Decider(HFBackend("Qwen/Qwen3-8B"))

route = Question.choice(
    "Which team should handle this?",
    ["billing", "technical", "sales", "other"],
    name="route",
)
risky = Question.noul(
    "Is this tool call destructive or irreversible?",
    name="risky",
)

result = decider.decide(
    {"message": "I was charged twice.", "tool_call": "refund"},
    [route, risky],
)

result["route"].distribution
result["risky"].p_true
result.level  # "L0"
01

Definer svarrommet

Applikasjonen navngir tillatte team og spør om det foreslåtte verktøykallet er risikabelt.

02

Les avgrensede fordelinger

Ingen fritekst genereres. Resultatet inneholder en fordeling eller sannsynlighet og nivået som ble brukt.

03

Behold policyen i kode

Koden setter terskler, sender usikre saker til vurdering og hindrer sideeffekter når risikoen er for høy.

Prosjektets benchmark

Hovedresultatet handler om tryggere automatisering, ikke bare nøyaktighet.

AnyJev rapporterer disse Qwen3-8B-resultatene på 300 BANKING77-testelementer. Tallene er rapportert av forfatterne fra artefakter i repoet; Jev AI Dev har ikke kjørt benchmarket uavhengig.

MålepunktRå logiterAnyJev L0AnyJev L1
Svar som endres når alternativene snus0.2300.0730.077
Nøyaktighet0.7470.8030.807
Forventet kalibreringsfeil0.2400.1840.095
Dekning ved høyst 5 % feil7.7%46.3%52.0%

Nøyaktigheten steg fra 0,747 til 0,807. Den største operative endringen var dekning ved høyst 5 % feil: 7,7 % for rå logiter og 52,0 % etter L1-kalibrering. Estimatet bygger på et lite testsett og må valideres for andre arbeidsflyter.

Se benchmark og ablasjoner
Video fra fellesskapet · 29 sekunder

Se kort hvordan en LLM blir en beslutningstaker i Jev-stil.

Data Science in your pocket publiserte denne korte introduksjonen etter at AnyJev kom. Det er en tredjepartsforklaring, ikke en offisiell Nokia Applied Research-demo eller en uavhengig benchmark.

Se «How to convert any LLM into Jev AI?» på YouTube
Fellesskapstest · September 2026

En test med 20 saker viste avveiingen mellom nøyaktighet og svartid.

WquGuru sammenlignet offisiell Jev og tre åpne prosjekter på én MacBook med 20 kinesiske supportsaker. Tråden inneholder video, tider og nøyaktighet per prosjekt.

@wquguru · Praktisk sammenligning

AnyJev med Qwen3-4B svarte angivelig riktig på 19 av 20 saker.

Nøyaktighet95%19 / 20 saker
Svartid~4srapportert per test
Testgrunnlag20kinesiske supportsaker

Samme tråd oppgir 20/20 for offisiell Jev, 65 % for Laya og 35 % for djev. Se det som en tidlig observasjon fra fellesskapet, ikke en kontrollert benchmark: ett lite spørsmålssett, én maskin og prosjektspesifikke oppsett.

Se sammenligning og video på X
@MorrisMz81 · AnyJev-forfatter
“The latency is real. We went correctness first.”

Jiamu «Morris» Zhang sa at første versjon ikke hadde optimalisert serveringsløpet. Han beskrev AnyJev som en metode for modeller teamet allerede drifter og opplyste at vLLM/SGLang-optimalisering var i gang.

Les hele svaret fra forfatteren
@Marktechpost · Medieomtale

En kort gjennomgang av prosjektet og den lagrede benchmarket.

MarkTechPost oppsummerer typet avlesning, skillet mellom L0/L1 og BANKING77-resultatene. Tallene kommer fra prosjektets egen benchmark, ikke en uavhengig gjentakelse.

Evidensgrense: Jev AI Dev har bekreftet at innleggene inneholder påstandene, men har ikke gjentatt fellesskapstesten. Visninger og reaksjoner er utelatt fordi de endrer seg.

Før produksjon

Kjenn begrensningene i dagens versjon.

Typet output fjerner ett integrasjonsproblem. Det gjør ikke automatisk en semantisk vurdering riktig, trygg eller overførbar.

01

L0 bruker mer beregning ved mange valg

Et valg med K alternativer bruker sykliske rotasjoner, så korreksjon uten etiketter krever K prefills. Mer inferens gir bedre stabilitet mot rekkefølge.

02

L1 og L2 krever etiketter fra arbeidsflyten

Kalibrering og utgangslag gjelder én bestemt modell og ett spørsmål. De må bygges på nytt eller valideres når noe endres.

03

L2 krever tilgang til skjulte tilstander

Dagens L2-sti bruker en lokal Transformers-backend. Serveringsmotorer som vLLM og SGLang står på veikartet.

04

Publiserte tall er ikke din akseptansetest

Mål nøyaktighet, kalibrering, rekkefølgefølsomhet og avståelse på representative data før en sannsynlighet styrer en viktig handling.

Primærkilder

Sjekk prosjektet ved kilden.

AnyJev utvikler seg raskt. Kontroller siste versjon, backender og begrensninger før bruk.

Utforsk økosystemet

Sammenlign AnyJev med andre System One-prosjekter fra fellesskapet.

AnyJev tilpasser en åpen kausal LLM i beslutningsøyeblikket. Økosystemet omfatter også spesialtrente modeller, lokale runtimes og API-kompatible eksperimenter.

Les System One-veiledningen Se fellesskapsprosjekter