En typet avlesning for åpne modeller
Du definerer kontekst og avgrensede spørsmål. AnyJev returnerer fordelinger for kategoriske valg, sannsynlighet for ja/nei eller forventet verdi på en ordnet skala.
AnyJev er et Python-verktøy med åpen kildekode fra Nokia Applied Research. Det leser Choice-, Score- og Noul-beslutninger fra kausale språkmodeller og korrigerer skjevhet fra rekkefølgen på alternativer samt kalibrerer sannsynligheter.
Viktig: AnyJev er ikke en ny grunnmodell, en åpen utgave av TypeSafes Jev-vekter eller et offisielt Jev-produkt. Det er en uavhengig måte å bygge beslutninger i Jev-format på modeller du kjører selv.
anyjev på PyPIstate → typed decisionsJeg ble belastet to ganger. Vennligst løs dette i dag.
result.level = "L0"Eksempel på resultatDen valgte kausale modellen beholdes; det som endres, er hvordan en avgrenset beslutning leses ut. AnyJev ligner derfor mer på et beslutningslag enn en selvstendig finjustert klassifikator.
Du definerer kontekst og avgrensede spørsmål. AnyJev returnerer fordelinger for kategoriske valg, sannsynlighet for ja/nei eller forventet verdi på en ordnet skala.
Rå logiter for svartokener kan favorisere en etikett eller posisjon. AnyJev viser hvilket korrigeringsnivå som ga beslutningen, slik at applikasjonen kan kreve riktig nivå.
Prosjektet publiserer eller gjenskaper ikke TypeSafes private vekter, treningsdata eller RLCD-metode. Lik request-form betyr ikke lik oppførsel.
L0 virker uten trening. Høyere nivåer bruker merkede eksempler; L2 tilpasser et lite spørsmålsspesifikt utgangslag uten å endre grunnmodellens vekter.
Ingen korrigering for alternativposisjon eller etikettpreferanse.
Mer stabilt, men sannsynlighetene er ikke oppgavekalibrert.
Gir bedre konfidensestimater, men retter ikke feil rangering.
Spesifikt for modell og spørsmål; krever lokal tilgang til skjulte tilstander.
Eksemplet følger den offentlige API-en: En Qwen-modell blir lokal, AnyJev leser to beslutninger med avgrenset svarrom, og applikasjonskoden avgjør neste steg.
pip install "anyjev[hf]"Krever Python 3.10 eller nyere. Første virkelige kjøring laster også ned den valgte åpne modellen.
Choice + Noulfrom anyjev import Decider, Question
from anyjev.backends.hf import HFBackend
decider = Decider(HFBackend("Qwen/Qwen3-8B"))
route = Question.choice(
"Which team should handle this?",
["billing", "technical", "sales", "other"],
name="route",
)
risky = Question.noul(
"Is this tool call destructive or irreversible?",
name="risky",
)
result = decider.decide(
{"message": "I was charged twice.", "tool_call": "refund"},
[route, risky],
)
result["route"].distribution
result["risky"].p_true
result.level # "L0"Applikasjonen navngir tillatte team og spør om det foreslåtte verktøykallet er risikabelt.
Ingen fritekst genereres. Resultatet inneholder en fordeling eller sannsynlighet og nivået som ble brukt.
Koden setter terskler, sender usikre saker til vurdering og hindrer sideeffekter når risikoen er for høy.
AnyJev rapporterer disse Qwen3-8B-resultatene på 300 BANKING77-testelementer. Tallene er rapportert av forfatterne fra artefakter i repoet; Jev AI Dev har ikke kjørt benchmarket uavhengig.
| Målepunkt | Rå logiter | AnyJev L0 | AnyJev L1 |
|---|---|---|---|
| Svar som endres når alternativene snus | 0.230 | 0.073 | 0.077 |
| Nøyaktighet | 0.747 | 0.803 | 0.807 |
| Forventet kalibreringsfeil | 0.240 | 0.184 | 0.095 |
| Dekning ved høyst 5 % feil | 7.7% | 46.3% | 52.0% |
Nøyaktigheten steg fra 0,747 til 0,807. Den største operative endringen var dekning ved høyst 5 % feil: 7,7 % for rå logiter og 52,0 % etter L1-kalibrering. Estimatet bygger på et lite testsett og må valideres for andre arbeidsflyter.
Se benchmark og ablasjonerData Science in your pocket publiserte denne korte introduksjonen etter at AnyJev kom. Det er en tredjepartsforklaring, ikke en offisiell Nokia Applied Research-demo eller en uavhengig benchmark.
Se «How to convert any LLM into Jev AI?» på YouTubeWquGuru sammenlignet offisiell Jev og tre åpne prosjekter på én MacBook med 20 kinesiske supportsaker. Tråden inneholder video, tider og nøyaktighet per prosjekt.
Samme tråd oppgir 20/20 for offisiell Jev, 65 % for Laya og 35 % for djev. Se det som en tidlig observasjon fra fellesskapet, ikke en kontrollert benchmark: ett lite spørsmålssett, én maskin og prosjektspesifikke oppsett.
Se sammenligning og video på X“The latency is real. We went correctness first.”
Jiamu «Morris» Zhang sa at første versjon ikke hadde optimalisert serveringsløpet. Han beskrev AnyJev som en metode for modeller teamet allerede drifter og opplyste at vLLM/SGLang-optimalisering var i gang.
Les hele svaret fra forfatterenMarkTechPost oppsummerer typet avlesning, skillet mellom L0/L1 og BANKING77-resultatene. Tallene kommer fra prosjektets egen benchmark, ikke en uavhengig gjentakelse.
Evidensgrense: Jev AI Dev har bekreftet at innleggene inneholder påstandene, men har ikke gjentatt fellesskapstesten. Visninger og reaksjoner er utelatt fordi de endrer seg.
Typet output fjerner ett integrasjonsproblem. Det gjør ikke automatisk en semantisk vurdering riktig, trygg eller overførbar.
Et valg med K alternativer bruker sykliske rotasjoner, så korreksjon uten etiketter krever K prefills. Mer inferens gir bedre stabilitet mot rekkefølge.
Kalibrering og utgangslag gjelder én bestemt modell og ett spørsmål. De må bygges på nytt eller valideres når noe endres.
Dagens L2-sti bruker en lokal Transformers-backend. Serveringsmotorer som vLLM og SGLang står på veikartet.
Mål nøyaktighet, kalibrering, rekkefølgefølsomhet og avståelse på representative data før en sannsynlighet styrer en viktig handling.
AnyJev utvikler seg raskt. Kontroller siste versjon, backender og begrensninger før bruk.
AnyJev tilpasser en åpen kausal LLM i beslutningsøyeblikket. Økosystemet omfatter også spesialtrente modeller, lokale runtimes og API-kompatible eksperimenter.