En typet aflæsning til åbne modeller
Du definerer en kontekst og afgrænsede spørgsmål. AnyJev returnerer fordelinger for kategoriske valg, en sandsynlighed for ja/nej eller en forventet værdi på en ordnet skala.
AnyJev er et open source Python-værktøj fra Nokia Applied Research. Det læser Choice-, Score- og Noul-beslutninger fra kausale sprogmodeller og korrigerer bias fra valgmulighedernes rækkefølge samt kalibrerer sandsynligheder.
Vigtigt: AnyJev er ikke en ny grundmodel, en åben udgivelse af TypeSafes Jev-vægte eller et officielt Jev-produkt. Det er en uafhængig metode til at bygge beslutninger i Jev-format oven på modeller, du selv kører.
anyjev på PyPIstate → typed decisionsJeg er blevet opkrævet to gange. Løs det venligst i dag.
result.level = "L0"Eksempel på outputDen valgte kausale sprogmodel bevares; kun måden, en afgrænset beslutning aflæses på, ændres. Derfor minder AnyJev mere om et beslutningslag end en selvstændig, finjusteret klassifikator.
Du definerer en kontekst og afgrænsede spørgsmål. AnyJev returnerer fordelinger for kategoriske valg, en sandsynlighed for ja/nej eller en forventet værdi på en ordnet skala.
Rå logits for svartokens kan favorisere en etiket eller position. AnyJev viser korrektionsniveauet bag hver beslutning, så applikationen kan kræve det forventede niveau.
Projektet udgiver eller reproducerer ikke TypeSafes private vægte, træningsdata eller RLCD-metode. Samme requestform er ikke bevis for samme adfærd.
L0 fungerer uden træning. Højere niveauer bruger mærkede eksempler; L2 tilpasser et lille spørgsmålsspecifikt outputlag uden at ændre grundmodellens vægte.
Ingen korrektion for position eller etiketpræference.
Mere stabilt, men sandsynlighederne er ikke opgavekalibrerede.
Forbedrer sikkerhedsestimatet, men retter ikke en forkert rangering.
Specifikt for model og spørgsmål; kræver lokal adgang til skjulte tilstande.
Eksemplet følger projektets offentlige API: En Qwen-model bliver lokal, AnyJev læser to afgrænsede beslutninger, og applikationskoden afgør næste skridt.
pip install "anyjev[hf]"Kræver Python 3.10 eller nyere. Første rigtige kørsel henter også den valgte åbne model.
Choice + Noulfrom anyjev import Decider, Question
from anyjev.backends.hf import HFBackend
decider = Decider(HFBackend("Qwen/Qwen3-8B"))
route = Question.choice(
"Which team should handle this?",
["billing", "technical", "sales", "other"],
name="route",
)
risky = Question.noul(
"Is this tool call destructive or irreversible?",
name="risky",
)
result = decider.decide(
{"message": "I was charged twice.", "tool_call": "refund"},
[route, risky],
)
result["route"].distribution
result["risky"].p_true
result.level # "L0"Applikationen navngiver de tilladte teams og spørger, om det foreslåede værktøjskald er risikabelt.
Der genereres intet fritekstsvar. Resultatet indeholder en fordeling eller sandsynlighed og det anvendte niveau.
Koden sætter grænser, sender usikre sager til kontrol og forhindrer følgevirkninger, når risikoen er for høj.
AnyJev rapporterer disse Qwen3-8B-resultater på 300 BANKING77-testemner. Tallene er forfatterrapporterede fra artefakter i repoet; Jev AI Dev har ikke kørt benchmarket uafhængigt.
| Målepunkt | Rå logits | AnyJev L0 | AnyJev L1 |
|---|---|---|---|
| Svarskift efter omvendt valgrækkefølge | 0.230 | 0.073 | 0.077 |
| Præcision | 0.747 | 0.803 | 0.807 |
| Forventet kalibreringsfejl | 0.240 | 0.184 | 0.095 |
| Dækning ved højst 5 % fejl | 7.7% | 46.3% | 52.0% |
Præcisionen steg fra 0,747 til 0,807. Den største operationelle ændring var dækning ved højst 5 % fejl: 7,7 % for rå logits og 52,0 % efter L1-kalibrering. Estimatet bygger på et lille testsæt og kan ikke overføres uden validering.
Se benchmark og ablationerData Science in your pocket udgav denne korte introduktion efter AnyJev. Det er en tredjepartsforklaring, ikke en officiel Nokia Applied Research-demo eller et uafhængigt benchmark.
Se ‘How to convert any LLM into Jev AI?’ på YouTubeWquGuru sammenlignede officiel Jev og tre åbne projekter på én MacBook med 20 kinesiske supportsager. Tråden indeholder video, tider og præcision pr. projekt.
Samme tråd rapporterer 20/20 for officiel Jev, 65 % for Laya og 35 % for djev. Betragt det som en tidlig communityobservation, ikke et kontrolleret benchmark: ét lille spørgsmålssæt, én maskine og projektspecifikke konfigurationer.
Se sammenligning og video på X“The latency is real. We went correctness first.”
Jiamu ‘Morris’ Zhang sagde, at første version endnu ikke havde optimeret serveringsvejen. Han beskrev AnyJev som en metode til modeller, teamet allerede driver, og fortalte, at vLLM/SGLang-optimering var påbegyndt.
Læs hele forfatterens svarMarkTechPost opsummerer den typede aflæsning, forskellen på L0/L1 og BANKING77-resultaterne. Tallene stammer fra projektets eget benchmark, ikke en uafhængig gentagelse.
Evidensgrænse: Jev AI Dev har bekræftet, at opslagene indeholder udsagnene, men har ikke gentaget communitytesten. Visninger og reaktioner er udeladt, fordi de ændrer sig.
Typet output fjerner ét integrationsproblem. Det gør ikke automatisk en semantisk vurdering korrekt, sikker eller overførbar.
Et valg med K muligheder bruger cykliske rotationer, så korrektionen uden labels kræver K prefills. Mere inferens køber bedre stabilitet over for rækkefølge.
Kalibrering og outputlag gælder en bestemt model og et bestemt spørgsmål. De skal genopbygges eller valideres, når en af delene ændres.
Den aktuelle L2-vej bruger en lokal Transformers-backend. Serveringsmotorer som vLLM og SGLang står på projektets udviklingsplan.
Mål præcision, kalibrering, rækkefølgefølsomhed og afståelse på repræsentative data, før en sandsynlighed styrer en vigtig handling.
AnyJev udvikler sig hurtigt. Kontrollér seneste version, backends og begrænsninger før brug.
AnyJev tilpasser en åben kausal LLM i beslutningsøjeblikket. Økosystemet rummer også specialtrænede modeller, lokale runtimes og API-kompatible eksperimenter.