Onafhankelijke gids · Beoordeeld op 25 september 2026

AnyJev maakt van een open LLM een getypeerd beslismodel.

AnyJev is een opensource-Pythontoolkit van Nokia Applied Research. De toolkit leest Choice-, Score- en Noul-beslissingen uit causale taalmodellen en corrigeert vertekening door optievolgorde en kalibratie van kansen.

Belangrijk: AnyJev is geen nieuw basismodel, geen open uitgave van TypeSafe's Jev-gewichten en geen officieel Jev-product. Het is een onafhankelijke manier om beslissingen in Jev-formaat te bouwen op modellen die je zelf uitvoert.

Beheerder
Nokia Applied Research
Licentie
Apache-2.0
Pakket
anyjev op PyPI
Status
Pre-alfa
AnyJev · L0state → typed decisions
context

Ik ben twee keer afgeschreven. Los dit vandaag alstublieft op.

choice · routeringWelk team moet dit behandelen?
facturatie0.81
techniek0.09
verkoop0.04
overig0.06
result.level = "L0"Voorbeelduitvoer
Het belangrijke onderscheid

AnyJev is een toolkit, geen nieuwe set modelgewichten.

Het gekozen causale taalmodel blijft behouden; alleen de manier waarop een beslissing met een afgebakende antwoordruimte wordt uitgelezen verandert. Daardoor is AnyJev eerder een beslislaag dan een zelfstandig model zoals een fijngetunede classifier.

Wat het is

Een getypeerde uitlezing voor open modellen

Je definieert context en een of meer vragen met een afgebakende antwoordruimte. AnyJev geeft verdelingen voor categorieën, een kans voor ja/nee-vragen of een verwachte waarde op een geordende schaal.

Wat het toevoegt

Niveaus voor biascorrectie en kalibratie

Ruwe antwoordtoken-logits kunnen een label of positie bevoordelen. AnyJev vermeldt welk correctieniveau elke beslissing heeft opgeleverd, zodat de applicatie het verwachte niveau kan afdwingen.

Wat het niet is

Een open kopie van TypeSafe Jev

Het project publiceert of reproduceert TypeSafe's private gewichten, trainingsdata en RLCD-methode niet. Een vergelijkbare requestvorm bewijst geen gelijkwaardig gedrag.

Ruw → L0 → L1 → L2

Vier niveaus maken de onderbouwing van een beslissing expliciet.

L0 werkt echt zonder training. Hogere niveaus gebruiken gelabelde voorbeelden; L2 past een kleine vraagspecifieke uitvoerlaag aan zonder de gewichten van het basismodel te wijzigen.

RuwGeen labels

Leest een beperkte softmax over logits van antwoordtokens.

Geen correctie voor optiepositie of labelvoorkeur.

L0Geen labels

Roteert opties en corrigeert een geschatte labelprior.

Stabieler, maar kansen zijn niet voor de taak gekalibreerd.

L1100–500 labels

Voegt temperatuurkalibratie toe voor één model en vraag.

Verbetert betrouwbaarheidsinschattingen, maar herstelt geen verkeerde rangorde.

L2100–300 labels

Past een kleine analytische uitvoerlaag toe op een tussenliggende verborgen toestand.

Specifiek voor één model en vraag; vereist lokale toegang tot verborgen toestanden.

Voorbeeld van een lokale workflow

Routeer een supportticket en controleer een voorgestelde actie.

Dit voorbeeld volgt de openbare API: een Qwen-model blijft lokaal, AnyJev leest twee beslissingen met een afgebakende antwoordruimte en gewone applicatiecode bepaalt de vervolgstap.

Installeer de Transformers-backend
pip install "anyjev[hf]"

Python 3.10 of nieuwer is vereist. Bij de eerste echte run wordt ook het gekozen open model gedownload.

PythonChoice + Noul
from anyjev import Decider, Question
from anyjev.backends.hf import HFBackend

decider = Decider(HFBackend("Qwen/Qwen3-8B"))

route = Question.choice(
    "Which team should handle this?",
    ["billing", "technical", "sales", "other"],
    name="route",
)
risky = Question.noul(
    "Is this tool call destructive or irreversible?",
    name="risky",
)

result = decider.decide(
    {"message": "I was charged twice.", "tool_call": "refund"},
    [route, risky],
)

result["route"].distribution
result["risky"].p_true
result.level  # "L0"
01

Definieer de antwoordruimte

De applicatie noemt de toegestane teams en vraagt of de voorgestelde toolcall riskant is.

02

Lees begrensde verdelingen

Er wordt geen vrij antwoord gegenereerd. Het resultaat bevat een verdeling of kans en het gebruikte niveau.

03

Houd beleid in code

Je code stelt drempels in, stuurt onzekere gevallen naar controle en voorkomt effecten als het risico te hoog is.

Benchmark van het project

Het hoofdresultaat gaat om veiliger automatiseren, niet alleen om nauwkeurigheid.

AnyJev rapporteert de volgende Qwen3-8B-resultaten op 300 BANKING77-testitems. De cijfers komen van vastgelegde benchmarkartefacten van de auteurs; Jev AI Dev heeft de benchmark niet onafhankelijk herhaald.

MetriekRuwe logitsAnyJev L0AnyJev L1
Antwoorden die omslaan na omkering van opties0.2300.0730.077
Nauwkeurigheid0.7470.8030.807
Verwachte kalibratiefout0.2400.1840.095
Dekking bij maximaal 5% fout7.7%46.3%52.0%

In deze test steeg de nauwkeurigheid van 0,747 naar 0,807. De grotere operationele verandering was de dekking bij maximaal 5% fout: 7,7% voor ruwe logits en 52,0% na L1-kalibratie. Deze schatting komt uit een kleine testset en is niet zonder validatie overdraagbaar.

Bekijk de benchmark en ablaties
Communityvideo · 29 seconden

Bekijk kort hoe een LLM een beslisser in Jev-stijl wordt.

Data Science in your pocket publiceerde deze korte introductie na de komst van AnyJev. Het is uitleg van een derde partij, geen officiële Nokia Applied Research-demo of onafhankelijke benchmark.

Bekijk ‘How to convert any LLM into Jev AI?’ op YouTube
Praktijktest uit de community · September 2026

Een test met 20 tickets liet de afweging tussen nauwkeurigheid en latentie zien.

WquGuru vergeleek officiële Jev en drie open projecten op één MacBook met 20 Chinese supporttickets. De thread bevat video, timing en nauwkeurigheid per project.

@wquguru · Praktische vergelijking

AnyJev met Qwen3-4B beantwoordde naar verluidt 19 van 20 tickets correct.

Nauwkeurigheid95%19 / 20 tickets
Latentie~4sgerapporteerd per test
Testset20Chinese supporttickets

Dezelfde thread meldt 20/20 voor officiële Jev, 65% voor Laya en 35% voor djev. Zie dit als een vroege communitywaarneming, niet als gecontroleerde benchmark: één kleine vragenset, één machine en projectspecifieke configuraties.

Bekijk vergelijking en video op X
@MorrisMz81 · Auteur van AnyJev
“The latency is real. We went correctness first.”

Jiamu ‘Morris’ Zhang zei dat de infrastructuur voor model-serving in de eerste release nog niet was geoptimaliseerd. Hij beschreef AnyJev als methode voor modellen die een team al aanbiedt en meldde dat optimalisatie voor vLLM/SGLang begon.

Lees de volledige reactie van de auteur
@Marktechpost · Mediaoverzicht

Een beknopte rondleiding door het project en de vastgelegde benchmark.

MarkTechPost vat de getypeerde uitlezing, het verschil tussen L0 en L1 en de BANKING77-resultaten samen. Die cijfers komen uit de eigen benchmark van het project, niet uit een onafhankelijke replicatie.

Bewijsgrens: Jev AI Dev heeft gecontroleerd dat de posts deze beweringen bevatten, maar de communitytest niet gereproduceerd. Aantallen weergaven en interacties ontbreken bewust omdat ze veranderen.

Voor productie

Weet wat de huidige release niet oplost.

Getypeerde uitvoer lost één integratieprobleem op. Een semantisch oordeel wordt daarmee niet automatisch juist, veilig of overdraagbaar naar een andere verdeling.

01

L0 gebruikt meer rekenwerk bij brede keuzes

Een keuze met K opties gebruikt cyclische rotaties; de correctie zonder labels vraagt dus K prefills. Meer inferentie levert betere stabiliteit tegenover volgorde op.

02

L1 en L2 vereisen labels uit de workflow

Kalibratie en uitvoerlagen horen bij een specifiek model en een specifieke vraag. Bij een wijziging moeten ze opnieuw worden opgebouwd of gevalideerd.

03

L2 vereist toegang tot verborgen toestanden

Het huidige L2-pad gebruikt een lokale Transformers-backend. Engines voor model-serving zoals vLLM en SGLang staan op de roadmap.

04

Gepubliceerde cijfers zijn niet je acceptatietest

Meet nauwkeurigheid, kalibratie, volgordegevoeligheid en onthouding op representatieve data voordat een kans een belangrijke actie stuurt.

Primaire bronnen

Controleer het project bij de bron.

AnyJev verandert snel. Controleer de nieuwste release, backends en beperkingen voordat je erop bouwt.

Verken het ecosysteem

Vergelijk AnyJev met andere System One-communityprojecten.

AnyJev past een open causaal LLM aan op het moment van beslissen. Het bredere ecosysteem bevat ook doelgericht getrainde modellen, lokale runtimes en API-compatibele experimenten.

Lees de System One-gids Bekijk communityprojecten