Een getypeerde uitlezing voor open modellen
Je definieert context en een of meer vragen met een afgebakende antwoordruimte. AnyJev geeft verdelingen voor categorieën, een kans voor ja/nee-vragen of een verwachte waarde op een geordende schaal.
AnyJev is een opensource-Pythontoolkit van Nokia Applied Research. De toolkit leest Choice-, Score- en Noul-beslissingen uit causale taalmodellen en corrigeert vertekening door optievolgorde en kalibratie van kansen.
Belangrijk: AnyJev is geen nieuw basismodel, geen open uitgave van TypeSafe's Jev-gewichten en geen officieel Jev-product. Het is een onafhankelijke manier om beslissingen in Jev-formaat te bouwen op modellen die je zelf uitvoert.
anyjev op PyPIstate → typed decisionsIk ben twee keer afgeschreven. Los dit vandaag alstublieft op.
result.level = "L0"VoorbeelduitvoerHet gekozen causale taalmodel blijft behouden; alleen de manier waarop een beslissing met een afgebakende antwoordruimte wordt uitgelezen verandert. Daardoor is AnyJev eerder een beslislaag dan een zelfstandig model zoals een fijngetunede classifier.
Je definieert context en een of meer vragen met een afgebakende antwoordruimte. AnyJev geeft verdelingen voor categorieën, een kans voor ja/nee-vragen of een verwachte waarde op een geordende schaal.
Ruwe antwoordtoken-logits kunnen een label of positie bevoordelen. AnyJev vermeldt welk correctieniveau elke beslissing heeft opgeleverd, zodat de applicatie het verwachte niveau kan afdwingen.
Het project publiceert of reproduceert TypeSafe's private gewichten, trainingsdata en RLCD-methode niet. Een vergelijkbare requestvorm bewijst geen gelijkwaardig gedrag.
L0 werkt echt zonder training. Hogere niveaus gebruiken gelabelde voorbeelden; L2 past een kleine vraagspecifieke uitvoerlaag aan zonder de gewichten van het basismodel te wijzigen.
Geen correctie voor optiepositie of labelvoorkeur.
Stabieler, maar kansen zijn niet voor de taak gekalibreerd.
Verbetert betrouwbaarheidsinschattingen, maar herstelt geen verkeerde rangorde.
Specifiek voor één model en vraag; vereist lokale toegang tot verborgen toestanden.
Dit voorbeeld volgt de openbare API: een Qwen-model blijft lokaal, AnyJev leest twee beslissingen met een afgebakende antwoordruimte en gewone applicatiecode bepaalt de vervolgstap.
pip install "anyjev[hf]"Python 3.10 of nieuwer is vereist. Bij de eerste echte run wordt ook het gekozen open model gedownload.
Choice + Noulfrom anyjev import Decider, Question
from anyjev.backends.hf import HFBackend
decider = Decider(HFBackend("Qwen/Qwen3-8B"))
route = Question.choice(
"Which team should handle this?",
["billing", "technical", "sales", "other"],
name="route",
)
risky = Question.noul(
"Is this tool call destructive or irreversible?",
name="risky",
)
result = decider.decide(
{"message": "I was charged twice.", "tool_call": "refund"},
[route, risky],
)
result["route"].distribution
result["risky"].p_true
result.level # "L0"De applicatie noemt de toegestane teams en vraagt of de voorgestelde toolcall riskant is.
Er wordt geen vrij antwoord gegenereerd. Het resultaat bevat een verdeling of kans en het gebruikte niveau.
Je code stelt drempels in, stuurt onzekere gevallen naar controle en voorkomt effecten als het risico te hoog is.
AnyJev rapporteert de volgende Qwen3-8B-resultaten op 300 BANKING77-testitems. De cijfers komen van vastgelegde benchmarkartefacten van de auteurs; Jev AI Dev heeft de benchmark niet onafhankelijk herhaald.
| Metriek | Ruwe logits | AnyJev L0 | AnyJev L1 |
|---|---|---|---|
| Antwoorden die omslaan na omkering van opties | 0.230 | 0.073 | 0.077 |
| Nauwkeurigheid | 0.747 | 0.803 | 0.807 |
| Verwachte kalibratiefout | 0.240 | 0.184 | 0.095 |
| Dekking bij maximaal 5% fout | 7.7% | 46.3% | 52.0% |
In deze test steeg de nauwkeurigheid van 0,747 naar 0,807. De grotere operationele verandering was de dekking bij maximaal 5% fout: 7,7% voor ruwe logits en 52,0% na L1-kalibratie. Deze schatting komt uit een kleine testset en is niet zonder validatie overdraagbaar.
Bekijk de benchmark en ablatiesData Science in your pocket publiceerde deze korte introductie na de komst van AnyJev. Het is uitleg van een derde partij, geen officiële Nokia Applied Research-demo of onafhankelijke benchmark.
Bekijk ‘How to convert any LLM into Jev AI?’ op YouTubeWquGuru vergeleek officiële Jev en drie open projecten op één MacBook met 20 Chinese supporttickets. De thread bevat video, timing en nauwkeurigheid per project.
Dezelfde thread meldt 20/20 voor officiële Jev, 65% voor Laya en 35% voor djev. Zie dit als een vroege communitywaarneming, niet als gecontroleerde benchmark: één kleine vragenset, één machine en projectspecifieke configuraties.
Bekijk vergelijking en video op X“The latency is real. We went correctness first.”
Jiamu ‘Morris’ Zhang zei dat de infrastructuur voor model-serving in de eerste release nog niet was geoptimaliseerd. Hij beschreef AnyJev als methode voor modellen die een team al aanbiedt en meldde dat optimalisatie voor vLLM/SGLang begon.
Lees de volledige reactie van de auteurMarkTechPost vat de getypeerde uitlezing, het verschil tussen L0 en L1 en de BANKING77-resultaten samen. Die cijfers komen uit de eigen benchmark van het project, niet uit een onafhankelijke replicatie.
Bewijsgrens: Jev AI Dev heeft gecontroleerd dat de posts deze beweringen bevatten, maar de communitytest niet gereproduceerd. Aantallen weergaven en interacties ontbreken bewust omdat ze veranderen.
Getypeerde uitvoer lost één integratieprobleem op. Een semantisch oordeel wordt daarmee niet automatisch juist, veilig of overdraagbaar naar een andere verdeling.
Een keuze met K opties gebruikt cyclische rotaties; de correctie zonder labels vraagt dus K prefills. Meer inferentie levert betere stabiliteit tegenover volgorde op.
Kalibratie en uitvoerlagen horen bij een specifiek model en een specifieke vraag. Bij een wijziging moeten ze opnieuw worden opgebouwd of gevalideerd.
Het huidige L2-pad gebruikt een lokale Transformers-backend. Engines voor model-serving zoals vLLM en SGLang staan op de roadmap.
Meet nauwkeurigheid, kalibratie, volgordegevoeligheid en onthouding op representatieve data voordat een kans een belangrijke actie stuurt.
AnyJev verandert snel. Controleer de nieuwste release, backends en beperkingen voordat je erop bouwt.
AnyJev past een open causaal LLM aan op het moment van beslissen. Het bredere ecosysteem bevat ook doelgericht getrainde modellen, lokale runtimes en API-compatibele experimenten.