Unabhängiger Projektleitfaden · geprüft am 25.09.2026

AnyJev macht aus einem offenen LLM ein typisiertes Entscheidungsmodell.

AnyJev ist ein quelloffenes Python-Toolkit von Nokia Applied Research. Es liest Choice-, Score- und Noul-Entscheidungen aus kausalen Sprachmodellen und ergänzt Korrekturen für Reihenfolgenbias sowie Wahrscheinlichkeitskalibrierung.

Wichtig: AnyJev ist weder ein neues Basismodell noch eine offene Version der Jev-Gewichte von TypeSafe oder ein offizielles Jev-Produkt. Es ist ein unabhängiger Ansatz, um bereits betriebene Modelle mit einer Jev-ähnlichen Entscheidungsschicht zu versehen.

Betreuung
Nokia Applied Research
Lizenz
Apache-2.0
Paket
anyjev auf PyPI
Reifegrad
Pre-Alpha
AnyJev · L0state → typed decisions
Zustand

Meine Karte wurde doppelt belastet. Bitte lösen Sie das heute.

choice · RoutingWelches Team soll den Fall bearbeiten?
Abrechnung0.81
Technik0.09
Vertrieb0.04
Sonstiges0.06
result.level = "L0"Beispielausgabe
Der entscheidende Unterschied

AnyJev ist ein Toolkit, kein weiterer Satz Modellgewichte.

Das gewählte kausale Sprachmodell bleibt unverändert; AnyJev ändert lediglich, wie Entscheidungen mit festgelegtem Antwortbereich ausgelesen werden. Damit ist es eher eine Entscheidungsschicht als ein separat feinabgestimmter Klassifikator.

Es ist

Eine typisierte Ausleseschicht für offene Modelle

Sie definieren einen Zustand und Fragen mit festgelegtem Antwortbereich. AnyJev liefert Verteilungen für Kategorien, eine Wahrscheinlichkeit für Ja/Nein-Fragen oder einen Erwartungswert für geordnete Scores.

Es ergänzt

Bias-Korrektur und Kalibrierungsstufen

Rohe Antwort-Token-Logits können Labels oder Positionen bevorzugen. AnyJev weist die verwendete Korrekturstufe aus, sodass Anwendungen die erwartete Korrekturstufe verlangen können.

Es ist nicht

Eine offene Kopie von TypeSafe Jev

Das Projekt veröffentlicht oder reproduziert weder private TypeSafe-Gewichte noch Trainingsdaten oder die RLCD-Methode. Ähnliche Anfrageformen bedeuten kein gleichwertiges Verhalten.

Raw → L0 → L1 → L2

Vier Stufen machen die Entscheidungsgrundlage sichtbar.

L0 kommt tatsächlich ohne Trainingslabels aus. Höhere Stufen verwenden gelabelte Beispiele; L2 passt einen kleinen, fragespezifischen Ausgabekopf an, ohne die Gewichte des Basismodells zu verändern.

RawKeine Labels

Wendet ein begrenztes Softmax auf Antwort-Token-Logits an.

Keine Korrektur für Position oder Labelpräferenz.

L0Keine Labels

Rotiert Optionen und korrigiert einen geschätzten Label-Prior.

Stabiler gegenüber Reihenfolge, aber nicht auf die Aufgabe kalibriert.

L1100–500 Labels

Fügt Temperaturkalibrierung für ein Modell und eine Frage hinzu.

Verbessert Konfidenzschätzungen, korrigiert aber keine falsche Rangfolge.

L2100–300 Labels

Passt einen kleinen Closed-Form-Ausgabekopf auf einem Zwischenzustand an.

Modell- und fragespezifisch; benötigt lokalen Zugriff auf Hidden States.

Beispiel für einen lokalen Workflow

Ein Support-Ticket routen und eine geplante Aktion prüfen.

Das kleine Beispiel entspricht der öffentlichen API: Qwen bleibt lokal, AnyJev liest zwei Entscheidungen mit festgelegtem Antwortbereich aus, und normaler Code bestimmt den nächsten Schritt.

Transformers-Backend installieren
pip install "anyjev[hf]"

Erfordert Python 3.10 oder neuer. Beim ersten echten Lauf wird auch das gewählte offene Modell geladen.

PythonChoice + Noul
from anyjev import Decider, Question
from anyjev.backends.hf import HFBackend

decider = Decider(HFBackend("Qwen/Qwen3-8B"))

route = Question.choice(
    "Which team should handle this?",
    ["billing", "technical", "sales", "other"],
    name="route",
)
risky = Question.noul(
    "Is this tool call destructive or irreversible?",
    name="risky",
)

result = decider.decide(
    {"message": "I was charged twice.", "tool_call": "refund"},
    [route, risky],
)

result["route"].distribution
result["risky"].p_true
result.level  # "L0"
01

Antwortbereich definieren

Die Anwendung nennt die zulässigen Teams und fragt, ob der geplante Tool-Aufruf destruktiv ist.

02

Begrenzte Verteilungen lesen

Es entsteht kein Freitext. Das Ergebnis enthält eine Verteilung oder Wahrscheinlichkeit sowie die verwendete Stufe.

03

Richtlinien im Code behalten

Ihr Code setzt Schwellenwerte, leitet unklare Fälle weiter und blockiert riskante Nebenwirkungen.

Benchmark des Projekts

Entscheidend ist nicht nur Genauigkeit, sondern sicher automatisierbare Abdeckung.

AnyJev veröffentlicht folgende Ergebnisse für Qwen3-8B auf 300 BANKING77-Testfällen. Die Werte stammen aus den eingecheckten Benchmark-Artefakten der Autoren; Jev AI Dev hat den Lauf nicht unabhängig wiederholt.

KennzahlRohe LogitsAnyJev L0AnyJev L1
Antwortwechsel nach Umkehr der Optionen0.2300.0730.077
Genauigkeit0.7470.8030.807
Erwarteter Kalibrierungsfehler0.2400.1840.095
Abdeckung bei höchstens 5 % Fehler7.7%46.3%52.0%

Die Genauigkeit stieg in diesem Test von 0,747 auf 0,807. Operativ deutlicher war die gemeldete Abdeckung bei höchstens 5 % Fehler: 7,7 % für rohe Logits und 52,0 % nach L1-Kalibrierung. Die kleine Testmenge lässt sich nicht auf andere Abläufe übertragen.

Benchmark und Ablationen prüfen
Community-Video · 29 Sekunden

Kurzer Überblick: Ein LLM als Jev-ähnlichen Entscheider nutzen.

Data Science in your pocket veröffentlichte diese kurze Einführung nach dem Start von AnyJev. Sie ist weder eine offizielle Demo von Nokia Applied Research noch ein unabhängiger Benchmark.

„How to convert any LLM into Jev AI?“ auf YouTube ansehen
Community-Praxistest · September 2026

Ein Test mit 20 Tickets zeigte den Zielkonflikt zwischen Genauigkeit und Latenz.

WquGuru verglich offizielles Jev und drei offene Projekte auf einem MacBook mit 20 chinesischen Support-Tickets. Der Thread enthält Video, Laufzeiten und Genauigkeit je Projekt.

@wquguru · Praxisvergleich

AnyJev mit Qwen3-4B beantwortete laut Bericht 19 von 20 Tickets richtig.

Genauigkeit95%19 / 20 Tickets
Latenz~4sgemeldeter Einzeltest
Umfang20chinesische Support-Tickets

Derselbe Thread meldet 20/20 für offizielles Jev, 65 % für Laya und 35 % für djev. Das ist eine frühe Community-Beobachtung, kein kontrollierter Benchmark: kleine Fragenmenge, ein Gerät und projektspezifische Modellkonfigurationen.

Vergleich und Video auf X ansehen
@MorrisMz81 · AnyJev-Autor
“The latency is real. We went correctness first.”

Jiamu „Morris“ Zhang erklärte, dass der Serving-Pfad der ersten Version noch nicht optimiert war. AnyJev sei keine weitere Jev-Variante, sondern eine Methode, bereits betriebene Modelle als Entscheidungsschicht zu nutzen; die Optimierung für vLLM/SGLang habe gerade begonnen.

Vollständige Antwort lesen
@Marktechpost · Medienüberblick

Kompakter Rundgang durch Projekt und eingecheckten Benchmark.

MarkTechPost fasst typisierte Auslesung, den Unterschied zwischen L0 und L1 sowie die BANKING77-Ergebnisse zusammen. Die Zahlen stammen aus dem Projektbenchmark und wurden nicht separat repliziert.

Evidenzgrenze: Jev AI Dev hat geprüft, dass die Beiträge diese Aussagen enthalten, den Community-Test aber nicht reproduziert. Aufruf- und Interaktionszahlen fehlen bewusst, da sie sich laufend ändern.

Vor dem Produktiveinsatz

Was die aktuelle Version nicht löst.

Typisierte Ausgabe löst ein Schnittstellenproblem. Sie macht eine semantische Entscheidung nicht automatisch richtig, sicher oder auf eine andere Verteilung übertragbar.

01

L0 benötigt bei vielen Optionen mehr Rechenaufwand

Eine Choice mit K Optionen nutzt zyklische Rotationen; die label-freie Korrektur braucht daher K Prefills. Rechenaufwand wird gegen Reihenfolgenstabilität getauscht.

02

L1 und L2 benötigen Workflow-Labels

Kalibrierung und Ausgabeköpfe gehören zu einem bestimmten Modell und einer Frage. Ändert sich eines davon, ist erneute Erstellung oder Validierung nötig.

03

L2 benötigt Zugriff auf Hidden States

Der aktuelle L2-Pfad verwendet ein lokales Transformers-Backend. Serving-Engines wie vLLM und SGLang stehen auf der Roadmap.

04

Veröffentlichte Zahlen sind kein Abnahmetest

Messen Sie Genauigkeit, Kalibrierung, Reihenfolgensensitivität und Ablehnungsstrategie auf repräsentativen Daten, bevor eine Wahrscheinlichkeit wichtige Aktionen steuert.

Primärquellen

Prüfen Sie das Projekt an der Quelle.

AnyJev entwickelt sich schnell. Prüfen Sie vor der Integration die aktuelle Version, unterstützte Backends und Einschränkungen.

Ökosystem erkunden

Vergleichen Sie AnyJev mit weiteren System-One-Projekten der Community.

AnyJev passt ein vorhandenes offenes kausales Sprachmodell zur Entscheidungszeit an. Daneben gibt es eigens trainierte Modelle, lokale Laufzeiten und API-kompatible Experimente.

System-One-Leitfaden lesen Community-Projekte ansehen