Typovaný výstup pre otvorené modely
Definujete kontext a otázky s pevne danou množinou odpovedí. AnyJev vráti rozdelenie pre kategorickú voľbu, pravdepodobnosť pre otázku áno/nie alebo očakávanú hodnotu na zoradenej škále.
AnyJev je open-source súprava nástrojov v Pythone od Nokia Applied Research. Z kauzálnych jazykových modelov číta rozhodnutia Choice, Score a Noul a koriguje skreslenie poradím možností aj kalibráciu pravdepodobností.
Dôležité: AnyJev nie je nový základný model, otvorené vydanie váh TypeSafe Jev ani oficiálny produkt Jev. Ide o nezávislý spôsob vytvárania rozhodnutí vo formáte Jev nad modelmi, ktoré prevádzkujete sami.
anyjev na PyPIstate → typed decisionsSuma mi bola zaúčtovaná dvakrát. Vyriešte to, prosím, ešte dnes.
result.level = "L0"Ukážkový výstupZvolený kauzálny model zostáva rovnaký; mení sa spôsob čítania rozhodnutia s pevne danou množinou odpovedí. AnyJev je preto bližšie k rozhodovacej vrstve než k samostatnému doladenému klasifikátoru.
Definujete kontext a otázky s pevne danou množinou odpovedí. AnyJev vráti rozdelenie pre kategorickú voľbu, pravdepodobnosť pre otázku áno/nie alebo očakávanú hodnotu na zoradenej škále.
Surové logity tokenov odpovede môžu zvýhodniť štítok alebo jeho pozíciu. AnyJev uvádza úroveň korekcie každého rozhodnutia, takže ju aplikácia môže vyžadovať.
Projekt nezverejňuje ani nereprodukuje súkromné váhy, tréningové dáta či metódu RLCD spoločnosti TypeSafe. Podobný tvar požiadavky nedokazuje rovnaké správanie.
L0 skutočne funguje bez tréningu. Vyššie úrovne používajú označené príklady; L2 prispôsobí malú výstupnú vrstvu konkrétnej otázke bez zmeny váh základného modelu.
Bez korekcie pozície možnosti alebo preferencie štítka.
Stabilnejšie, ale pravdepodobnosti nie sú kalibrované pre úlohu.
Spresňuje odhad istoty, ale neopraví chybné poradie.
Je viazaná na model a otázku; vyžaduje lokálny prístup ku skrytým stavom.
Príklad zodpovedá verejnému API: model Qwen zostáva lokálny, AnyJev prečíta dve ohraničené rozhodnutia a bežný kód aplikácie určí ďalší krok.
pip install "anyjev[hf]"Vyžaduje sa Python 3.10 alebo novší. Pri prvom skutočnom spustení sa stiahne aj vybraný otvorený model.
Choice + Noulfrom anyjev import Decider, Question
from anyjev.backends.hf import HFBackend
decider = Decider(HFBackend("Qwen/Qwen3-8B"))
route = Question.choice(
"Which team should handle this?",
["billing", "technical", "sales", "other"],
name="route",
)
risky = Question.noul(
"Is this tool call destructive or irreversible?",
name="risky",
)
result = decider.decide(
{"message": "I was charged twice.", "tool_call": "refund"},
[route, risky],
)
result["route"].distribution
result["risky"].p_true
result.level # "L0"Aplikácia uvedie povolené tímy a opýta sa, či je navrhnuté volanie nástroja rizikové.
Nevytvára sa voľný text. Výsledok obsahuje rozdelenie alebo pravdepodobnosť a použitú úroveň.
Kód nastaví prahy, pošle neisté prípady na kontrolu a zablokuje vedľajšie účinky pri príliš vysokom riziku.
AnyJev uvádza nasledujúce výsledky Qwen3-8B na 300 testovacích položkách BANKING77. Čísla pochádzajú od autorov z artefaktov v repozitári; Jev AI Dev benchmark nezávisle nezopakoval.
| Metrika | Surové logity | AnyJev L0 | AnyJev L1 |
|---|---|---|---|
| Zmena odpovede po obrátení možností | 0.230 | 0.073 | 0.077 |
| Presnosť | 0.747 | 0.803 | 0.807 |
| Očakávaná chyba kalibrácie | 0.240 | 0.184 | 0.095 |
| Pokrytie pri najviac 5% chybe | 7.7% | 46.3% | 52.0% |
Presnosť v teste vzrástla z 0,747 na 0,807. Väčšou prevádzkovou zmenou bolo pokrytie pri najviac 5% chybe: 7,7 % pri surových logitoch a 52,0 % po kalibrácii L1. Odhad vychádza z malej sady a pre iný postup vyžaduje validáciu.
Pozrieť benchmark a ablácieData Science in your pocket zverejnil toto krátke predstavenie po vydaní AnyJev. Ide o vysvetlenie tretej strany, nie oficiálne demo Nokia Applied Research ani nezávislý benchmark.
Prehrať „How to convert any LLM into Jev AI?“ na YouTubeWquGuru porovnal oficiálny Jev a tri otvorené projekty na jednom MacBooku s 20 čínskymi požiadavkami podpory. Vlákno obsahuje video, časy a presnosť projektov.
Rovnaké vlákno uvádza 20/20 pre oficiálny Jev, 65 % pre Laya a 35 % pre djev. Berte to ako skoré pozorovanie komunity, nie kontrolovaný benchmark: malá sada, jeden stroj a odlišné nastavenia projektov.
Zobraziť porovnanie a video na X“The latency is real. We went correctness first.”
Jiamu „Morris“ Zhang uviedol, že prvá verzia ešte neoptimalizovala cestu obsluhy. AnyJev opísal ako metódu pre už prevádzkované modely a spomenul začiatok optimalizácie vLLM/SGLang.
Prečítať celú odpoveď autoraMarkTechPost sumarizuje typovaný výstup, rozdiel L0/L1 a výsledky BANKING77. Čísla sú z benchmarku projektu, nie z nezávislej replikácie.
Hranica dôkazov: Jev AI Dev overil, že príspevky tieto tvrdenia obsahujú, ale test komunity nereprodukoval. Počty zobrazení a reakcií sú vynechané, pretože sa menia.
Typovaný výstup odstráni jeden integračný problém. Sémantický úsudok tým nie je automaticky správny, bezpečný ani prenositeľný.
Voľba s K možnosťami používa cyklické rotácie, takže korekcia bez štítkov vyžaduje K prefillov. Viac inferencie zvyšuje stabilitu voči poradiu.
Kalibrácia a hlavy patria konkrétnemu modelu a otázke. Pri zmene ich treba znovu zostaviť alebo overiť.
Súčasná cesta L2 používa lokálny backend Transformers. Enginy vLLM a SGLang sú v pláne projektu.
Pred riadením dôležitej akcie pravdepodobnosťou zmerajte presnosť, kalibráciu, citlivosť na poradie a odmietnutie na reprezentatívnych dátach.
AnyJev sa rýchlo vyvíja. Pred použitím overte najnovšiu verziu, backendy a obmedzenia.
AnyJev upravuje otvorený kauzálny LLM v okamihu rozhodnutia. Ekosystém zahŕňa aj účelovo trénované modely, lokálne behové prostredia a experimenty kompatibilné s API.