Typovaný výstup pro otevřené modely
Definujete kontext a otázky s pevně danou sadou odpovědí. AnyJev vrátí rozdělení pro kategorickou volbu, pravděpodobnost pro otázku ano/ne nebo očekávanou hodnotu na seřazené škále.
AnyJev je open-source sada nástrojů v Pythonu od Nokia Applied Research. Z kauzálních jazykových modelů čte rozhodnutí Choice, Score a Noul a koriguje zkreslení pořadím možností i kalibraci pravděpodobností.
Důležité: AnyJev není nový základní model, otevřené vydání vah TypeSafe Jev ani oficiální produkt Jev. Jde o nezávislý způsob, jak nad modely spuštěnými ve vlastním prostředí vytvářet rozhodnutí ve formátu Jev.
anyjev na PyPIstate → typed decisionsČástka mi byla stržena dvakrát. Prosím vyřešte to dnes.
result.level = "L0"Ukázkový výstupZvolený kauzální model zůstává beze změny; mění se způsob čtení rozhodnutí s pevně danou sadou odpovědí. AnyJev je tak bližší rozhodovací vrstvě než samostatnému doladěnému klasifikátoru.
Definujete kontext a otázky s pevně danou sadou odpovědí. AnyJev vrátí rozdělení pro kategorickou volbu, pravděpodobnost pro otázku ano/ne nebo očekávanou hodnotu na seřazené škále.
Surové logity tokenů odpovědi mohou zvýhodnit štítek nebo jeho pozici. AnyJev uvádí úroveň korekce každého rozhodnutí, takže ji aplikace může vyžadovat.
Projekt nezveřejňuje ani nereprodukuje soukromé váhy, trénovací data či metodu RLCD společnosti TypeSafe. Podobný tvar požadavku nedokazuje stejné chování.
L0 skutečně funguje bez tréninku. Vyšší úrovně používají označené příklady; L2 přizpůsobí malou výstupní vrstvu konkrétní otázce bez změny vah základního modelu.
Bez korekce pozice možnosti nebo preference štítku.
Stabilnější, ale pravděpodobnosti nejsou kalibrovány pro úlohu.
Zpřesňuje odhad jistoty, ale neopraví chybné pořadí.
Je vázaná na model a otázku; vyžaduje lokální přístup ke skrytým stavům.
Příklad odpovídá veřejnému API: model Qwen zůstává lokální, AnyJev přečte dvě omezená rozhodnutí a běžný kód aplikace určí další krok.
pip install "anyjev[hf]"Je vyžadován Python 3.10 nebo novější. Při prvním skutečném spuštění se stáhne i vybraný otevřený model.
Choice + Noulfrom anyjev import Decider, Question
from anyjev.backends.hf import HFBackend
decider = Decider(HFBackend("Qwen/Qwen3-8B"))
route = Question.choice(
"Which team should handle this?",
["billing", "technical", "sales", "other"],
name="route",
)
risky = Question.noul(
"Is this tool call destructive or irreversible?",
name="risky",
)
result = decider.decide(
{"message": "I was charged twice.", "tool_call": "refund"},
[route, risky],
)
result["route"].distribution
result["risky"].p_true
result.level # "L0"Aplikace uvede povolené týmy a zeptá se, zda je navržené volání nástroje rizikové.
Nevytváří se volný text. Výsledek obsahuje rozdělení nebo pravděpodobnost a použitou úroveň.
Kód nastavuje prahy, posílá nejisté případy ke kontrole a blokuje vedlejší účinky při příliš vysokém riziku.
AnyJev uvádí následující výsledky Qwen3-8B na 300 testovacích položkách BANKING77. Čísla pocházejí od autorů z artefaktů v repozitáři; Jev AI Dev benchmark nezávisle neopakoval.
| Metrika | Surové logity | AnyJev L0 | AnyJev L1 |
|---|---|---|---|
| Změna odpovědi po obrácení možností | 0.230 | 0.073 | 0.077 |
| Přesnost | 0.747 | 0.803 | 0.807 |
| Očekávaná chyba kalibrace | 0.240 | 0.184 | 0.095 |
| Pokrytí při nejvýše 5% chybě | 7.7% | 46.3% | 52.0% |
Přesnost v testu vzrostla z 0,747 na 0,807. Větší provozní změnou bylo pokrytí při nejvýše 5% chybě: 7,7 % u surových logitů a 52,0 % po kalibraci L1. Odhad vychází z malé sady a pro jiný postup vyžaduje validaci.
Prohlédnout benchmark a ablaceData Science in your pocket zveřejnil toto krátké představení po vydání AnyJev. Jde o vysvětlení třetí strany, nikoli oficiální demo Nokia Applied Research či nezávislý benchmark.
Přehrát „How to convert any LLM into Jev AI?“ na YouTubeWquGuru porovnal oficiální Jev a tři otevřené projekty na jednom MacBooku s 20 čínskými požadavky podpory. Vlákno obsahuje video, časy a přesnost projektů.
Stejné vlákno uvádí 20/20 pro oficiální Jev, 65 % pro Laya a 35 % pro djev. Berte to jako rané pozorování komunity, ne kontrolovaný benchmark: malá sada, jeden stroj a různá nastavení projektů.
Zobrazit srovnání a video na X“The latency is real. We went correctness first.”
Jiamu „Morris“ Zhang uvedl, že první verze dosud neoptimalizovala cestu obsluhy. AnyJev popsal jako metodu pro již provozované modely a zmínil zahájení optimalizace vLLM/SGLang.
Přečíst celou odpověď autoraMarkTechPost shrnuje typovaný výstup, rozdíl L0/L1 a výsledky BANKING77. Čísla jsou z benchmarku projektu, nikoli z nezávislé replikace.
Hranice důkazů: Jev AI Dev ověřil, že příspěvky tato tvrzení obsahují, ale test komunity nereprodukoval. Počty zhlédnutí a reakcí jsou vynechány, protože se mění.
Typovaný výstup odstraní jeden integrační problém. Sémantický úsudek tím není automaticky správný, bezpečný ani přenositelný.
Volba s K možnostmi používá cyklické rotace, takže korekce bez štítků vyžaduje K prefillů. Více inferencí zvyšuje stabilitu vůči pořadí.
Kalibrace a hlavy patří konkrétnímu modelu a otázce. Při změně je nutné je znovu sestavit nebo ověřit.
Současná cesta L2 používá lokální backend Transformers. Enginy vLLM a SGLang jsou v plánu projektu.
Než pravděpodobnost začne řídit důležitou akci, změřte přesnost, kalibraci, citlivost na pořadí a odmítnutí na reprezentativních datech.
AnyJev se rychle vyvíjí. Před použitím ověřte nejnovější verzi, backendy a omezení.
AnyJev upravuje otevřený kauzální LLM v okamžiku rozhodnutí. Ekosystém zahrnuje i účelově trénované modely, lokální běhová prostředí a experimenty kompatibilní s API.