Niezależny przewodnik · Sprawdzono 25 września 2026

AnyJev zmienia otwarty LLM w typowany model decyzyjny.

AnyJev to otwartoźródłowy zestaw narzędzi Python od Nokia Applied Research. Odczytuje decyzje Choice, Score i Noul z przyczynowych modeli językowych, a następnie koryguje wpływ kolejności opcji i kalibruje prawdopodobieństwa.

Ważne: AnyJev nie jest nowym modelem bazowym, otwartą publikacją wag Jev firmy TypeSafe ani oficjalnym produktem Jev. To niezależny sposób budowania decyzji w formacie Jev na modelach uruchamianych we własnym środowisku.

Opiekun
Nokia Applied Research
Licencja
Apache-2.0
Pakiet
anyjev w PyPI
Status
Pre-alpha
AnyJev · L0state → typed decisions
kontekst

Opłata została pobrana dwa razy. Proszę rozwiązać to jeszcze dziś.

choice · routingKtóry zespół powinien obsłużyć tę sprawę?
rozliczenia0.81
techniczny0.09
sprzedaż0.04
inny0.06
result.level = "L0"Przykładowy wynik
Najważniejsze rozróżnienie

AnyJev to zestaw narzędzi, a nie kolejny zestaw wag modelu.

Wybrany model przyczynowy pozostaje bez zmian; zmienia się sposób odczytu decyzji z zamkniętym zbiorem odpowiedzi. AnyJev jest więc bliższy warstwie decyzyjnej niż samodzielnemu, dostrojonemu klasyfikatorowi.

Czym jest

Typowany odczyt dla otwartych modeli

Definiujesz kontekst i jedno lub więcej pytań z zamkniętym zbiorem odpowiedzi. AnyJev zwraca rozkłady dla wyborów kategorycznych, prawdopodobieństwo dla pytań tak/nie albo wartość oczekiwaną na uporządkowanej skali.

Co dodaje

Poziomy korekty biasu i kalibracji

Surowe logity tokenów odpowiedzi mogą preferować etykietę lub jej pozycję. AnyJev wskazuje poziom korekty każdej decyzji, dzięki czemu aplikacja może wymagać właściwego poziomu.

Czym nie jest

Otwartą kopią TypeSafe Jev

Projekt nie publikuje ani nie odtwarza prywatnych wag, danych treningowych czy metody RLCD TypeSafe. Podobny format zapytania nie dowodzi równoważnego działania.

Surowy → L0 → L1 → L2

Cztery poziomy jasno pokazują, na jakich danych opiera się decyzja.

L0 rzeczywiście nie wymaga treningu. Wyższe poziomy wykorzystują oznaczone przykłady; L2 dopasowuje małą głowicę wyjściową dla konkretnego pytania bez zmiany wag modelu bazowego.

SurowyBez etykiet

Odczytuje ograniczony softmax z logitów tokenów odpowiedzi.

Bez korekty pozycji opcji ani preferencji etykiet.

L0Bez etykiet

Rotuje opcje i koryguje prawdopodobieństwo a priori etykiety.

Większa stabilność, ale prawdopodobieństwa nie są skalibrowane dla zadania.

L1100–500 etykiet

Dodaje kalibrację temperaturową dla jednego modelu i pytania.

Poprawia ocenę pewności, ale nie naprawia błędnego rankingu.

L2100–300 etykiet

Dopasowuje małą analityczną głowicę wyjściową na pośrednim stanie ukrytym.

Dotyczy konkretnego modelu i pytania; wymaga lokalnego dostępu do stanów ukrytych.

Przykład lokalnego przepływu

Skieruj zgłoszenie i sprawdź proponowane działanie.

Przykład odzwierciedla publiczne API: model Qwen pozostaje lokalny, AnyJev odczytuje dwie decyzje z zamkniętym zbiorem odpowiedzi, a zwykły kod aplikacji określa dalsze kroki.

Zainstaluj backend Transformers
pip install "anyjev[hf]"

Wymagany jest Python 3.10 lub nowszy. Pierwsze właściwe uruchomienie pobierze też wybrany otwarty model.

PythonChoice + Noul
from anyjev import Decider, Question
from anyjev.backends.hf import HFBackend

decider = Decider(HFBackend("Qwen/Qwen3-8B"))

route = Question.choice(
    "Which team should handle this?",
    ["billing", "technical", "sales", "other"],
    name="route",
)
risky = Question.noul(
    "Is this tool call destructive or irreversible?",
    name="risky",
)

result = decider.decide(
    {"message": "I was charged twice.", "tool_call": "refund"},
    [route, risky],
)

result["route"].distribution
result["risky"].p_true
result.level  # "L0"
01

Zdefiniuj przestrzeń odpowiedzi

Aplikacja wskazuje dozwolone zespoły i pyta, czy proponowane wywołanie narzędzia jest ryzykowne.

02

Odczytaj ograniczone rozkłady

Nie powstaje odpowiedź swobodna. Wynik zawiera rozkład lub prawdopodobieństwo oraz użyty poziom.

03

Zachowaj reguły w kodzie

Kod ustala progi, kieruje niepewne sprawy do weryfikacji i blokuje skutki uboczne przy zbyt dużym ryzyku.

Benchmark projektu

Najważniejszy wynik dotyczy bezpieczniejszej automatyzacji, nie tylko trafności.

AnyJev podaje następujące wyniki Qwen3-8B dla 300 elementów testowych BANKING77. To dane autorów z artefaktów zapisanych w repozytorium; Jev AI Dev nie powtórzył benchmarku niezależnie.

MetrykaSurowe logityAnyJev L0AnyJev L1
Zmiana odpowiedzi po odwróceniu opcji0.2300.0730.077
Trafność0.7470.8030.807
Oczekiwany błąd kalibracji0.2400.1840.095
Pokrycie przy maks. 5% błędu7.7%46.3%52.0%

W tym teście trafność wzrosła z 0,747 do 0,807. Większą zmianą operacyjną było pokrycie przy maksymalnie 5% błędu: 7,7% dla surowych logitów i 52,0% po kalibracji L1. Szacunek pochodzi z małego zbioru i wymaga walidacji w innym procesie.

Sprawdź benchmark i ablacje
Film społeczności · 29 sekund

Krótko o tym, jak zmienić LLM w decydenta w stylu Jev.

Data Science in your pocket opublikował to krótkie wprowadzenie po premierze AnyJev. Jest to wyjaśnienie strony trzeciej, a nie oficjalna demonstracja Nokia Applied Research ani niezależny benchmark.

Obejrzyj „How to convert any LLM into Jev AI?” w YouTube
Test społeczności · Wrzesień 2026

Test 20 zgłoszeń pokazał kompromis między trafnością a opóźnieniem.

WquGuru porównał oficjalny Jev i trzy otwarte projekty na jednym MacBooku, używając 20 chińskich zgłoszeń wsparcia. Wątek zawiera film, czasy i trafność każdego projektu.

@wquguru · Porównanie praktyczne

AnyJev z Qwen3-4B miał poprawnie obsłużyć 19 z 20 zgłoszeń.

Trafność95%19 / 20 zgłoszeń
Opóźnienie~4sraportowane na test
Zestaw20chińskie zgłoszenia wsparcia

Ten sam wątek podaje 20/20 dla oficjalnego Jev, 65% dla Laya i 35% dla djev. To wczesna obserwacja społeczności, a nie kontrolowany benchmark: mały zestaw pytań, jedna maszyna i różne konfiguracje projektów.

Zobacz porównanie i film w X
@MorrisMz81 · Autor AnyJev
“The latency is real. We went correctness first.”

Jiamu „Morris” Zhang wyjaśnił, że pierwsza wersja nie optymalizowała jeszcze ścieżki serwowania. Przedstawił AnyJev jako metodę dla już obsługiwanych modeli i zapowiedział prace nad vLLM/SGLang.

Przeczytaj pełną odpowiedź autora
@Marktechpost · Omówienie medialne

Zwięzły przegląd projektu i zapisanego benchmarku.

MarkTechPost podsumowuje typowany odczyt, różnicę L0/L1 i wyniki BANKING77. Liczby pochodzą z benchmarku projektu, nie z niezależnej replikacji.

Granica dowodów: Jev AI Dev potwierdził, że wpisy zawierają te twierdzenia, ale nie odtworzył testu społeczności. Liczby wyświetleń i interakcji pominięto, ponieważ stale się zmieniają.

Przed wdrożeniem

Poznaj problemy, których obecna wersja nie rozwiązuje.

Typowany wynik usuwa jeden problem integracyjny. Nie sprawia, że ocena semantyczna automatycznie staje się poprawna, bezpieczna lub przenośna.

01

L0 zużywa więcej mocy przy wielu opcjach

Wybór z K opcjami stosuje rotacje cykliczne, więc korekta bez etykiet wymaga K prefili. Dodatkowa inferencja zwiększa stabilność względem kolejności.

02

L1 i L2 potrzebują etykiet z procesu

Kalibracja i głowice dotyczą konkretnego modelu i pytania. Po zmianie należy je przebudować lub ponownie zweryfikować.

03

L2 wymaga dostępu do stanów ukrytych

Obecna ścieżka L2 korzysta z lokalnego backendu Transformers. Silniki vLLM i SGLang znajdują się na mapie rozwoju.

04

Opublikowane liczby nie są testem akceptacyjnym

Zmierz trafność, kalibrację, wrażliwość na kolejność i abstencję na reprezentatywnych danych, zanim prawdopodobieństwo zacznie sterować ważnym działaniem.

Źródła pierwotne

Sprawdź projekt u źródła.

AnyJev szybko się rozwija. Przed użyciem sprawdź najnowszą wersję, backendy i ograniczenia.

Poznaj ekosystem

Porównaj AnyJev z innymi projektami społeczności System One.

AnyJev dostosowuje otwarty model przyczynowy w chwili podejmowania decyzji. Ekosystem obejmuje też modele trenowane zadaniowo, lokalne środowiska uruchomieniowe i eksperymenty zgodne z API.

Przeczytaj przewodnik System One Zobacz projekty społeczności