Tyypitetty ulostulo avoimille malleille
Määrität kontekstin ja rajatut kysymykset. AnyJev palauttaa jakauman kategorisille valinnoille, todennäköisyyden kyllä/ei-kysymyksille tai odotusarvon järjestetylle asteikolle.
AnyJev on Nokia Applied Researchin avoimen lähdekoodin Python-työkalupakki. Se lukee Choice-, Score- ja Noul-päätöksiä kausaalisista kielimalleista sekä korjaa vaihtoehtojen järjestykseen liittyvää harhaa ja kalibroi todennäköisyyksiä.
Huomio: AnyJev ei ole uusi perusmalli, TypeSafen Jev-painojen avoin julkaisu eikä virallinen Jev-tuote. Se on riippumaton tapa rakentaa Jev-muotoisia päätöksiä itse ajettavien mallien päälle.
anyjev PyPI:ssästate → typed decisionsMinua veloitettiin kahdesti. Korjatkaa asia tänään.
result.level = "L0"Havainnollinen tulosValittu kausaalinen malli säilyy; vain rajatun päätöksen lukutapa muuttuu. AnyJev on siksi lähempänä päätöskerrosta kuin itsenäistä hienosäädettyä luokitinta.
Määrität kontekstin ja rajatut kysymykset. AnyJev palauttaa jakauman kategorisille valinnoille, todennäköisyyden kyllä/ei-kysymyksille tai odotusarvon järjestetylle asteikolle.
Raakojen vastaustokeneiden logitit voivat suosia tiettyä tunnistetta tai sijaintia. AnyJev kertoo päätöksen korjaustason, joten sovellus voi vaatia odottamansa tason.
Projekti ei julkaise eikä toisinna TypeSafen yksityisiä painoja, koulutusdataa tai RLCD-menetelmää. Samankaltainen pyyntörakenne ei takaa vastaavaa toimintaa.
L0 toimii ilman koulutusta. Ylemmät tasot käyttävät annotoituja esimerkkejä; L2 sovittaa pienen kysymyskohtaisen ulostulokerroksen muuttamatta perusmallin painoja.
Ei korjausta vaihtoehdon sijainnille tai tunnisteen suosinnalle.
Vakaampi, mutta todennäköisyyksiä ei ole kalibroitu tehtävään.
Parantaa luottamusarviota, mutta ei korjaa väärää järjestystä.
Malli- ja kysymyskohtainen; vaatii paikallisen pääsyn piilotiloihin.
Esimerkki seuraa projektin julkista API:a: Qwen-malli pysyy paikallisena, AnyJev lukee kaksi rajattua päätöstä ja sovelluskoodi päättää jatkosta.
pip install "anyjev[hf]"Vaatii Python 3.10:n tai uudemman. Ensimmäinen varsinainen ajo lataa myös valitsemasi avoimen mallin.
Choice + Noulfrom anyjev import Decider, Question
from anyjev.backends.hf import HFBackend
decider = Decider(HFBackend("Qwen/Qwen3-8B"))
route = Question.choice(
"Which team should handle this?",
["billing", "technical", "sales", "other"],
name="route",
)
risky = Question.noul(
"Is this tool call destructive or irreversible?",
name="risky",
)
result = decider.decide(
{"message": "I was charged twice.", "tool_call": "refund"},
[route, risky],
)
result["route"].distribution
result["risky"].p_true
result.level # "L0"Sovellus nimeää sallitut tiimit ja kysyy, onko ehdotettu työkalukutsu riskialtis.
Vapaamuotoista vastausta ei luoda. Tulos sisältää jakauman tai todennäköisyyden ja käytetyn tason.
Koodi asettaa kynnykset, ohjaa epävarmat tapaukset tarkistukseen ja estää sivuvaikutukset riskin ollessa liian suuri.
AnyJev raportoi seuraavat Qwen3-8B-tulokset 300 BANKING77-testinäytteellä. Luvut ovat tekijöiden ilmoittamia ja perustuvat repositorion artefakteihin; Jev AI Dev ei ole toistanut testiä riippumattomasti.
| Mittari | Raakalogitit | AnyJev L0 | AnyJev L1 |
|---|---|---|---|
| Vastauksen vaihtuminen vaihtoehdot käännettäessä | 0.230 | 0.073 | 0.077 |
| Tarkkuus | 0.747 | 0.803 | 0.807 |
| Odotettu kalibrointivirhe | 0.240 | 0.184 | 0.095 |
| Kattavuus enintään 5 %:n virheellä | 7.7% | 46.3% | 52.0% |
Tarkkuus nousi testissä 0,747:stä 0,807:ään. Suurempi toiminnallinen muutos oli kattavuus enintään 5 %:n virheellä: raakalogiteilla 7,7 % ja L1-kalibroinnin jälkeen 52,0 %. Arvio perustuu pieneen testijoukkoon eikä siirry toiseen työnkulkuun ilman validointia.
Tutki vertailutestiä ja ablaatioitaData Science in your pocket julkaisi tämän esittelyn AnyJevin ilmestyttyä. Se on kolmannen osapuolen selitys, ei Nokia Applied Researchin virallinen demo tai riippumaton vertailutesti.
Katso ”How to convert any LLM into Jev AI?” YouTubessaWquGuru vertasi virallista Jeviä ja kolmea avointa projektia yhdellä MacBookilla käyttäen 20 kiinankielistä tukipyyntöä. Ketjussa on video, ajoajat ja projektikohtainen tarkkuus.
Samassa ketjussa virallinen Jev sai 20/20, Laya 65 % ja djev 35 %. Kyse on varhaisesta yhteisöhavainnosta, ei kontrolloidusta testistä: yksi pieni kysymysjoukko, yksi kone ja projektikohtaiset määritykset.
Katso vertailu ja video X:ssä“The latency is real. We went correctness first.”
Jiamu ”Morris” Zhang sanoi, ettei ensimmäisen version palvelupolkua ollut optimoitu. Hän kuvasi AnyJevin menetelmäksi tiimin jo palvelemille malleille ja kertoi vLLM/SGLang-optimoinnin alkavan.
Lue tekijän koko vastausMarkTechPost tiivistää tyypitetyn ulostulon, L0/L1-eron ja BANKING77-tulokset. Luvut ovat projektin omasta testistä, eivät riippumattomasta toistosta.
Näytön raja: Jev AI Dev varmisti, että julkaisuissa esitetään nämä väitteet, mutta ei toistanut yhteisötestiä. Katselu- ja reaktiomäärät on jätetty pois, koska ne muuttuvat.
Tyypitetty tulos poistaa yhden integraatio-ongelman. Se ei tee semanttisesta arviosta automaattisesti oikeaa, turvallista tai siirrettävää.
K vaihtoehdon valinta käyttää syklisiä kiertoja, joten korjaus ilman merkittyä dataa tarvitsee K prefilliä. Lisälaskenta parantaa vakautta järjestystä vastaan.
Kalibrointi ja ulostulokerrokset kuuluvat tietylle mallille ja kysymykselle. Ne on rakennettava tai validoitava uudelleen muutosten jälkeen.
Nykyinen L2-polku käyttää paikallista Transformers-taustaa. vLLM:n ja SGLangin kaltaiset palvelumoottorit ovat tiekartalla.
Mittaa tarkkuus, kalibrointi, järjestysherkkyys ja pidättäytyminen edustavalla datalla ennen tärkeän toiminnon ohjaamista todennäköisyydellä.
AnyJev kehittyy nopeasti. Tarkista uusin julkaisu, taustajärjestelmät ja rajoitukset ennen käyttöönottoa.
AnyJev mukauttaa avointa kausaalista LLM:ää päätöshetkellä. Ekosysteemiin kuuluu myös tehtävään koulutettuja malleja, paikallisia ajoympäristöjä ja API-yhteensopivia kokeiluja.