Açık modeller için yapılandırılmış karar okuması
Bir bağlam ve yanıt alanı sınırlı sorular tanımlarsınız. AnyJev kategorik seçimler için dağılım, evet/hayır için olasılık veya sıralı ölçekte beklenen değer döndürür.
AnyJev, Nokia Applied Research tarafından geliştirilen açık kaynaklı bir Python araç setidir. Nedensel dil modellerinden Choice, Score ve Noul kararlarını okur; seçenek sırası yanlılığını düzeltir ve olasılıkları kalibre eder.
Önemli: AnyJev yeni bir temel model, TypeSafe'in Jev ağırlıklarının açık sürümü veya resmî bir Jev ürünü değildir. Kendi çalıştırdığınız modeller üzerinde Jev biçiminde kararlar üretmenin bağımsız bir yoludur.
state → typed decisionsBenden iki kez ücret alındı. Lütfen bugün düzeltin.
result.level = "L0"Örnek çıktıSeçtiğiniz nedensel model aynı kalır; değişen, yanıt alanı sınırlı bir kararın nasıl okunduğudur. Bu yüzden AnyJev, bağımsız ve ince ayarlı bir sınıflandırıcıdan çok bir karar katmanına benzer.
Bir bağlam ve yanıt alanı sınırlı sorular tanımlarsınız. AnyJev kategorik seçimler için dağılım, evet/hayır için olasılık veya sıralı ölçekte beklenen değer döndürür.
Ham yanıt token logitleri bir etiketi veya konumunu kayırabilir. AnyJev her kararın düzeltme seviyesini gösterir; uygulama da beklenen seviyeyi zorunlu tutabilir.
Proje TypeSafe'in özel ağırlıklarını, eğitim verilerini veya RLCD yöntemini yayımlamaz ya da yeniden üretmez. Benzer istek biçimi eşdeğer davranışı kanıtlamaz.
L0 gerçekten eğitim gerektirmez. Üst seviyeler etiketli örnekler kullanır; L2, temel model ağırlıklarını değiştirmeden soruya özel küçük bir çıktı katmanı uyarlar.
Seçenek konumu veya etiket tercihi düzeltilmez.
Daha kararlıdır; ancak olasılıklar göreve göre kalibre değildir.
Güven tahminini iyileştirir, yanlış sıralamayı düzeltmez.
Model ve soruya özeldir; gizli duruma yerel erişim gerektirir.
Örnek, projenin açık API'sini izler: Qwen modeli yerelde kalır, AnyJev yanıt alanı sınırlı iki kararı okur ve uygulama kodu sonraki adımı belirler.
pip install "anyjev[hf]"Python 3.10 veya üstü gerekir. İlk gerçek çalıştırma seçtiğiniz açık modeli de indirir.
Choice + Noulfrom anyjev import Decider, Question
from anyjev.backends.hf import HFBackend
decider = Decider(HFBackend("Qwen/Qwen3-8B"))
route = Question.choice(
"Which team should handle this?",
["billing", "technical", "sales", "other"],
name="route",
)
risky = Question.noul(
"Is this tool call destructive or irreversible?",
name="risky",
)
result = decider.decide(
{"message": "I was charged twice.", "tool_call": "refund"},
[route, risky],
)
result["route"].distribution
result["risky"].p_true
result.level # "L0"Uygulama izin verilen ekipleri belirtir ve önerilen araç çağrısının riskli olup olmadığını sorar.
Serbest biçimli yanıt üretilmez. Sonuç bir dağılım veya olasılık ile kullanılan seviyeyi taşır.
Kod eşikleri belirler, belirsiz vakaları incelemeye gönderir ve risk yüksekse yan etkileri engeller.
AnyJev, 300 BANKING77 test öğesinde şu Qwen3-8B sonuçlarını bildiriyor. Rakamlar repoya işlenmiş artefaktlardan yazarlarca raporlandı; Jev AI Dev benchmark'ı bağımsız olarak tekrarlamadı.
| Metrik | Ham logitler | AnyJev L0 | AnyJev L1 |
|---|---|---|---|
| Seçenekler ters çevrilince değişen yanıtlar | 0.230 | 0.073 | 0.077 |
| Doğruluk | 0.747 | 0.803 | 0.807 |
| Beklenen kalibrasyon hatası | 0.240 | 0.184 | 0.095 |
| En fazla %5 hatada kapsam | 7.7% | 46.3% | 52.0% |
Bu testte doğruluk 0,747'den 0,807'ye çıktı. Daha büyük operasyonel değişim, en fazla %5 hatada kapsamdı: ham logitlerde %7,7, L1 kalibrasyonundan sonra %52,0. Tahmin küçük bir test setine dayanır ve başka iş akışına doğrulanmadan taşınmamalıdır.
Benchmark ve ablasyonları inceleyinData Science in your pocket, AnyJev çıktıktan sonra bu kısa tanıtımı yayımladı. Bu, üçüncü taraf açıklamasıdır; resmî Nokia Applied Research demosu veya bağımsız benchmark değildir.
YouTube'da “How to convert any LLM into Jev AI?” videosunu izleyinWquGuru, resmî Jev ile üç açık projeyi 20 Çince destek kaydıyla tek bir MacBook'ta karşılaştırdı. Gönderi video, süre ve proje bazında doğruluk içeriyor.
Aynı gönderi resmî Jev için 20/20, Laya için %65 ve djev için %35 bildiriyor. Bunu kontrollü benchmark değil, erken bir topluluk gözlemi olarak değerlendirin: küçük bir set, tek makine ve projeye özel yapılandırmalar.
Karşılaştırma ve videoyu X'te görün“The latency is real. We went correctness first.”
Jiamu “Morris” Zhang ilk sürümde model sunma yolunun henüz optimize edilmediğini söyledi. AnyJev'i ekibin hâlihazırda çalıştırdığı modeller için bir yöntem olarak tanımladı ve vLLM/SGLang optimizasyonunun başladığını belirtti.
Yazarın tam yanıtını okuyunMarkTechPost yapılandırılmış karar okumasını, L0/L1 farkını ve BANKING77 sonuçlarını özetliyor. Rakamlar bağımsız tekrardan değil, projenin kendi benchmark'ından geliyor.
Kanıt sınırı: Jev AI Dev gönderilerde bu ifadelerin bulunduğunu doğruladı, ancak topluluk testini tekrarlamadı. Görüntülenme ve etkileşim sayıları zamanla değiştiği için verilmedi.
Yapılandırılmış çıktı bir entegrasyon sorununu giderir. Semantik değerlendirmeyi otomatik olarak doğru, güvenli veya aktarılabilir yapmaz.
K seçenekli bir seçim döngüsel rotasyon kullanır; etiketsiz düzeltme K prefill gerektirir. Ek inferans, sıraya karşı daha iyi kararlılık sağlar.
Kalibrasyon ve çıktı katmanları belirli model ve soruya aittir. Biri değiştiğinde yeniden kurulmalı veya doğrulanmalıdır.
Mevcut L2 yolu yerel Transformers backend'i kullanır. vLLM ve SGLang gibi model sunma motorları yol haritasındadır.
Bir olasılık önemli eylemi yönetmeden önce temsili veride doğruluk, kalibrasyon, sıra hassasiyeti ve kaçınmayı ölçün.
AnyJev hızla gelişiyor. Entegrasyon öncesinde son sürümü, backend'leri ve kısıtları doğrulayın.
AnyJev açık bir nedensel LLM'yi karar anında uyarlar. Ekosistem ayrıca özel eğitimli modeller, yerel çalışma ortamları ve API uyumlu deneyler içerir.