Pembacaan terstruktur untuk model terbuka
Anda menentukan konteks dan pertanyaan dengan ruang jawaban terbatas. AnyJev mengembalikan distribusi untuk pilihan kategori, probabilitas untuk pertanyaan ya/tidak, atau nilai harapan pada skala berurutan.
AnyJev adalah toolkit Python sumber terbuka dari Nokia Applied Research. Toolkit ini membaca keputusan Choice, Score, dan Noul dari model bahasa kausal, lalu mengoreksi bias urutan opsi dan mengalibrasi probabilitas.
Penting: AnyJev bukan model fondasi baru, bukan rilis terbuka bobot Jev milik TypeSafe, dan bukan produk Jev resmi. Ini adalah cara independen untuk membangun keputusan berformat Jev pada model yang Anda jalankan sendiri.
anyjev di PyPIstate → typed decisionsSaya ditagih dua kali. Tolong selesaikan hari ini.
result.level = "L0"Contoh keluaranModel kausal pilihan Anda tetap digunakan; yang berubah adalah cara membaca keputusan dengan ruang jawaban terbatas. Karena itu AnyJev lebih menyerupai lapisan keputusan daripada model mandiri seperti pengklasifikasi yang di-fine-tune.
Anda menentukan konteks dan pertanyaan dengan ruang jawaban terbatas. AnyJev mengembalikan distribusi untuk pilihan kategori, probabilitas untuk pertanyaan ya/tidak, atau nilai harapan pada skala berurutan.
Logit token jawaban mentah dapat mengutamakan label atau posisinya. AnyJev menunjukkan tingkat koreksi yang menghasilkan setiap keputusan agar aplikasi dapat mewajibkan tingkat yang sesuai.
Proyek ini tidak menerbitkan atau mereproduksi bobot privat, data pelatihan, maupun metode RLCD milik TypeSafe. Bentuk permintaan yang mirip tidak membuktikan perilaku yang setara.
L0 benar-benar bekerja tanpa pelatihan. Tingkat lebih tinggi memakai contoh berlabel; L2 menyesuaikan lapisan keluaran kecil khusus pertanyaan tanpa mengubah bobot model dasar.
Tidak mengoreksi posisi opsi atau preferensi label.
Lebih stabil, tetapi probabilitas belum dikalibrasi untuk tugas.
Memperbaiki estimasi keyakinan, bukan peringkat yang keliru.
Khusus untuk satu model dan pertanyaan; perlu akses lokal ke keadaan tersembunyi.
Contoh ini mengikuti API publik: model Qwen tetap lokal, AnyJev membaca dua keputusan dengan ruang jawaban terbatas, dan kode aplikasi menentukan langkah berikutnya.
pip install "anyjev[hf]"Memerlukan Python 3.10 atau lebih baru. Eksekusi nyata pertama juga akan mengunduh model terbuka pilihan Anda.
Choice + Noulfrom anyjev import Decider, Question
from anyjev.backends.hf import HFBackend
decider = Decider(HFBackend("Qwen/Qwen3-8B"))
route = Question.choice(
"Which team should handle this?",
["billing", "technical", "sales", "other"],
name="route",
)
risky = Question.noul(
"Is this tool call destructive or irreversible?",
name="risky",
)
result = decider.decide(
{"message": "I was charged twice.", "tool_call": "refund"},
[route, risky],
)
result["route"].distribution
result["risky"].p_true
result.level # "L0"Aplikasi menyebutkan tim yang diizinkan dan menanyakan apakah pemanggilan alat yang diusulkan berisiko.
Tidak ada jawaban bebas yang dibuat. Hasil membawa distribusi atau probabilitas serta tingkat yang digunakan.
Kode menetapkan ambang, mengirim kasus tidak pasti untuk ditinjau, dan mencegah efek samping saat risiko terlalu tinggi.
AnyJev melaporkan hasil Qwen3-8B berikut pada 300 item uji BANKING77. Angka ini dilaporkan penulis dari artefak di repositori; Jev AI Dev belum mengulang benchmark secara independen.
| Metrik | Logit mentah | AnyJev L0 | AnyJev L1 |
|---|---|---|---|
| Jawaban berubah setelah urutan opsi dibalik | 0.230 | 0.073 | 0.077 |
| Akurasi | 0.747 | 0.803 | 0.807 |
| Galat kalibrasi harapan | 0.240 | 0.184 | 0.095 |
| Cakupan dengan galat maksimal 5% | 7.7% | 46.3% | 52.0% |
Akurasi naik dari 0,747 menjadi 0,807. Perubahan operasional yang lebih besar adalah cakupan pada galat maksimal 5%: 7,7% untuk logit mentah dan 52,0% setelah kalibrasi L1. Estimasi ini berasal dari set uji kecil dan harus divalidasi untuk alur kerja lain.
Periksa benchmark dan ablasiData Science in your pocket menerbitkan pengantar singkat ini setelah AnyJev muncul. Ini penjelasan pihak ketiga, bukan demo resmi Nokia Applied Research atau benchmark independen.
Tonton “How to convert any LLM into Jev AI?” di YouTubeWquGuru membandingkan Jev resmi dan tiga proyek terbuka pada satu MacBook dengan 20 tiket dukungan berbahasa Tionghoa. Utasnya memuat video, waktu, dan akurasi tiap proyek.
Utas yang sama melaporkan 20/20 untuk Jev resmi, 65% untuk Laya, dan 35% untuk djev. Anggap ini pengamatan awal komunitas, bukan benchmark terkontrol: satu set kecil, satu mesin, dan konfigurasi berbeda untuk tiap proyek.
Lihat perbandingan dan video di X“The latency is real. We went correctness first.”
Jiamu “Morris” Zhang menyatakan rilis pertama belum mengoptimalkan jalur penyajian model. Ia menyebut AnyJev sebagai metode untuk model yang sudah dijalankan tim dan mengatakan optimasi vLLM/SGLang mulai dikerjakan.
Baca tanggapan lengkap penulisMarkTechPost merangkum pembacaan keputusan terstruktur, perbedaan L0/L1, dan hasil BANKING77. Angkanya berasal dari benchmark proyek, bukan replikasi independen.
Batas bukti: Jev AI Dev memverifikasi bahwa postingan tersebut memuat klaim ini, tetapi tidak mereproduksi uji komunitas. Jumlah tayangan dan interaksi sengaja tidak dicantumkan karena terus berubah.
Keluaran terstruktur menghilangkan satu masalah integrasi. Itu tidak otomatis membuat penilaian semantik benar, aman, atau dapat diterapkan pada distribusi data lain.
Pilihan dengan K opsi menggunakan rotasi siklik, sehingga koreksi tanpa label memerlukan K prefill. Komputasi tambahan meningkatkan kestabilan terhadap urutan.
Kalibrasi dan lapisan keluaran terkait dengan model dan pertanyaan tertentu. Keduanya harus dibangun atau divalidasi ulang saat ada perubahan.
Jalur L2 saat ini memakai backend Transformers lokal. Mesin penyajian model seperti vLLM dan SGLang ada dalam roadmap.
Ukur akurasi, kalibrasi, sensitivitas urutan, dan abstain pada data representatif sebelum probabilitas mengendalikan tindakan penting.
AnyJev berkembang cepat. Periksa rilis, backend, dan batasan terbaru sebelum menggunakannya.
AnyJev menyesuaikan LLM kausal terbuka saat keputusan dibuat. Ekosistem juga mencakup model yang dilatih khusus, runtime lokal, dan eksperimen yang kompatibel dengan API.