Panduan independen · Ditinjau 25 September 2026

AnyJev mengubah LLM terbuka menjadi model keputusan terstruktur.

AnyJev adalah toolkit Python sumber terbuka dari Nokia Applied Research. Toolkit ini membaca keputusan Choice, Score, dan Noul dari model bahasa kausal, lalu mengoreksi bias urutan opsi dan mengalibrasi probabilitas.

Penting: AnyJev bukan model fondasi baru, bukan rilis terbuka bobot Jev milik TypeSafe, dan bukan produk Jev resmi. Ini adalah cara independen untuk membangun keputusan berformat Jev pada model yang Anda jalankan sendiri.

Pengelola
Nokia Applied Research
Lisensi
Apache-2.0
Paket
anyjev di PyPI
Status
Pra-alfa
AnyJev · L0state → typed decisions
konteks

Saya ditagih dua kali. Tolong selesaikan hari ini.

choice · peruteanTim mana yang harus menangani kasus ini?
penagihan0.81
teknis0.09
penjualan0.04
lainnya0.06
result.level = "L0"Contoh keluaran
Perbedaan yang penting

AnyJev adalah toolkit, bukan set bobot model baru.

Model kausal pilihan Anda tetap digunakan; yang berubah adalah cara membaca keputusan dengan ruang jawaban terbatas. Karena itu AnyJev lebih menyerupai lapisan keputusan daripada model mandiri seperti pengklasifikasi yang di-fine-tune.

Apa itu

Pembacaan terstruktur untuk model terbuka

Anda menentukan konteks dan pertanyaan dengan ruang jawaban terbatas. AnyJev mengembalikan distribusi untuk pilihan kategori, probabilitas untuk pertanyaan ya/tidak, atau nilai harapan pada skala berurutan.

Yang ditambahkan

Tingkat koreksi bias dan kalibrasi

Logit token jawaban mentah dapat mengutamakan label atau posisinya. AnyJev menunjukkan tingkat koreksi yang menghasilkan setiap keputusan agar aplikasi dapat mewajibkan tingkat yang sesuai.

Bukan apa

Bukan salinan terbuka TypeSafe Jev

Proyek ini tidak menerbitkan atau mereproduksi bobot privat, data pelatihan, maupun metode RLCD milik TypeSafe. Bentuk permintaan yang mirip tidak membuktikan perilaku yang setara.

Mentah → L0 → L1 → L2

Empat tingkat memperjelas bukti yang mendasari keputusan.

L0 benar-benar bekerja tanpa pelatihan. Tingkat lebih tinggi memakai contoh berlabel; L2 menyesuaikan lapisan keluaran kecil khusus pertanyaan tanpa mengubah bobot model dasar.

MentahTanpa label

Membaca softmax terbatas dari logit token jawaban.

Tidak mengoreksi posisi opsi atau preferensi label.

L0Tanpa label

Memutar opsi dan mengoreksi probabilitas awal label yang diperkirakan.

Lebih stabil, tetapi probabilitas belum dikalibrasi untuk tugas.

L1100–500 label

Menambahkan kalibrasi suhu untuk satu model dan pertanyaan.

Memperbaiki estimasi keyakinan, bukan peringkat yang keliru.

L2100–300 label

Menyesuaikan lapisan keluaran analitis kecil pada keadaan tersembunyi perantara.

Khusus untuk satu model dan pertanyaan; perlu akses lokal ke keadaan tersembunyi.

Contoh alur kerja lokal

Rutekan tiket dukungan dan periksa tindakan yang diusulkan.

Contoh ini mengikuti API publik: model Qwen tetap lokal, AnyJev membaca dua keputusan dengan ruang jawaban terbatas, dan kode aplikasi menentukan langkah berikutnya.

Instal backend Transformers
pip install "anyjev[hf]"

Memerlukan Python 3.10 atau lebih baru. Eksekusi nyata pertama juga akan mengunduh model terbuka pilihan Anda.

PythonChoice + Noul
from anyjev import Decider, Question
from anyjev.backends.hf import HFBackend

decider = Decider(HFBackend("Qwen/Qwen3-8B"))

route = Question.choice(
    "Which team should handle this?",
    ["billing", "technical", "sales", "other"],
    name="route",
)
risky = Question.noul(
    "Is this tool call destructive or irreversible?",
    name="risky",
)

result = decider.decide(
    {"message": "I was charged twice.", "tool_call": "refund"},
    [route, risky],
)

result["route"].distribution
result["risky"].p_true
result.level  # "L0"
01

Tentukan ruang jawaban

Aplikasi menyebutkan tim yang diizinkan dan menanyakan apakah pemanggilan alat yang diusulkan berisiko.

02

Baca distribusi terbatas

Tidak ada jawaban bebas yang dibuat. Hasil membawa distribusi atau probabilitas serta tingkat yang digunakan.

03

Pertahankan kebijakan dalam kode

Kode menetapkan ambang, mengirim kasus tidak pasti untuk ditinjau, dan mencegah efek samping saat risiko terlalu tinggi.

Benchmark proyek

Hasil utama adalah otomatisasi yang lebih aman, bukan sekadar akurasi.

AnyJev melaporkan hasil Qwen3-8B berikut pada 300 item uji BANKING77. Angka ini dilaporkan penulis dari artefak di repositori; Jev AI Dev belum mengulang benchmark secara independen.

MetrikLogit mentahAnyJev L0AnyJev L1
Jawaban berubah setelah urutan opsi dibalik0.2300.0730.077
Akurasi0.7470.8030.807
Galat kalibrasi harapan0.2400.1840.095
Cakupan dengan galat maksimal 5%7.7%46.3%52.0%

Akurasi naik dari 0,747 menjadi 0,807. Perubahan operasional yang lebih besar adalah cakupan pada galat maksimal 5%: 7,7% untuk logit mentah dan 52,0% setelah kalibrasi L1. Estimasi ini berasal dari set uji kecil dan harus divalidasi untuk alur kerja lain.

Periksa benchmark dan ablasi
Video komunitas · 29 detik

Penjelasan singkat untuk mengubah LLM menjadi pengambil keputusan bergaya Jev.

Data Science in your pocket menerbitkan pengantar singkat ini setelah AnyJev muncul. Ini penjelasan pihak ketiga, bukan demo resmi Nokia Applied Research atau benchmark independen.

Tonton “How to convert any LLM into Jev AI?” di YouTube
Uji komunitas · September 2026

Uji 20 tiket menunjukkan kompromi antara akurasi dan latensi.

WquGuru membandingkan Jev resmi dan tiga proyek terbuka pada satu MacBook dengan 20 tiket dukungan berbahasa Tionghoa. Utasnya memuat video, waktu, dan akurasi tiap proyek.

@wquguru · Perbandingan langsung

AnyJev dengan Qwen3-4B dilaporkan menjawab 19 dari 20 tiket dengan benar.

Akurasi95%19 / 20 tiket
Latensi~4sdilaporkan per uji
Beban uji20tiket dukungan berbahasa Tionghoa

Utas yang sama melaporkan 20/20 untuk Jev resmi, 65% untuk Laya, dan 35% untuk djev. Anggap ini pengamatan awal komunitas, bukan benchmark terkontrol: satu set kecil, satu mesin, dan konfigurasi berbeda untuk tiap proyek.

Lihat perbandingan dan video di X
@MorrisMz81 · Penulis AnyJev
“The latency is real. We went correctness first.”

Jiamu “Morris” Zhang menyatakan rilis pertama belum mengoptimalkan jalur penyajian model. Ia menyebut AnyJev sebagai metode untuk model yang sudah dijalankan tim dan mengatakan optimasi vLLM/SGLang mulai dikerjakan.

Baca tanggapan lengkap penulis
@Marktechpost · Ulasan media

Ringkasan singkat proyek dan benchmark yang disimpan.

MarkTechPost merangkum pembacaan keputusan terstruktur, perbedaan L0/L1, dan hasil BANKING77. Angkanya berasal dari benchmark proyek, bukan replikasi independen.

Batas bukti: Jev AI Dev memverifikasi bahwa postingan tersebut memuat klaim ini, tetapi tidak mereproduksi uji komunitas. Jumlah tayangan dan interaksi sengaja tidak dicantumkan karena terus berubah.

Sebelum produksi

Pahami apa yang belum diselesaikan rilis saat ini.

Keluaran terstruktur menghilangkan satu masalah integrasi. Itu tidak otomatis membuat penilaian semantik benar, aman, atau dapat diterapkan pada distribusi data lain.

01

L0 memakai komputasi lebih banyak untuk banyak opsi

Pilihan dengan K opsi menggunakan rotasi siklik, sehingga koreksi tanpa label memerlukan K prefill. Komputasi tambahan meningkatkan kestabilan terhadap urutan.

02

L1 dan L2 memerlukan label dari alur kerja

Kalibrasi dan lapisan keluaran terkait dengan model dan pertanyaan tertentu. Keduanya harus dibangun atau divalidasi ulang saat ada perubahan.

03

L2 memerlukan akses ke keadaan tersembunyi

Jalur L2 saat ini memakai backend Transformers lokal. Mesin penyajian model seperti vLLM dan SGLang ada dalam roadmap.

04

Angka publik bukan uji penerimaan Anda

Ukur akurasi, kalibrasi, sensitivitas urutan, dan abstain pada data representatif sebelum probabilitas mengendalikan tindakan penting.

Sumber primer

Periksa proyek langsung dari sumbernya.

AnyJev berkembang cepat. Periksa rilis, backend, dan batasan terbaru sebelum menggunakannya.

Jelajahi ekosistem

Bandingkan AnyJev dengan proyek komunitas System One lainnya.

AnyJev menyesuaikan LLM kausal terbuka saat keputusan dibuat. Ekosistem juga mencakup model yang dilatih khusus, runtime lokal, dan eksperimen yang kompatibel dengan API.

Baca panduan System One Lihat proyek komunitas