Hướng dẫn độc lập · Rà soát ngày 25/09/2026

AnyJev biến một LLM mở thành mô hình ra quyết định có cấu trúc.

AnyJev là bộ công cụ Python mã nguồn mở của Nokia Applied Research. Công cụ trích xuất các kết quả Choice, Score và Noul từ mô hình ngôn ngữ nhân quả, sau đó giảm thiên lệch do thứ tự lựa chọn và hiệu chỉnh xác suất.

Lưu ý: AnyJev không phải mô hình nền tảng mới, không phải bản phát hành mở của trọng số Jev do TypeSafe sở hữu và cũng không phải sản phẩm Jev chính thức. Đây là cách độc lập để tạo quyết định theo cấu trúc Jev trên mô hình bạn tự vận hành.

Đơn vị duy trì
Nokia Applied Research
Giấy phép
Apache-2.0
Gói
anyjev trên PyPI
Trạng thái
Tiền alpha
AnyJev · L0state → typed decisions
ngữ cảnh

Tôi bị tính phí hai lần. Vui lòng xử lý trong hôm nay.

choice · định tuyếnNhóm nào nên xử lý yêu cầu này?
thanh toán0.81
kỹ thuật0.09
kinh doanh0.04
khác0.06
result.level = "L0"Kết quả minh họa
Điểm khác biệt quan trọng

AnyJev là bộ công cụ, không phải một bộ trọng số mô hình khác.

Mô hình nhân quả bạn chọn vẫn được giữ nguyên; AnyJev chỉ thay đổi cách trích xuất quyết định trong một không gian trả lời giới hạn. Vì vậy, nó gần với một lớp quyết định hơn là một mô hình độc lập như bộ phân loại đã tinh chỉnh.

AnyJev là gì

Lớp đọc quyết định có cấu trúc cho mô hình mở

Bạn xác định ngữ cảnh và một hoặc nhiều câu hỏi có phạm vi trả lời giới hạn. AnyJev trả về phân phối cho lựa chọn phân loại, xác suất cho câu hỏi có/không hoặc giá trị kỳ vọng trên thang điểm có thứ tự.

AnyJev bổ sung gì

Các cấp sửa thiên lệch và hiệu chỉnh

Logit token trả lời thô có thể thiên về một nhãn hoặc vị trí. AnyJev cho biết cấp hiệu chỉnh tạo ra từng quyết định để ứng dụng có thể yêu cầu đúng cấp cần dùng.

AnyJev không phải gì

Không phải bản sao mở của TypeSafe Jev

Dự án không công bố hay tái tạo trọng số riêng, dữ liệu huấn luyện hoặc phương pháp RLCD của TypeSafe. Hình dạng yêu cầu tương tự không chứng minh hành vi tương đương.

Thô → L0 → L1 → L2

Bốn cấp độ cho biết mỗi quyết định đã được hiệu chỉnh đến đâu.

L0 thực sự không cần huấn luyện. Các cấp cao hơn dùng ví dụ có nhãn; L2 khớp một lớp đầu ra nhỏ theo từng câu hỏi mà không cập nhật trọng số mô hình gốc.

ThôKhông cần nhãn

Đọc softmax giới hạn trên logit token trả lời.

Không sửa thiên lệch vị trí lựa chọn hoặc ưu tiên nhãn.

L0Không cần nhãn

Xoay vòng các lựa chọn và hiệu chỉnh xác suất tiên nghiệm ước tính của nhãn.

Ổn định hơn, nhưng xác suất chưa được hiệu chỉnh cho tác vụ.

L1100–500 nhãn

Thêm hiệu chỉnh nhiệt độ cho một mô hình và câu hỏi.

Cải thiện ước lượng độ tin cậy, nhưng không sửa thứ hạng sai.

L2100–300 nhãn

Khớp một lớp đầu ra dạng đóng nhỏ trên trạng thái ẩn trung gian.

Gắn với một mô hình và câu hỏi; cần truy cập trạng thái ẩn tại chỗ.

Ví dụ quy trình cục bộ

Định tuyến phiếu hỗ trợ và kiểm tra hành động được đề xuất.

Ví dụ bám theo API công khai: mô hình Qwen vẫn chạy cục bộ, AnyJev đọc hai quyết định giới hạn và mã ứng dụng xác định bước tiếp theo.

Cài backend Transformers
pip install "anyjev[hf]"

Yêu cầu Python 3.10 trở lên. Lần chạy thực tế đầu tiên cũng tải mô hình mở bạn chọn.

PythonChoice + Noul
from anyjev import Decider, Question
from anyjev.backends.hf import HFBackend

decider = Decider(HFBackend("Qwen/Qwen3-8B"))

route = Question.choice(
    "Which team should handle this?",
    ["billing", "technical", "sales", "other"],
    name="route",
)
risky = Question.noul(
    "Is this tool call destructive or irreversible?",
    name="risky",
)

result = decider.decide(
    {"message": "I was charged twice.", "tool_call": "refund"},
    [route, risky],
)

result["route"].distribution
result["risky"].p_true
result.level  # "L0"
01

Xác định không gian trả lời

Ứng dụng liệt kê các nhóm được phép và hỏi liệu lệnh gọi công cụ được đề xuất có rủi ro hay không.

02

Đọc phân phối giới hạn

Không sinh câu trả lời tự do. Kết quả chứa phân phối hoặc xác suất cùng cấp độ đã dùng.

03

Giữ chính sách trong mã

Mã đặt ngưỡng, chuyển trường hợp không chắc chắn sang kiểm duyệt và ngăn tác động phụ khi rủi ro quá cao.

Benchmark của dự án

Kết quả đáng chú ý là tự động hóa an toàn hơn, không chỉ là độ chính xác.

AnyJev công bố các kết quả Qwen3-8B sau trên 300 mẫu thử BANKING77. Số liệu do tác giả báo cáo dựa trên các tệp benchmark đã lưu trong kho mã; Jev AI Dev chưa tự chạy lại thử nghiệm.

Chỉ sốLogit thôAnyJev L0AnyJev L1
Câu trả lời đổi khi đảo thứ tự lựa chọn0.2300.0730.077
Độ chính xác0.7470.8030.807
Sai số hiệu chỉnh kỳ vọng0.2400.1840.095
Độ bao phủ với sai số không quá 5%7.7%46.3%52.0%

Trong thử nghiệm này, độ chính xác tăng từ 0,747 lên 0,807. Thay đổi vận hành lớn hơn là độ bao phủ ở mức sai số tối đa 5%: 7,7% với logit thô và 52,0% sau hiệu chỉnh L1. Ước lượng dựa trên tập thử nhỏ và cần xác thực trước khi áp dụng cho quy trình khác.

Xem benchmark và các thử nghiệm ablation
Video cộng đồng · 29 giây

Xem giải thích nhanh về cách biến LLM thành bộ ra quyết định kiểu Jev.

Data Science in your pocket đăng phần giới thiệu ngắn này sau khi AnyJev xuất hiện. Đây là nội dung của bên thứ ba, không phải demo chính thức của Nokia Applied Research hay benchmark độc lập.

Xem “How to convert any LLM into Jev AI?” trên YouTube
Thử nghiệm cộng đồng · Tháng 9/2026

Bài thử 20 phiếu cho thấy đánh đổi giữa độ chính xác và độ trễ.

WquGuru so sánh Jev chính thức với ba dự án mở trên một MacBook bằng 20 phiếu hỗ trợ tiếng Trung. Chuỗi bài có video, thời gian và độ chính xác theo từng dự án.

@wquguru · So sánh thực tế

AnyJev dùng Qwen3-4B được báo cáo là trả lời đúng 19/20 phiếu.

Độ chính xác95%19 / 20 phiếu
Độ trễ~4sđược báo cáo mỗi lần thử
Bộ thử20phiếu hỗ trợ tiếng Trung

Cùng chuỗi bài báo cáo 20/20 cho Jev chính thức, 65% cho Laya và 35% cho djev. Hãy xem đây là quan sát ban đầu của cộng đồng, không phải benchmark có kiểm soát: một bộ câu hỏi nhỏ, một máy và cấu hình riêng cho từng dự án.

Xem so sánh và video trên X
@MorrisMz81 · Tác giả AnyJev
“The latency is real. We went correctness first.”

Jiamu “Morris” Zhang cho biết bản đầu chưa tối ưu hệ thống phục vụ mô hình. Anh mô tả AnyJev là phương pháp áp dụng cho các mô hình mà nhóm đang vận hành và cho biết việc tối ưu vLLM/SGLang đang bắt đầu.

Đọc toàn bộ phản hồi của tác giả
@Marktechpost · Tổng quan truyền thông

Tổng quan ngắn về dự án và benchmark đã lưu.

MarkTechPost tóm tắt cách trích xuất quyết định có cấu trúc, khác biệt L0/L1 và kết quả BANKING77. Các số liệu đến từ benchmark của dự án, không phải phép lặp độc lập.

Giới hạn bằng chứng: Jev AI Dev đã xác minh các bài đăng có nêu những thông tin này nhưng chưa tái tạo thử nghiệm cộng đồng. Lượt xem và tương tác được lược bỏ vì thay đổi theo thời gian.

Trước khi đưa vào production

Hiểu rõ những gì bản hiện tại chưa giải quyết.

Đầu ra có cấu trúc giải quyết một vấn đề tích hợp, nhưng không tự động bảo đảm phán đoán ngữ nghĩa là đúng, an toàn hoặc áp dụng tốt cho một phân phối dữ liệu khác.

01

L0 tốn thêm tính toán khi có nhiều lựa chọn

Lựa chọn gồm K phương án dùng xoay vòng, nên việc hiệu chỉnh không nhãn cần K lần prefill. Đổi lại, hệ thống ổn định hơn trước thay đổi thứ tự lựa chọn.

02

L1 và L2 cần nhãn từ quy trình thực tế

Bộ hiệu chỉnh và lớp đầu ra gắn với một mô hình và câu hỏi cụ thể. Cần xây dựng hoặc xác thực lại khi một trong hai thay đổi.

03

L2 cần truy cập trạng thái ẩn

Đường L2 hiện dùng backend Transformers cục bộ. Các công cụ phục vụ mô hình như vLLM và SGLang nằm trong lộ trình.

04

Số liệu công bố không thay thế tiêu chí nghiệm thu

Đo độ chính xác, hiệu chỉnh, độ nhạy với thứ tự và khả năng từ chối trên dữ liệu đại diện trước khi dùng xác suất để điều khiển hành động quan trọng.

Nguồn chính

Kiểm tra dự án tại nguồn.

AnyJev phát triển nhanh. Hãy kiểm tra bản phát hành, backend và giới hạn mới nhất trước khi tích hợp.

Khám phá hệ sinh thái

So sánh AnyJev với các dự án cộng đồng System One khác.

AnyJev điều chỉnh LLM nhân quả mở tại thời điểm ra quyết định. Hệ sinh thái còn có mô hình được huấn luyện riêng, runtime cục bộ và thử nghiệm tương thích API.

Đọc hướng dẫn System One Xem dự án cộng đồng