Lớp đọc quyết định có cấu trúc cho mô hình mở
Bạn xác định ngữ cảnh và một hoặc nhiều câu hỏi có phạm vi trả lời giới hạn. AnyJev trả về phân phối cho lựa chọn phân loại, xác suất cho câu hỏi có/không hoặc giá trị kỳ vọng trên thang điểm có thứ tự.
AnyJev là bộ công cụ Python mã nguồn mở của Nokia Applied Research. Công cụ trích xuất các kết quả Choice, Score và Noul từ mô hình ngôn ngữ nhân quả, sau đó giảm thiên lệch do thứ tự lựa chọn và hiệu chỉnh xác suất.
Lưu ý: AnyJev không phải mô hình nền tảng mới, không phải bản phát hành mở của trọng số Jev do TypeSafe sở hữu và cũng không phải sản phẩm Jev chính thức. Đây là cách độc lập để tạo quyết định theo cấu trúc Jev trên mô hình bạn tự vận hành.
anyjev trên PyPIstate → typed decisionsTôi bị tính phí hai lần. Vui lòng xử lý trong hôm nay.
result.level = "L0"Kết quả minh họaMô hình nhân quả bạn chọn vẫn được giữ nguyên; AnyJev chỉ thay đổi cách trích xuất quyết định trong một không gian trả lời giới hạn. Vì vậy, nó gần với một lớp quyết định hơn là một mô hình độc lập như bộ phân loại đã tinh chỉnh.
Bạn xác định ngữ cảnh và một hoặc nhiều câu hỏi có phạm vi trả lời giới hạn. AnyJev trả về phân phối cho lựa chọn phân loại, xác suất cho câu hỏi có/không hoặc giá trị kỳ vọng trên thang điểm có thứ tự.
Logit token trả lời thô có thể thiên về một nhãn hoặc vị trí. AnyJev cho biết cấp hiệu chỉnh tạo ra từng quyết định để ứng dụng có thể yêu cầu đúng cấp cần dùng.
Dự án không công bố hay tái tạo trọng số riêng, dữ liệu huấn luyện hoặc phương pháp RLCD của TypeSafe. Hình dạng yêu cầu tương tự không chứng minh hành vi tương đương.
L0 thực sự không cần huấn luyện. Các cấp cao hơn dùng ví dụ có nhãn; L2 khớp một lớp đầu ra nhỏ theo từng câu hỏi mà không cập nhật trọng số mô hình gốc.
Không sửa thiên lệch vị trí lựa chọn hoặc ưu tiên nhãn.
Ổn định hơn, nhưng xác suất chưa được hiệu chỉnh cho tác vụ.
Cải thiện ước lượng độ tin cậy, nhưng không sửa thứ hạng sai.
Gắn với một mô hình và câu hỏi; cần truy cập trạng thái ẩn tại chỗ.
Ví dụ bám theo API công khai: mô hình Qwen vẫn chạy cục bộ, AnyJev đọc hai quyết định giới hạn và mã ứng dụng xác định bước tiếp theo.
pip install "anyjev[hf]"Yêu cầu Python 3.10 trở lên. Lần chạy thực tế đầu tiên cũng tải mô hình mở bạn chọn.
Choice + Noulfrom anyjev import Decider, Question
from anyjev.backends.hf import HFBackend
decider = Decider(HFBackend("Qwen/Qwen3-8B"))
route = Question.choice(
"Which team should handle this?",
["billing", "technical", "sales", "other"],
name="route",
)
risky = Question.noul(
"Is this tool call destructive or irreversible?",
name="risky",
)
result = decider.decide(
{"message": "I was charged twice.", "tool_call": "refund"},
[route, risky],
)
result["route"].distribution
result["risky"].p_true
result.level # "L0"Ứng dụng liệt kê các nhóm được phép và hỏi liệu lệnh gọi công cụ được đề xuất có rủi ro hay không.
Không sinh câu trả lời tự do. Kết quả chứa phân phối hoặc xác suất cùng cấp độ đã dùng.
Mã đặt ngưỡng, chuyển trường hợp không chắc chắn sang kiểm duyệt và ngăn tác động phụ khi rủi ro quá cao.
AnyJev công bố các kết quả Qwen3-8B sau trên 300 mẫu thử BANKING77. Số liệu do tác giả báo cáo dựa trên các tệp benchmark đã lưu trong kho mã; Jev AI Dev chưa tự chạy lại thử nghiệm.
| Chỉ số | Logit thô | AnyJev L0 | AnyJev L1 |
|---|---|---|---|
| Câu trả lời đổi khi đảo thứ tự lựa chọn | 0.230 | 0.073 | 0.077 |
| Độ chính xác | 0.747 | 0.803 | 0.807 |
| Sai số hiệu chỉnh kỳ vọng | 0.240 | 0.184 | 0.095 |
| Độ bao phủ với sai số không quá 5% | 7.7% | 46.3% | 52.0% |
Trong thử nghiệm này, độ chính xác tăng từ 0,747 lên 0,807. Thay đổi vận hành lớn hơn là độ bao phủ ở mức sai số tối đa 5%: 7,7% với logit thô và 52,0% sau hiệu chỉnh L1. Ước lượng dựa trên tập thử nhỏ và cần xác thực trước khi áp dụng cho quy trình khác.
Xem benchmark và các thử nghiệm ablationData Science in your pocket đăng phần giới thiệu ngắn này sau khi AnyJev xuất hiện. Đây là nội dung của bên thứ ba, không phải demo chính thức của Nokia Applied Research hay benchmark độc lập.
Xem “How to convert any LLM into Jev AI?” trên YouTubeWquGuru so sánh Jev chính thức với ba dự án mở trên một MacBook bằng 20 phiếu hỗ trợ tiếng Trung. Chuỗi bài có video, thời gian và độ chính xác theo từng dự án.
Cùng chuỗi bài báo cáo 20/20 cho Jev chính thức, 65% cho Laya và 35% cho djev. Hãy xem đây là quan sát ban đầu của cộng đồng, không phải benchmark có kiểm soát: một bộ câu hỏi nhỏ, một máy và cấu hình riêng cho từng dự án.
Xem so sánh và video trên X“The latency is real. We went correctness first.”
Jiamu “Morris” Zhang cho biết bản đầu chưa tối ưu hệ thống phục vụ mô hình. Anh mô tả AnyJev là phương pháp áp dụng cho các mô hình mà nhóm đang vận hành và cho biết việc tối ưu vLLM/SGLang đang bắt đầu.
Đọc toàn bộ phản hồi của tác giảMarkTechPost tóm tắt cách trích xuất quyết định có cấu trúc, khác biệt L0/L1 và kết quả BANKING77. Các số liệu đến từ benchmark của dự án, không phải phép lặp độc lập.
Giới hạn bằng chứng: Jev AI Dev đã xác minh các bài đăng có nêu những thông tin này nhưng chưa tái tạo thử nghiệm cộng đồng. Lượt xem và tương tác được lược bỏ vì thay đổi theo thời gian.
Đầu ra có cấu trúc giải quyết một vấn đề tích hợp, nhưng không tự động bảo đảm phán đoán ngữ nghĩa là đúng, an toàn hoặc áp dụng tốt cho một phân phối dữ liệu khác.
Lựa chọn gồm K phương án dùng xoay vòng, nên việc hiệu chỉnh không nhãn cần K lần prefill. Đổi lại, hệ thống ổn định hơn trước thay đổi thứ tự lựa chọn.
Bộ hiệu chỉnh và lớp đầu ra gắn với một mô hình và câu hỏi cụ thể. Cần xây dựng hoặc xác thực lại khi một trong hai thay đổi.
Đường L2 hiện dùng backend Transformers cục bộ. Các công cụ phục vụ mô hình như vLLM và SGLang nằm trong lộ trình.
Đo độ chính xác, hiệu chỉnh, độ nhạy với thứ tự và khả năng từ chối trên dữ liệu đại diện trước khi dùng xác suất để điều khiển hành động quan trọng.
AnyJev phát triển nhanh. Hãy kiểm tra bản phát hành, backend và giới hạn mới nhất trước khi tích hợp.
AnyJev điều chỉnh LLM nhân quả mở tại thời điểm ra quyết định. Hệ sinh thái còn có mô hình được huấn luyện riêng, runtime cục bộ và thử nghiệm tương thích API.