คู่มืออิสระ · ตรวจสอบเมื่อ 25 กันยายน 2026

AnyJev เปลี่ยน LLM แบบเปิดให้เป็นโมเดลตัดสินใจที่มีโครงสร้าง

AnyJev คือชุดเครื่องมือ Python แบบโอเพนซอร์สจาก Nokia Applied Research ซึ่งดึงผลลัพธ์ Choice, Score และ Noul จากโมเดลภาษาแบบ causal แล้วลดอคติจากลำดับตัวเลือกและปรับเทียบความน่าจะเป็น

ข้อควรรู้: AnyJev ไม่ใช่โมเดลพื้นฐานตัวใหม่ ไม่ใช่การเปิดเผยน้ำหนัก Jev ของ TypeSafe และไม่ใช่ผลิตภัณฑ์ Jev อย่างเป็นทางการ แต่เป็นวิธีอิสระในการสร้างการตัดสินใจรูปแบบ Jev บนโมเดลที่คุณรันเอง

ผู้ดูแล
Nokia Applied Research
สัญญาอนุญาต
Apache-2.0
แพ็กเกจ
anyjev บน PyPI
สถานะ
Pre-alpha
AnyJev · L0state → typed decisions
บริบท

ฉันถูกเรียกเก็บเงินสองครั้ง โปรดแก้ไขภายในวันนี้

choice · การส่งต่อทีมใดควรรับเรื่องนี้?
การเรียกเก็บเงิน0.81
เทคนิค0.09
ฝ่ายขาย0.04
อื่น ๆ0.06
result.level = "L0"ผลลัพธ์ตัวอย่าง
ความแตกต่างที่สำคัญ

AnyJev คือชุดเครื่องมือ ไม่ใช่น้ำหนักโมเดลชุดใหม่

โมเดลแบบ causal ที่คุณเลือกยังคงเดิม สิ่งที่เปลี่ยนคือวิธีอ่านคำถามที่จำกัดชุดคำตอบ จึงใกล้เคียงเลเยอร์สำหรับตัดสินใจมากกว่าโมเดลเดี่ยวอย่างตัวจำแนกที่ผ่านการ fine-tune

สิ่งที่เป็น

ชั้นอ่านผลลัพธ์แบบมีโครงสร้างสำหรับโมเดลเปิด

คุณกำหนดบริบทและคำถามที่จำกัดชุดคำตอบ AnyJev จะคืนการกระจายสำหรับตัวเลือกหมวดหมู่ ความน่าจะเป็นสำหรับคำถามใช่/ไม่ใช่ หรือค่าคาดหวังบนสเกลที่มีลำดับ

สิ่งที่เพิ่ม

ระดับการแก้อคติและการปรับเทียบ

logit ของโทเค็นคำตอบดิบอาจเอนเอียงไปยังป้ายกำกับหรือตำแหน่ง AnyJev ระบุระดับการแก้ไขของแต่ละการตัดสินใจ เพื่อให้แอปกำหนดระดับที่ต้องการได้

สิ่งที่ไม่ใช่

ไม่ใช่สำเนาเปิดของ TypeSafe Jev

โครงการไม่ได้เผยแพร่หรือทำซ้ำน้ำหนักส่วนตัว ข้อมูลฝึก หรือวิธี RLCD ของ TypeSafe รูปแบบคำขอที่คล้ายกันไม่ยืนยันว่าพฤติกรรมเทียบเท่ากัน

ดิบ → L0 → L1 → L2

ทั้งสี่ระดับบอกชัดว่าการตัดสินใจแต่ละครั้งผ่านการแก้อคติและปรับเทียบระดับใด

L0 ใช้งานได้โดยไม่ต้องฝึก ส่วนระดับที่สูงขึ้นใช้ตัวอย่างที่มีป้ายกำกับ และ L2 จะฟิตชั้นเอาต์พุตขนาดเล็กเฉพาะคำถามโดยไม่เปลี่ยนน้ำหนักโมเดลฐาน

ดิบไม่ใช้ป้ายกำกับ

อ่าน softmax แบบจำกัดจาก logit ของโทเค็นคำตอบ

ไม่แก้อคติจากตำแหน่งตัวเลือกหรือความชอบป้ายกำกับ

L0ไม่ใช้ป้ายกำกับ

หมุนลำดับตัวเลือกและแก้ความน่าจะเป็นตั้งต้นของป้ายกำกับที่ประมาณไว้

เสถียรขึ้น แต่ความน่าจะเป็นยังไม่ปรับเทียบกับงาน

L1100–500 ป้ายกำกับ

เพิ่ม temperature calibration สำหรับหนึ่งโมเดลและหนึ่งคำถาม

ปรับการประเมินความมั่นใจ แต่ไม่แก้อันดับที่ผิด

L2100–300 ป้ายกำกับ

ฟิตชั้นเอาต์พุตขนาดเล็กแบบ closed-form บนสถานะแฝงระหว่างทาง

เฉพาะโมเดลและคำถาม ต้องเข้าถึงสถานะแฝง (hidden state) ในเครื่อง

ตัวอย่างเวิร์กโฟลว์ในเครื่อง

ส่งต่อทิกเก็ตซัพพอร์ตและตรวจสอบการดำเนินการที่เสนอ

ตัวอย่างนี้อิง API สาธารณะของโครงการ: โมเดล Qwen อยู่ในเครื่อง AnyJev อ่านคำถามที่จำกัดชุดคำตอบสองข้อ และโค้ดแอปกำหนดขั้นตอนถัดไป

ติดตั้งแบ็กเอนด์ Transformers
pip install "anyjev[hf]"

ต้องใช้ Python 3.10 ขึ้นไป การรันจริงครั้งแรกจะดาวน์โหลดโมเดลเปิดที่คุณเลือกด้วย

PythonChoice + Noul
from anyjev import Decider, Question
from anyjev.backends.hf import HFBackend

decider = Decider(HFBackend("Qwen/Qwen3-8B"))

route = Question.choice(
    "Which team should handle this?",
    ["billing", "technical", "sales", "other"],
    name="route",
)
risky = Question.noul(
    "Is this tool call destructive or irreversible?",
    name="risky",
)

result = decider.decide(
    {"message": "I was charged twice.", "tool_call": "refund"},
    [route, risky],
)

result["route"].distribution
result["risky"].p_true
result.level  # "L0"
01

กำหนดขอบเขตคำตอบ

แอประบุทีมที่เลือกได้ และถามว่าการเรียกเครื่องมือที่เสนอมีความเสี่ยงหรือไม่

02

อ่านการกระจายของคำตอบ

ไม่มีการสร้างคำตอบแบบอิสระ ผลลัพธ์จะมีการกระจายหรือความน่าจะเป็นและระดับที่ใช้

03

เก็บนโยบายไว้ในโค้ด

โค้ดกำหนดเกณฑ์ ส่งกรณีไม่แน่ใจให้ตรวจสอบ และป้องกันผลข้างเคียงเมื่อความเสี่ยงสูงเกินไป

Benchmark จากโครงการ

ผลลัพธ์สำคัญคือการทำงานอัตโนมัติที่ปลอดภัยขึ้น ไม่ใช่แค่ความแม่นยำ

AnyJev รายงานผล Qwen3-8B ต่อไปนี้จากตัวอย่างทดสอบ BANKING77 จำนวน 300 รายการ ตัวเลขมาจาก artifact ที่ผู้เขียนบันทึกไว้ในรีโพซิทอรี; Jev AI Dev ยังไม่ได้รัน benchmark ซ้ำอย่างอิสระ

ตัวชี้วัดlogit ดิบAnyJev L0AnyJev L1
คำตอบเปลี่ยนเมื่อกลับลำดับตัวเลือก0.2300.0730.077
ความแม่นยำ0.7470.8030.807
ค่าคลาดเคลื่อนการปรับเทียบคาดหวัง0.2400.1840.095
ความครอบคลุมที่ความผิดพลาดไม่เกิน 5%7.7%46.3%52.0%

ความแม่นยำเพิ่มจาก 0.747 เป็น 0.807 ในการทดสอบนี้ การเปลี่ยนแปลงเชิงปฏิบัติที่ใหญ่กว่าคือความครอบคลุมที่ความผิดพลาดไม่เกิน 5%: 7.7% สำหรับ logit ดิบ และ 52.0% หลังปรับเทียบ L1 ตัวเลขนี้มาจากชุดทดสอบขนาดเล็กและต้องตรวจสอบก่อนใช้กับเวิร์กโฟลว์อื่น

ตรวจสอบ benchmark และ ablation
วิดีโอจากชุมชน · 29 วินาที

ชมคำอธิบายสั้น ๆ เกี่ยวกับการเปลี่ยน LLM ให้เป็นตัวตัดสินใจแบบ Jev

Data Science in your pocket เผยแพร่คลิปแนะนำนี้หลัง AnyJev เปิดตัว นี่เป็นคำอธิบายจากบุคคลที่สาม ไม่ใช่เดโมทางการของ Nokia Applied Research หรือ benchmark อิสระ

ดู “How to convert any LLM into Jev AI?” บน YouTube
การทดสอบจากชุมชน · กันยายน 2026

การทดสอบ 20 ทิกเก็ตเผยให้เห็นข้อแลกเปลี่ยนระหว่างความแม่นยำกับความหน่วง

WquGuru เปรียบเทียบ Jev ทางการกับโครงการเปิดสามรายการบน MacBook เครื่องเดียว โดยใช้ทิกเก็ตซัพพอร์ตภาษาจีน 20 รายการ โพสต์มีวิดีโอ เวลา และความแม่นยำของแต่ละโครงการ

@wquguru · เปรียบเทียบจากการใช้งาน

มีรายงานว่า AnyJev ที่ใช้ Qwen3-4B ตอบถูก 19 จาก 20 ทิกเก็ต

ความแม่นยำ95%19 / 20 ทิกเก็ต
ความหน่วง~4sรายงานต่อการทดสอบ
ชุดทดสอบ20ทิกเก็ตซัพพอร์ตภาษาจีน

โพสต์เดียวกันรายงาน 20/20 สำหรับ Jev ทางการ, 65% สำหรับ Laya และ 35% สำหรับ djev ควรมองว่าเป็นข้อสังเกตระยะแรกจากชุมชน ไม่ใช่ benchmark ที่ควบคุม: ใช้ชุดคำถามเล็ก เครื่องเดียว และการตั้งค่าต่างกันในแต่ละโครงการ

ดูการเปรียบเทียบและวิดีโอบน X
@MorrisMz81 · ผู้พัฒนา AnyJev
“The latency is real. We went correctness first.”

Jiamu “Morris” Zhang กล่าวว่ารีลีสแรกยังไม่ได้ปรับเส้นทางให้บริการโมเดล โดยอธิบายว่า AnyJev เป็นวิธีที่ใช้กับโมเดลซึ่งทีมให้บริการอยู่แล้ว และงานปรับ vLLM/SGLang เพิ่งเริ่มต้น

อ่านคำตอบฉบับเต็มของผู้พัฒนา
@Marktechpost · ภาพรวมจากสื่อ

สรุปโครงการและ benchmark ที่บันทึกไว้แบบกระชับ

MarkTechPost สรุปการดึงผลลัพธ์การตัดสินใจแบบมีโครงสร้าง ความต่างของ L0/L1 และผล BANKING77 ตัวเลขเหล่านี้มาจาก benchmark ของโครงการ ไม่ใช่การทำซ้ำอย่างอิสระ

ขอบเขตหลักฐาน: Jev AI Dev ตรวจสอบแล้วว่าโพสต์มีข้อความเหล่านี้ แต่ไม่ได้ทำการทดสอบจากชุมชนซ้ำ ยอดดูและการมีส่วนร่วมถูกตัดออกโดยตั้งใจเพราะเปลี่ยนแปลงตลอดเวลา

ก่อนใช้งานจริง

ทำความเข้าใจสิ่งที่รีลีสปัจจุบันยังแก้ไม่ได้

เอาต์พุตแบบมีโครงสร้างช่วยแก้ปัญหาการเชื่อมต่อหนึ่งด้าน แต่ไม่ได้รับประกันว่าการตัดสินเชิงความหมายจะถูกต้อง ปลอดภัย หรือใช้ได้กับการกระจายข้อมูลแบบอื่นโดยอัตโนมัติ

01

L0 ใช้การคำนวณเพิ่มเมื่อมีหลายตัวเลือก

การเลือก K ตัวเลือกใช้การหมุนแบบวน จึงต้อง prefill K ครั้งเพื่อแก้โดยไม่ใช้ป้ายกำกับ เป็นข้อแลกเปลี่ยนระหว่างต้นทุนการอนุมานกับความเสถียรต่อลำดับ

02

L1 และ L2 ต้องใช้ป้ายกำกับจากเวิร์กโฟลว์จริง

การปรับเทียบและชั้นเอาต์พุตผูกกับโมเดลและคำถามเฉพาะ ต้องสร้างใหม่หรือตรวจสอบซ้ำเมื่อส่วนใดเปลี่ยน

03

L2 ต้องเข้าถึงสถานะแฝง

เส้นทาง L2 ปัจจุบันใช้แบ็กเอนด์ Transformers ในเครื่อง ส่วนระบบอย่าง vLLM และ SGLang อยู่ในแผนพัฒนา

04

ตัวเลขที่เผยแพร่ไม่ใช่เกณฑ์ยอมรับก่อนใช้งานจริง

วัดความแม่นยำ การปรับเทียบ ความไวต่อลำดับ และการปฏิเสธตอบเมื่อไม่มั่นใจบนข้อมูลที่เป็นตัวแทน ก่อนให้ความน่าจะเป็นควบคุมการกระทำสำคัญ

แหล่งข้อมูลหลัก

ตรวจสอบโครงการจากต้นทาง

AnyJev เปลี่ยนแปลงเร็ว ควรตรวจสอบรีลีส แบ็กเอนด์ และข้อจำกัดล่าสุดก่อนนำไปใช้

สำรวจระบบนิเวศ

เปรียบเทียบ AnyJev กับโครงการ System One อื่นจากชุมชน

AnyJev ปรับ LLM แบบ causal ที่เปิดให้ใช้งานในช่วงตัดสินใจ ระบบนิเวศยังมีโมเดลที่ฝึกเฉพาะงาน สภาพแวดล้อมรันไทม์ในเครื่อง และการทดลองที่เข้ากันได้กับ API

อ่านคู่มือ System One ดูโครงการจากชุมชน