ชั้นอ่านผลลัพธ์แบบมีโครงสร้างสำหรับโมเดลเปิด
คุณกำหนดบริบทและคำถามที่จำกัดชุดคำตอบ AnyJev จะคืนการกระจายสำหรับตัวเลือกหมวดหมู่ ความน่าจะเป็นสำหรับคำถามใช่/ไม่ใช่ หรือค่าคาดหวังบนสเกลที่มีลำดับ
AnyJev คือชุดเครื่องมือ Python แบบโอเพนซอร์สจาก Nokia Applied Research ซึ่งดึงผลลัพธ์ Choice, Score และ Noul จากโมเดลภาษาแบบ causal แล้วลดอคติจากลำดับตัวเลือกและปรับเทียบความน่าจะเป็น
ข้อควรรู้: AnyJev ไม่ใช่โมเดลพื้นฐานตัวใหม่ ไม่ใช่การเปิดเผยน้ำหนัก Jev ของ TypeSafe และไม่ใช่ผลิตภัณฑ์ Jev อย่างเป็นทางการ แต่เป็นวิธีอิสระในการสร้างการตัดสินใจรูปแบบ Jev บนโมเดลที่คุณรันเอง
anyjev บน PyPIstate → typed decisionsฉันถูกเรียกเก็บเงินสองครั้ง โปรดแก้ไขภายในวันนี้
result.level = "L0"ผลลัพธ์ตัวอย่างโมเดลแบบ causal ที่คุณเลือกยังคงเดิม สิ่งที่เปลี่ยนคือวิธีอ่านคำถามที่จำกัดชุดคำตอบ จึงใกล้เคียงเลเยอร์สำหรับตัดสินใจมากกว่าโมเดลเดี่ยวอย่างตัวจำแนกที่ผ่านการ fine-tune
คุณกำหนดบริบทและคำถามที่จำกัดชุดคำตอบ AnyJev จะคืนการกระจายสำหรับตัวเลือกหมวดหมู่ ความน่าจะเป็นสำหรับคำถามใช่/ไม่ใช่ หรือค่าคาดหวังบนสเกลที่มีลำดับ
logit ของโทเค็นคำตอบดิบอาจเอนเอียงไปยังป้ายกำกับหรือตำแหน่ง AnyJev ระบุระดับการแก้ไขของแต่ละการตัดสินใจ เพื่อให้แอปกำหนดระดับที่ต้องการได้
โครงการไม่ได้เผยแพร่หรือทำซ้ำน้ำหนักส่วนตัว ข้อมูลฝึก หรือวิธี RLCD ของ TypeSafe รูปแบบคำขอที่คล้ายกันไม่ยืนยันว่าพฤติกรรมเทียบเท่ากัน
L0 ใช้งานได้โดยไม่ต้องฝึก ส่วนระดับที่สูงขึ้นใช้ตัวอย่างที่มีป้ายกำกับ และ L2 จะฟิตชั้นเอาต์พุตขนาดเล็กเฉพาะคำถามโดยไม่เปลี่ยนน้ำหนักโมเดลฐาน
ไม่แก้อคติจากตำแหน่งตัวเลือกหรือความชอบป้ายกำกับ
เสถียรขึ้น แต่ความน่าจะเป็นยังไม่ปรับเทียบกับงาน
ปรับการประเมินความมั่นใจ แต่ไม่แก้อันดับที่ผิด
เฉพาะโมเดลและคำถาม ต้องเข้าถึงสถานะแฝง (hidden state) ในเครื่อง
ตัวอย่างนี้อิง API สาธารณะของโครงการ: โมเดล Qwen อยู่ในเครื่อง AnyJev อ่านคำถามที่จำกัดชุดคำตอบสองข้อ และโค้ดแอปกำหนดขั้นตอนถัดไป
pip install "anyjev[hf]"ต้องใช้ Python 3.10 ขึ้นไป การรันจริงครั้งแรกจะดาวน์โหลดโมเดลเปิดที่คุณเลือกด้วย
Choice + Noulfrom anyjev import Decider, Question
from anyjev.backends.hf import HFBackend
decider = Decider(HFBackend("Qwen/Qwen3-8B"))
route = Question.choice(
"Which team should handle this?",
["billing", "technical", "sales", "other"],
name="route",
)
risky = Question.noul(
"Is this tool call destructive or irreversible?",
name="risky",
)
result = decider.decide(
{"message": "I was charged twice.", "tool_call": "refund"},
[route, risky],
)
result["route"].distribution
result["risky"].p_true
result.level # "L0"แอประบุทีมที่เลือกได้ และถามว่าการเรียกเครื่องมือที่เสนอมีความเสี่ยงหรือไม่
ไม่มีการสร้างคำตอบแบบอิสระ ผลลัพธ์จะมีการกระจายหรือความน่าจะเป็นและระดับที่ใช้
โค้ดกำหนดเกณฑ์ ส่งกรณีไม่แน่ใจให้ตรวจสอบ และป้องกันผลข้างเคียงเมื่อความเสี่ยงสูงเกินไป
AnyJev รายงานผล Qwen3-8B ต่อไปนี้จากตัวอย่างทดสอบ BANKING77 จำนวน 300 รายการ ตัวเลขมาจาก artifact ที่ผู้เขียนบันทึกไว้ในรีโพซิทอรี; Jev AI Dev ยังไม่ได้รัน benchmark ซ้ำอย่างอิสระ
| ตัวชี้วัด | logit ดิบ | AnyJev L0 | AnyJev L1 |
|---|---|---|---|
| คำตอบเปลี่ยนเมื่อกลับลำดับตัวเลือก | 0.230 | 0.073 | 0.077 |
| ความแม่นยำ | 0.747 | 0.803 | 0.807 |
| ค่าคลาดเคลื่อนการปรับเทียบคาดหวัง | 0.240 | 0.184 | 0.095 |
| ความครอบคลุมที่ความผิดพลาดไม่เกิน 5% | 7.7% | 46.3% | 52.0% |
ความแม่นยำเพิ่มจาก 0.747 เป็น 0.807 ในการทดสอบนี้ การเปลี่ยนแปลงเชิงปฏิบัติที่ใหญ่กว่าคือความครอบคลุมที่ความผิดพลาดไม่เกิน 5%: 7.7% สำหรับ logit ดิบ และ 52.0% หลังปรับเทียบ L1 ตัวเลขนี้มาจากชุดทดสอบขนาดเล็กและต้องตรวจสอบก่อนใช้กับเวิร์กโฟลว์อื่น
ตรวจสอบ benchmark และ ablationData Science in your pocket เผยแพร่คลิปแนะนำนี้หลัง AnyJev เปิดตัว นี่เป็นคำอธิบายจากบุคคลที่สาม ไม่ใช่เดโมทางการของ Nokia Applied Research หรือ benchmark อิสระ
ดู “How to convert any LLM into Jev AI?” บน YouTubeWquGuru เปรียบเทียบ Jev ทางการกับโครงการเปิดสามรายการบน MacBook เครื่องเดียว โดยใช้ทิกเก็ตซัพพอร์ตภาษาจีน 20 รายการ โพสต์มีวิดีโอ เวลา และความแม่นยำของแต่ละโครงการ
โพสต์เดียวกันรายงาน 20/20 สำหรับ Jev ทางการ, 65% สำหรับ Laya และ 35% สำหรับ djev ควรมองว่าเป็นข้อสังเกตระยะแรกจากชุมชน ไม่ใช่ benchmark ที่ควบคุม: ใช้ชุดคำถามเล็ก เครื่องเดียว และการตั้งค่าต่างกันในแต่ละโครงการ
ดูการเปรียบเทียบและวิดีโอบน X“The latency is real. We went correctness first.”
Jiamu “Morris” Zhang กล่าวว่ารีลีสแรกยังไม่ได้ปรับเส้นทางให้บริการโมเดล โดยอธิบายว่า AnyJev เป็นวิธีที่ใช้กับโมเดลซึ่งทีมให้บริการอยู่แล้ว และงานปรับ vLLM/SGLang เพิ่งเริ่มต้น
อ่านคำตอบฉบับเต็มของผู้พัฒนาMarkTechPost สรุปการดึงผลลัพธ์การตัดสินใจแบบมีโครงสร้าง ความต่างของ L0/L1 และผล BANKING77 ตัวเลขเหล่านี้มาจาก benchmark ของโครงการ ไม่ใช่การทำซ้ำอย่างอิสระ
ขอบเขตหลักฐาน: Jev AI Dev ตรวจสอบแล้วว่าโพสต์มีข้อความเหล่านี้ แต่ไม่ได้ทำการทดสอบจากชุมชนซ้ำ ยอดดูและการมีส่วนร่วมถูกตัดออกโดยตั้งใจเพราะเปลี่ยนแปลงตลอดเวลา
เอาต์พุตแบบมีโครงสร้างช่วยแก้ปัญหาการเชื่อมต่อหนึ่งด้าน แต่ไม่ได้รับประกันว่าการตัดสินเชิงความหมายจะถูกต้อง ปลอดภัย หรือใช้ได้กับการกระจายข้อมูลแบบอื่นโดยอัตโนมัติ
การเลือก K ตัวเลือกใช้การหมุนแบบวน จึงต้อง prefill K ครั้งเพื่อแก้โดยไม่ใช้ป้ายกำกับ เป็นข้อแลกเปลี่ยนระหว่างต้นทุนการอนุมานกับความเสถียรต่อลำดับ
การปรับเทียบและชั้นเอาต์พุตผูกกับโมเดลและคำถามเฉพาะ ต้องสร้างใหม่หรือตรวจสอบซ้ำเมื่อส่วนใดเปลี่ยน
เส้นทาง L2 ปัจจุบันใช้แบ็กเอนด์ Transformers ในเครื่อง ส่วนระบบอย่าง vLLM และ SGLang อยู่ในแผนพัฒนา
วัดความแม่นยำ การปรับเทียบ ความไวต่อลำดับ และการปฏิเสธตอบเมื่อไม่มั่นใจบนข้อมูลที่เป็นตัวแทน ก่อนให้ความน่าจะเป็นควบคุมการกระทำสำคัญ
AnyJev เปลี่ยนแปลงเร็ว ควรตรวจสอบรีลีส แบ็กเอนด์ และข้อจำกัดล่าสุดก่อนนำไปใช้
AnyJev ปรับ LLM แบบ causal ที่เปิดให้ใช้งานในช่วงตัดสินใจ ระบบนิเวศยังมีโมเดลที่ฝึกเฉพาะงาน สภาพแวดล้อมรันไทม์ในเครื่อง และการทดลองที่เข้ากันได้กับ API