오픈 모델용 구조화된 결정 읽기 계층
상태와 답의 범위가 정해진 질문을 정의하면 범주별 확률 분포, 예/아니오 확률, 순서형 점수의 기댓값을 반환합니다.
AnyJev는 Nokia Applied Research가 공개한 오픈 소스 Python 도구입니다. 인과 언어 모델에서 Choice, Score, Noul 형태의 결정을 읽고 선택지 순서 편향 완화와 확률 보정을 더합니다.
중요: AnyJev는 새로운 기반 모델도, TypeSafe Jev 가중치의 공개 버전도, Jev 공식 제품도 아닙니다. 이미 운영 중인 모델에 Jev 형태의 의사결정 인터페이스를 더하는 독립적인 방법입니다.
anyjev (PyPI)state → typed decisions요금이 두 번 청구됐습니다. 오늘 처리해 주세요.
result.level = "L0"예시 출력선택한 인과 언어 모델은 그대로 두고 답의 범위가 정해진 판단을 읽는 방식만 바꿉니다. 별도의 미세 조정 분류기보다는 의사결정 계층에 가깝습니다.
상태와 답의 범위가 정해진 질문을 정의하면 범주별 확률 분포, 예/아니오 확률, 순서형 점수의 기댓값을 반환합니다.
원시 답변 token logits는 특정 레이블이나 위치를 선호할 수 있습니다. AnyJev는 각 결정에 사용한 보정 레벨을 보여 주므로 애플리케이션이 필요한 수준을 요구할 수 있습니다.
TypeSafe의 비공개 가중치, 학습 데이터, RLCD 방식을 공개하거나 재현하지 않습니다. 요청 형식이 비슷하다고 같은 동작을 보장하지는 않습니다.
L0는 학습 레이블이 필요 없습니다. 상위 레벨은 레이블이 붙은 예시를 사용하며, L2는 기반 모델 가중치를 바꾸지 않고 질문 전용의 작은 출력 헤드를 학습합니다.
선택지 위치나 레이블 선호를 보정하지 않습니다.
순서에는 더 안정적이지만 확률은 작업별로 보정되지 않았습니다.
신뢰도 추정은 개선하지만 잘못된 순위를 고치지는 않습니다.
특정 모델과 질문에 종속되며 로컬 은닉 상태 접근이 필요합니다.
공개 API 형태를 따른 간단한 예시입니다. Qwen은 로컬에서 실행되고 AnyJev가 답의 범위가 정해진 두 가지 판단을 읽으며 이후 동작은 일반 코드가 정합니다.
pip install "anyjev[hf]"Python 3.10 이상이 필요합니다. 첫 실제 실행에서는 선택한 오픈 모델도 내려받습니다.
Choice + Noulfrom anyjev import Decider, Question
from anyjev.backends.hf import HFBackend
decider = Decider(HFBackend("Qwen/Qwen3-8B"))
route = Question.choice(
"Which team should handle this?",
["billing", "technical", "sales", "other"],
name="route",
)
risky = Question.noul(
"Is this tool call destructive or irreversible?",
name="risky",
)
result = decider.decide(
{"message": "I was charged twice.", "tool_call": "refund"},
[route, risky],
)
result["route"].distribution
result["risky"].p_true
result.level # "L0"담당 가능한 팀을 나열하고 예정된 도구 호출이 파괴적인지 묻습니다.
자유 형식 답변은 만들지 않습니다. 결과에는 분포 또는 확률과 사용된 레벨이 포함됩니다.
임계값, 검토 전환, 위험한 부작용 차단은 애플리케이션 코드가 담당합니다.
AnyJev는 Qwen3-8B를 BANKING77 테스트 300개로 평가한 결과를 공개했습니다. 수치는 개발자가 저장소에 공개한 벤치마크 산출물에서 가져왔으며 Jev AI Dev가 독립적으로 재실행하지 않았습니다.
| 지표 | 원시 logits | AnyJev L0 | AnyJev L1 |
|---|---|---|---|
| 선택지 역순 배치 후 답변 변경률 | 0.230 | 0.073 | 0.077 |
| 정확도 | 0.747 | 0.803 | 0.807 |
| 기대 보정 오차 | 0.240 | 0.184 | 0.095 |
| 오류율 5% 이하에서의 커버리지 | 7.7% | 46.3% | 52.0% |
이 평가에서 정확도는 0.747에서 0.807로 올랐습니다. 운영상 더 큰 변화는 오류율 5% 이하의 커버리지가 원시 logits 7.7%에서 L1 보정 후 52.0%로 늘어난 점입니다. 작은 테스트셋이므로 다른 업무에 그대로 적용할 수 없습니다.
벤치마크와 제거 실험 보기Data Science in your pocket이 AnyJev 공개 후 만든 짧은 소개입니다. Nokia Applied Research의 공식 데모도, 독립 벤치마크도 아닙니다.
YouTube에서 ‘How to convert any LLM into Jev AI?’ 보기WquGuru는 MacBook 한 대와 중국어 지원 티켓 20개로 공식 Jev와 세 오픈 프로젝트를 비교했습니다. 스레드에는 영상, 처리 시간, 프로젝트별 정확도가 포함됩니다.
같은 스레드는 공식 Jev 20/20, Laya 65%, djev 35%를 보고합니다. 문항이 적고 한 대의 장비만 사용했으며 프로젝트별 모델 구성도 달라 통제된 벤치마크가 아닌 초기 커뮤니티 관찰로 봐야 합니다.
X에서 비교와 영상 보기“The latency is real. We went correctness first.”
Jiamu ‘Morris’ Zhang은 첫 버전의 서빙 경로가 아직 최적화되지 않았다고 설명했습니다. AnyJev는 또 하나의 Jev 모델이 아니라 팀이 이미 운영하는 모델을 의사결정 계층으로 만드는 방법이며, vLLM/SGLang 최적화가 막 시작된 단계라고 밝혔습니다.
개발자 답변 전체 읽기MarkTechPost는 구조화된 결정 읽기, L0/L1 차이, BANKING77 결과를 요약합니다. 수치는 프로젝트 자체 평가에서 나온 것이며 별도 재현 실험은 아닙니다.
근거의 범위: Jev AI Dev는 게시물에 위 내용이 있음을 확인했지만 커뮤니티 테스트를 재현하지 않았습니다. 조회수와 반응 수는 계속 바뀌므로 본문에 고정해 싣지 않았습니다.
구조화된 출력은 인터페이스 문제를 줄이지만 의미 판단의 정확성, 안전성, 다른 분포로의 이전 가능성을 보장하지 않습니다.
K개 선택지를 순환하므로 레이블 없는 보정에는 K번의 prefill이 필요합니다. 추론 비용과 순서 안정성을 맞바꿉니다.
보정기와 헤드는 특정 모델과 질문에 속합니다. 둘 중 하나가 바뀌면 다시 만들거나 검증해야 합니다.
현재 L2는 로컬 Transformers 백엔드를 사용합니다. vLLM과 SGLang 같은 서빙 엔진은 로드맵에 있습니다.
확률이 중요한 작업을 제어하기 전에 대표 데이터로 정확도, 보정, 순서 민감도, 거부 전략을 측정하세요.
AnyJev는 빠르게 변하고 있습니다. 도입 전 최신 릴리스, 지원 백엔드, 한계를 확인하세요.
AnyJev는 기존 오픈 인과 언어 모델을 결정 시점에 적응시키는 접근입니다. 전용 학습 모델, 로컬 런타임, API 호환 실험도 함께 살펴볼 수 있습니다.