Guia independente · Revisto em 25 de setembro de 2026

AnyJev transforma um LLM aberto num modelo de decisão tipado.

O AnyJev é um toolkit Python de código aberto da Nokia Applied Research. Lê decisões Choice, Score e Noul a partir de modelos de linguagem causais e acrescenta controlos para o viés da ordem das opções e a calibração de probabilidades.

Importante: O AnyJev não é um novo modelo de base, uma versão aberta dos pesos Jev da TypeSafe nem um produto Jev oficial. É uma forma independente de criar decisões com a estrutura de Jev sobre modelos executados por si.

Responsável
Nokia Applied Research
Licença
Apache-2.0
Pacote
anyjev no PyPI
Estado
Pré-alfa
AnyJev · L0state → typed decisions
contexto

Cobraram-me duas vezes. Preciso que resolvam isto hoje.

choice · encaminhamentoQue equipa deve tratar deste pedido?
faturação0.81
técnica0.09
vendas0.04
outra0.06
result.level = "L0"Saída ilustrativa
A diferença importante

O AnyJev é um toolkit, não outro conjunto de pesos.

Mantém o modelo causal escolhido e altera a forma como uma decisão com um conjunto fechado de respostas é lida. Por isso, está mais próximo de uma camada de decisão do que de um modelo autónomo, como um classificador afinado.

O que é

Uma leitura tipada para modelos abertos

Define um contexto e uma ou mais perguntas com um conjunto fechado de respostas. O AnyJev devolve distribuições para escolhas categóricas, uma probabilidade para perguntas de sim/não ou um valor esperado numa escala ordenada.

O que acrescenta

Níveis de correção de viés e calibração

Os logits dos tokens de resposta podem favorecer uma etiqueta ou a respetiva posição. O AnyJev expõe o nível de correção que produziu cada decisão, permitindo à aplicação exigir o nível esperado.

O que não é

Uma cópia aberta do TypeSafe Jev

O projeto não publica nem reproduz os pesos privados, os dados de treino ou o método RLCD da TypeSafe. Pedidos com estrutura semelhante não garantem comportamento equivalente.

Bruto → L0 → L1 → L2

Quatro níveis tornam explícita a evidência associada a uma decisão.

L0 funciona efetivamente sem treino. Os níveis superiores acrescentam exemplos etiquetados; L2 ajusta uma pequena camada de saída específica da pergunta sem atualizar os pesos do modelo base.

BrutoSem etiquetas

Lê um softmax restrito sobre os logits dos tokens de resposta.

Sem correção da posição das opções ou da preferência por etiquetas.

L0Sem etiquetas

Roda as opções e corrige a probabilidade prévia estimada da etiqueta.

Mais estável, mas as probabilidades não estão calibradas para a tarefa.

L1100–500 etiquetas

Acrescenta calibração por temperatura para um modelo e uma pergunta.

Melhora as estimativas de confiança, mas não corrige uma ordenação errada.

L2100–300 etiquetas

Ajusta uma pequena camada de saída em forma fechada sobre um estado oculto intermédio.

Específico de um modelo e pergunta; requer acesso local aos estados ocultos.

Exemplo de fluxo local

Encaminhe um pedido de suporte e verifique uma ação proposta.

Este exemplo segue a API pública do projeto: um modelo Qwen permanece local, o AnyJev lê duas decisões com um conjunto fechado de respostas e o código da aplicação decide o passo seguinte.

Instalar o backend Transformers
pip install "anyjev[hf]"

É necessário Python 3.10 ou posterior. A primeira execução real também transfere o modelo aberto escolhido.

PythonChoice + Noul
from anyjev import Decider, Question
from anyjev.backends.hf import HFBackend

decider = Decider(HFBackend("Qwen/Qwen3-8B"))

route = Question.choice(
    "Which team should handle this?",
    ["billing", "technical", "sales", "other"],
    name="route",
)
risky = Question.noul(
    "Is this tool call destructive or irreversible?",
    name="risky",
)

result = decider.decide(
    {"message": "I was charged twice.", "tool_call": "refund"},
    [route, risky],
)

result["route"].distribution
result["risky"].p_true
result.level  # "L0"
01

Defina o espaço de resposta

A aplicação indica as equipas permitidas e pergunta se a chamada de ferramenta proposta é arriscada.

02

Leia distribuições limitadas

Não é gerada uma resposta livre. O resultado inclui uma distribuição ou probabilidade e o nível usado.

03

Mantenha a política no código

O seu código define limiares, envia casos incertos para revisão e impede efeitos quando o risco é demasiado elevado.

Benchmark do projeto

O resultado de destaque é uma automação mais segura, não apenas maior precisão.

O AnyJev publica os seguintes resultados do Qwen3-8B em 300 itens de teste do BANKING77. Os valores são comunicados pelos autores a partir de artefactos guardados no repositório; a Jev AI Dev não repetiu o benchmark de forma independente.

MétricaLogits brutosAnyJev L0AnyJev L1
Respostas alteradas ao inverter as opções0.2300.0730.077
Precisão0.7470.8030.807
Erro de calibração esperado0.2400.1840.095
Cobertura com no máximo 5% de erro7.7%46.3%52.0%

Neste teste, a precisão passou de 0,747 para 0,807. A maior mudança operacional foi a cobertura com até 5% de erro: 7,7% para logits brutos e 52,0% após calibração L1. A estimativa usa um conjunto pequeno e não deve ser aplicada a outro fluxo sem validação.

Consultar o benchmark e as ablações
Vídeo da comunidade · 29 segundos

Uma explicação rápida de como transformar um LLM num decisor ao estilo Jev.

A Data Science in your pocket publicou esta breve introdução depois do aparecimento do AnyJev. É uma explicação de terceiros, não uma demonstração oficial da Nokia Applied Research nem um benchmark independente.

Ver «How to convert any LLM into Jev AI?» no YouTube
Teste da comunidade · Setembro de 2026

Um teste com 20 pedidos expôs o compromisso entre precisão e latência.

A WquGuru comparou o Jev oficial e três projetos abertos num MacBook, usando 20 pedidos de suporte em chinês. A publicação inclui vídeo, tempos e precisão por projeto.

@wquguru · Comparação prática

O AnyJev com Qwen3-4B terá respondido corretamente a 19 de 20 pedidos.

Precisão95%19 de 20 pedidos
Latência~4sreportada por teste
Carga20pedidos em chinês

A mesma publicação indica 20/20 para o Jev oficial, 65% para o Laya e 35% para o djev. Trate estes dados como uma observação inicial da comunidade, não como benchmark controlado: há um conjunto pequeno, uma máquina e configurações diferentes por projeto.

Ver a comparação e o vídeo no X
@MorrisMz81 · Autor do AnyJev
“The latency is real. We went correctness first.”

Jiamu «Morris» Zhang disse que a primeira versão ainda não otimizava o caminho de serving. Apresentou o AnyJev como um método para modelos já servidos pela equipa e afirmou que o trabalho de otimização para vLLM/SGLang estava a começar.

Ler a resposta completa do autor
@Marktechpost · Visão geral nos media

Uma apresentação concisa do projeto e do benchmark versionado.

A MarkTechPost resume a leitura tipada, a diferença L0/L1 e os resultados BANKING77. Os números vêm do benchmark do projeto, não de uma replicação independente.

Limite da evidência: A Jev AI Dev confirmou que as publicações contêm estas afirmações, mas não reproduziu o teste da comunidade. As visualizações e interações são omitidas porque mudam ao longo do tempo.

Antes da produção

Saiba o que a versão atual não resolve.

Uma saída tipada elimina um problema de integração. Não torna um julgamento semântico correto, seguro ou transferível para outra distribuição.

01

L0 usa mais computação em escolhas extensas

Uma escolha com K opções usa rotações cíclicas, por isso a correção sem etiquetas requer K prefills. Troca trabalho de inferência por maior estabilidade à ordem.

02

L1 e L2 precisam de etiquetas do fluxo real

A calibração e as camadas de saída pertencem a um modelo e pergunta específicos. Devem ser reconstruídas ou revalidadas quando um deles muda.

03

L2 requer acesso aos estados ocultos

O caminho L2 atual usa um backend Transformers local. Motores de inferência como vLLM e SGLang estão no roteiro do projeto.

04

Os números publicados não são o seu teste de aceitação

Meça precisão, calibração, sensibilidade à ordem e abstenção em dados representativos antes de uma probabilidade controlar uma ação importante.

Fontes primárias

Confirme o projeto na fonte.

O AnyJev evolui rapidamente. Verifique a versão, os backends e as limitações antes de o integrar.

Explore o ecossistema

Compare o AnyJev com outros projetos da comunidade System One.

O AnyJev segue uma abordagem: adaptar um LLM causal aberto no momento da decisão. O ecossistema inclui também modelos treinados para a tarefa, runtimes locais e experiências compatíveis com a API.

Ler o guia System One Ver projetos da comunidade