Guía independiente · Revisada el 25 de septiembre de 2026

AnyJev convierte un LLM abierto en un modelo de decisión tipado.

AnyJev es una herramienta Python de código abierto de Nokia Applied Research. Extrae decisiones Choice, Score y Noul de modelos de lenguaje causales, y añade controles para el sesgo por orden de opciones y la calibración de probabilidades.

Importante: AnyJev no es un nuevo modelo fundacional, una publicación abierta de los pesos Jev de TypeSafe ni un producto Jev oficial. Es una forma independiente de crear decisiones con el formato de Jev sobre modelos que tú ejecutas.

Responsable
Nokia Applied Research
Licencia
Apache-2.0
Paquete
anyjev en PyPI
Estado
Prealfa
AnyJev · L0state → typed decisions
contexto

Me cobraron dos veces. Necesito que lo resuelvan hoy.

choice · enrutamiento¿Qué equipo debe gestionar este caso?
facturación0.81
soporte técnico0.09
ventas0.04
otro0.06
result.level = "L0"Salida ilustrativa
La diferencia clave

AnyJev es una herramienta, no otro conjunto de pesos.

Mantiene el modelo causal que elijas y cambia la forma de leer de él una decisión con un conjunto cerrado de respuestas. Por eso se parece más a una capa de decisión que a un modelo independiente, como un clasificador ajustado.

Qué es

Una lectura tipada para modelos abiertos

Defines un contexto y una o varias preguntas con un conjunto cerrado de respuestas. AnyJev devuelve distribuciones para opciones categóricas, una probabilidad para preguntas de sí/no o un valor esperado sobre una escala ordenada.

Qué añade

Niveles de corrección de sesgo y calibración

Los logits de los tokens de respuesta pueden favorecer una etiqueta o su posición. AnyJev indica qué nivel de corrección produjo cada decisión para que la aplicación pueda exigir el nivel previsto.

Qué no es

Una copia abierta de TypeSafe Jev

El proyecto no publica ni reproduce los pesos privados, los datos de entrenamiento ni el método RLCD de TypeSafe. Que las solicitudes se parezcan no implica un comportamiento equivalente.

Sin procesar → L0 → L1 → L2

Cuatro niveles dejan claro qué evidencia respalda cada decisión.

L0 sí funciona sin entrenamiento. Los niveles superiores añaden ejemplos etiquetados; L2 ajusta una pequeña capa de salida específica de la pregunta sin modificar los pesos del modelo base.

Sin procesarSin etiquetas

Lee un softmax restringido sobre los logits de tokens de respuesta.

No corrige la posición de las opciones ni la preferencia por etiquetas.

L0Sin etiquetas

Rota las opciones y corrige la probabilidad previa estimada de la etiqueta.

Es más estable, pero sus probabilidades no están calibradas para la tarea.

L1100–500 etiquetas

Añade calibración por temperatura para un modelo y una pregunta.

Mejora la estimación de confianza; no corrige un orden de respuestas equivocado.

L2100–300 etiquetas

Ajusta una pequeña capa de salida de forma cerrada sobre un estado oculto intermedio.

Es específica de un modelo y una pregunta y necesita acceso local al estado oculto.

Ejemplo de flujo local

Enruta un ticket de soporte y comprueba una acción propuesta.

Este ejemplo refleja la API pública del proyecto: un modelo Qwen permanece en local, AnyJev lee dos decisiones con un conjunto cerrado de respuestas y el código habitual decide qué ocurre después.

Instalar el backend de Transformers
pip install "anyjev[hf]"

Se necesita Python 3.10 o posterior. La primera ejecución real también descarga el modelo abierto que elijas.

PythonChoice + Noul
from anyjev import Decider, Question
from anyjev.backends.hf import HFBackend

decider = Decider(HFBackend("Qwen/Qwen3-8B"))

route = Question.choice(
    "Which team should handle this?",
    ["billing", "technical", "sales", "other"],
    name="route",
)
risky = Question.noul(
    "Is this tool call destructive or irreversible?",
    name="risky",
)

result = decider.decide(
    {"message": "I was charged twice.", "tool_call": "refund"},
    [route, risky],
)

result["route"].distribution
result["risky"].p_true
result.level  # "L0"
01

Define el espacio de respuesta

La aplicación enumera los equipos permitidos y pregunta si la llamada de herramienta propuesta es arriesgada.

02

Lee distribuciones acotadas

No se genera una respuesta libre. El resultado incluye una distribución o probabilidad y el nivel utilizado.

03

Mantén la política en el código

Tu código fija umbrales, envía los casos inciertos a revisión y evita efectos secundarios cuando el riesgo es demasiado alto.

Benchmark del proyecto

El resultado principal trata de automatizar con más seguridad, no solo de la precisión.

AnyJev publica estos resultados de Qwen3-8B sobre 300 elementos de prueba de BANKING77. Son cifras comunicadas por los autores a partir de artefactos incluidos en el repositorio; Jev AI Dev no ha repetido el benchmark de forma independiente.

MétricaLogits sin procesarAnyJev L0AnyJev L1
Cambios de respuesta al invertir las opciones0.2300.0730.077
Precisión0.7470.8030.807
Error de calibración esperado0.2400.1840.095
Cobertura con un máximo del 5 % de error7.7%46.3%52.0%

En esta prueba, la precisión pasó de 0,747 a 0,807. El mayor cambio operativo fue la cobertura con un máximo del 5 % de error: 7,7 % para los logits sin procesar y 52,0 % tras calibrar L1. La estimación parte de un conjunto pequeño y no debe trasladarse a otro flujo sin validación.

Consultar el benchmark y las ablaciones
Vídeo de la comunidad · 29 segundos

Una explicación breve de cómo convertir un LLM en un decisor al estilo Jev.

Data Science in your pocket publicó esta introducción poco después de aparecer AnyJev. Es una explicación de terceros, no una demo oficial de Nokia Applied Research ni un benchmark independiente.

Ver «How to convert any LLM into Jev AI?» en YouTube
Prueba de la comunidad · Septiembre de 2026

Una prueba con 20 tickets mostró el equilibrio entre precisión y latencia.

WquGuru comparó Jev oficial y tres proyectos abiertos en un MacBook con 20 tickets de soporte en chino. El hilo incluye vídeo, tiempos y precisión por proyecto.

@wquguru · Comparación práctica

AnyJev con Qwen3-4B habría resuelto correctamente 19 de 20 tickets.

Precisión95%19 de 20 tickets
Latencia~4scomunicada por prueba
Carga20tickets en chino

El mismo hilo informa de 20/20 para Jev oficial, 65 % para Laya y 35 % para djev. Tómalo como una observación temprana de la comunidad, no como un benchmark controlado: usa un conjunto pequeño, una sola máquina y configuraciones distintas por proyecto.

Ver la comparación y el vídeo en X
@MorrisMz81 · Autor de AnyJev
“The latency is real. We went correctness first.”

Jiamu «Morris» Zhang explicó que la primera versión aún no había optimizado la ruta de servicio. Presentó AnyJev como un método para modelos que el equipo ya sirve y señaló que empezaban las optimizaciones para vLLM/SGLang.

Leer la respuesta completa del autor
@Marktechpost · Resumen en medios

Un recorrido breve por el proyecto y su benchmark versionado.

MarkTechPost resume la lectura tipada, la diferencia L0/L1 y los resultados de BANKING77. Las cifras proceden del benchmark del proyecto, no de una réplica independiente.

Límite de la evidencia: Jev AI Dev comprobó que las publicaciones contienen estas afirmaciones, pero no reprodujo la prueba de la comunidad. Se omiten las cifras de visualizaciones e interacciones porque cambian con el tiempo.

Antes de producción

Ten claro qué no resuelve la versión actual.

Una salida tipada elimina un problema de integración. No convierte un juicio semántico en correcto, seguro o transferible a otra distribución.

01

L0 consume más cómputo con muchas opciones

Una elección con K opciones usa rotaciones cíclicas, por lo que la corrección sin etiquetas necesita K prefills. Intercambia cómputo por estabilidad frente al orden.

02

L1 y L2 necesitan etiquetas del flujo real

La calibración y las capas de salida pertenecen a un modelo y una pregunta concretos. Hay que reconstruirlas o revalidarlas si cambia cualquiera de los dos.

03

L2 necesita acceso al estado oculto

La ruta L2 actual usa un backend local de Transformers. Motores de inferencia como vLLM y SGLang figuran en la hoja de ruta.

04

Las cifras publicadas no son tu prueba de aceptación

Mide precisión, calibración, sensibilidad al orden y abstención con datos representativos antes de dejar que una probabilidad controle una acción importante.

Fuentes primarias

Comprueba el proyecto en su fuente.

AnyJev evoluciona rápido. Verifica la versión, los backends y las limitaciones antes de integrarlo.

Explora el ecosistema

Compara AnyJev con otros proyectos de la comunidad System One.

AnyJev sigue un enfoque: adaptar un LLM causal abierto en el momento de decidir. El ecosistema también incluye modelos entrenados para la tarea, runtimes locales y experimentos compatibles con la API.

Leer la guía de System One Ver proyectos de la comunidad