Независимое руководство · Проверено 25 сентября 2026 года

AnyJev превращает открытую LLM в типизированную модель решений.

AnyJev — открытый Python-инструментарий от Nokia Applied Research. Он считывает решения Choice, Score и Noul из каузальных языковых моделей, а затем корректирует смещение из-за порядка вариантов и калибрует вероятности.

Важно: AnyJev — не новая фундаментальная модель, не открытая публикация весов TypeSafe Jev и не официальный продукт Jev. Это независимый способ строить решения в формате Jev на моделях, которые вы запускаете сами.

Разработчик
Nokia Applied Research
Лицензия
Apache-2.0
Пакет
anyjev в PyPI
Статус
Пре-альфа
AnyJev · L0state → typed decisions
контекст

С меня дважды списали деньги. Пожалуйста, решите вопрос сегодня.

choice · маршрутизацияКакая команда должна обработать обращение?
биллинг0.81
техподдержка0.09
продажи0.04
другое0.06
result.level = "L0"Пример результата
Главное отличие

AnyJev — инструментарий, а не ещё один набор весов.

Выбранная каузальная модель остаётся прежней; меняется способ считывания решения с фиксированным набором ответов. Поэтому AnyJev ближе к слою принятия решений, чем к самостоятельному дообученному классификатору.

Что это

Типизированное считывание для открытых моделей

Вы задаёте контекст и один или несколько вопросов с фиксированным набором ответов. AnyJev возвращает распределение для категориального выбора, вероятность для вопроса да/нет или ожидаемое значение на упорядоченной шкале.

Что добавляет

Уровни коррекции смещения и калибровки

Сырые логиты токенов ответа могут предпочитать метку или её позицию. AnyJev указывает уровень коррекции каждого решения, чтобы приложение могло требовать нужный уровень.

Чем не является

Открытой копией TypeSafe Jev

Проект не публикует и не воспроизводит закрытые веса, обучающие данные или метод RLCD компании TypeSafe. Сходная форма запроса не доказывает эквивалентное поведение.

Сырые данные → L0 → L1 → L2

Четыре уровня явно показывают, на чём основано решение.

L0 действительно не требует обучения. Более высокие уровни используют размеченные примеры; L2 подгоняет небольшую выходную головку под конкретный вопрос, не меняя веса базовой модели.

Сырые данныеБез разметки

Считывает ограниченный softmax по логитам токенов ответа.

Без коррекции позиции варианта или предпочтения метки.

L0Без разметки

Переставляет варианты и корректирует оценённый априор метки.

Стабильнее, но вероятности не откалиброваны под задачу.

L1100–500 меток

Добавляет температурную калибровку для одной модели и вопроса.

Улучшает оценку уверенности, но не исправляет неверное ранжирование.

L2100–300 меток

Подгоняет небольшую аналитическую выходную головку по промежуточному скрытому состоянию.

Привязан к модели и вопросу; нужен локальный доступ к скрытым состояниям.

Пример локального процесса

Маршрутизируйте обращение и проверьте предлагаемое действие.

Пример повторяет публичный API: модель Qwen остаётся локальной, AnyJev считывает два решения с фиксированным набором ответов, а обычный код приложения определяет следующий шаг.

Установить бэкенд Transformers
pip install "anyjev[hf]"

Требуется Python 3.10 или новее. При первом реальном запуске также загружается выбранная открытая модель.

PythonChoice + Noul
from anyjev import Decider, Question
from anyjev.backends.hf import HFBackend

decider = Decider(HFBackend("Qwen/Qwen3-8B"))

route = Question.choice(
    "Which team should handle this?",
    ["billing", "technical", "sales", "other"],
    name="route",
)
risky = Question.noul(
    "Is this tool call destructive or irreversible?",
    name="risky",
)

result = decider.decide(
    {"message": "I was charged twice.", "tool_call": "refund"},
    [route, risky],
)

result["route"].distribution
result["risky"].p_true
result.level  # "L0"
01

Задайте пространство ответов

Приложение перечисляет допустимые команды и спрашивает, рискован ли предложенный вызов инструмента.

02

Считайте ограниченные распределения

Свободный текст не генерируется. Результат содержит распределение или вероятность и использованный уровень.

03

Оставьте правила в коде

Код задаёт пороги, направляет неопределённые случаи на проверку и блокирует побочные эффекты при высоком риске.

Бенчмарк проекта

Главный результат — более безопасная автоматизация, а не только точность.

AnyJev приводит следующие результаты Qwen3-8B на 300 тестовых примерах BANKING77. Данные взяты из опубликованных авторами материалов бенчмарка; Jev AI Dev не повторял его независимо.

МетрикаСырые логитыAnyJev L0AnyJev L1
Смена ответа при обратном порядке вариантов0.2300.0730.077
Точность0.7470.8030.807
Ожидаемая ошибка калибровки0.2400.1840.095
Покрытие при ошибке не более 5%7.7%46.3%52.0%

В этом тесте точность выросла с 0,747 до 0,807. Более заметное операционное изменение — покрытие при ошибке не выше 5%: 7,7% для сырых логитов и 52,0% после калибровки L1. Оценка основана на малом наборе и требует проверки для другого процесса.

Изучить бенчмарк и абляции
Видео сообщества · 29 секунд

Коротко о том, как превратить LLM в решатель в стиле Jev.

Data Science in your pocket выпустил это краткое введение после появления AnyJev. Это стороннее объяснение, а не официальная демонстрация Nokia Applied Research и не независимый бенчмарк.

Посмотреть «How to convert any LLM into Jev AI?» на YouTube
Тест сообщества · Сентябрь 2026

Тест на 20 обращениях показал компромисс между точностью и задержкой.

WquGuru сравнил официальный Jev и три открытых проекта на одном MacBook, используя 20 обращений поддержки на китайском. В треде есть видео, время и точность по каждому проекту.

@wquguru · Практическое сравнение

По данным автора теста, AnyJev с Qwen3-4B правильно обработал 19 из 20 обращений.

Точность95%19 из 20 обращений
Задержка~4sзаявлена на тест
Нагрузка20обращения на китайском

В том же треде указаны 20/20 для официального Jev, 65% для Laya и 35% для djev. Это раннее наблюдение сообщества, а не контролируемый бенчмарк: малый набор вопросов, одна машина и разные конфигурации проектов.

Открыть сравнение и видео в X
@MorrisMz81 · Автор AnyJev
“The latency is real. We went correctness first.”

Jiamu «Morris» Zhang сообщил, что в первой версии контур инференса ещё не был оптимизирован. Он описал AnyJev как метод для уже используемых командой моделей и отметил начало оптимизации vLLM/SGLang.

Прочитать полный ответ автора
@Marktechpost · Обзор в СМИ

Краткий обзор проекта и сохранённого бенчмарка.

MarkTechPost описывает типизированное считывание, различие L0/L1 и результаты BANKING77. Эти цифры взяты из бенчмарка проекта, а не независимого воспроизведения.

Граница доказательств: Jev AI Dev проверил наличие этих утверждений в публикациях, но не воспроизводил тест сообщества. Числа просмотров и реакций намеренно не приведены, поскольку меняются со временем.

Перед продакшеном

Учитывайте, что текущая версия не решает.

Типизированный вывод снимает одну проблему интеграции. Он не делает семантическую оценку автоматически правильной, безопасной или переносимой.

01

L0 требует больше вычислений при широком выборе

Выбор из K вариантов использует циклические перестановки, поэтому коррекция без меток требует K prefills. Дополнительная инференция повышает устойчивость к порядку.

02

L1 и L2 нужны метки из рабочего процесса

Калибровка и выходные головки относятся к конкретной модели и вопросу. При изменении их нужно перестроить или проверить заново.

03

L2 нужен доступ к скрытым состояниям

Текущий путь L2 использует локальный бэкенд Transformers. Серверные движки vLLM и SGLang указаны в плане проекта.

04

Опубликованные цифры — не приёмочный тест

Измерьте точность, калибровку, чувствительность к порядку и отказ на репрезентативных данных, прежде чем вероятность начнёт управлять важным действием.

Первоисточники

Проверяйте информацию в самом проекте.

AnyJev быстро развивается. Перед интеграцией проверьте последнюю версию, бэкенды и ограничения.

Изучите экосистему

Сравните AnyJev с другими проектами сообщества System One.

AnyJev адаптирует открытую каузальную LLM в момент принятия решения. В экосистеме также есть специально обученные модели, локальные среды и API-совместимые эксперименты.

Прочитать руководство System One Посмотреть проекты сообщества