独立项目指南 · 2026 年 9 月 25 日核查

AnyJev 让开源 LLM 输出类型化决策。

AnyJev 是 Nokia Applied Research 开源的 Python 工具包。它直接从因果语言模型中读取 Choice、Score 和 Noul 风格的决策,并提供选项顺序去偏与概率校准能力。

需要说明: AnyJev 不是新的基础模型,也不是 TypeSafe Jev 权重的开源版本,更不是 Jev 官方产品。它提供的是一种方法,让你正在运行的模型具备 Jev 风格的决策接口。

维护团队
Nokia Applied Research
许可证
Apache-2.0
安装包
anyjev(PyPI)
成熟度
早期预览版
AnyJev · L0state → typed decisions
输入状态

我的账户被重复扣款了,请今天帮我处理。

choice · 分流应该由哪个团队处理?
账单0.81
技术0.09
销售0.04
其他0.06
result.level = "L0"示意结果
关键区别

AnyJev 是工具包,不是另一套模型权重。

它保留你选择的因果语言模型,只改变如何从模型中读取边界明确的判断。因此,它更像一层决策接口,而不是经过微调的独立分类模型。

它是什么

面向开源模型的类型化读取层

你定义输入状态和一个或多个有限问题。AnyJev 返回分类选项的概率分布、是非问题的概率,或有序评分的期望值。

它增加了

偏差修正与校准级别

原始答案 token 的 logits 可能偏爱某个标签或位置。AnyJev 会标明每项决策使用的修正级别,让应用代码可以要求符合预期的证据等级。

它不是什么

TypeSafe Jev 的开源复刻

该项目没有发布或复现 TypeSafe 的私有权重、训练数据或 RLCD 方法。请求格式相似,并不代表两者行为等价。

Raw → L0 → L1 → L2

四个级别会标明每项决策采用了哪种去偏或校准方式。

L0 确实不需要训练数据。更高级别会加入标注样本;L2 会针对特定问题拟合一个小型输出头,但不会更新基础模型权重。

Raw无需标签

对答案 token 的 logits 做受限 softmax。

不修正选项位置或标签偏好。

L0无需标签

轮换选项顺序,并修正估计得到的标签先验。

顺序更稳定,但概率尚未针对任务校准。

L1100–500 条标签

为特定模型和问题加入温度校准。

能改善置信度估计,但不会修正错误排序。

L2100–300 条标签

在中间隐藏状态上拟合闭式解的小型输出头。

只适用于特定模型和问题,并需要读取本地隐藏状态。

本地工作流示例

给客服工单分流,并检查准备执行的操作。

下面的简化示例沿用项目公开 API:Qwen 模型留在本地,AnyJev 读取两项边界明确的判断,后续动作仍由普通代码决定。

安装 Transformers 后端
pip install "anyjev[hf]"

需要 Python 3.10 或更高版本。首次实际运行时,还会下载你选择的开源模型。

PythonChoice + Noul
from anyjev import Decider, Question
from anyjev.backends.hf import HFBackend

decider = Decider(HFBackend("Qwen/Qwen3-8B"))

route = Question.choice(
    "Which team should handle this?",
    ["billing", "technical", "sales", "other"],
    name="route",
)
risky = Question.noul(
    "Is this tool call destructive or irreversible?",
    name="risky",
)

result = decider.decide(
    {"message": "I was charged twice.", "tool_call": "refund"},
    [route, risky],
)

result["route"].distribution
result["risky"].p_true
result.level  # "L0"
01

定义答案范围

应用先列出允许的处理团队,并询问准备执行的工具调用是否具有破坏性。

02

读取有限分布

模型不会生成自由文本;结果包含概率分布或概率值,以及本次使用的级别。

03

把策略留在代码里

代码负责设置阈值、把不确定情况交给人工,并在风险过高时阻止副作用。

上游基准测试

值得关注的不只是准确率,而是能否更安全地自动处理。

AnyJev 公布了 Qwen3-8B 在 300 条 BANKING77 测试样本上的结果。以下数字来自项目作者提交的评测产物;Jev AI Dev 尚未独立复跑该模型评测。

指标原始 logitsAnyJev L0AnyJev L1
反转选项后答案变化率0.2300.0730.077
准确率0.7470.8030.807
期望校准误差0.2400.1840.095
错误率不超过 5% 时的覆盖率7.7%46.3%52.0%

在这组测试中,准确率从 0.747 提升到 0.807。更显著的实际变化,是错误率不超过 5% 时的覆盖率:原始 logits 为 7.7%,L1 校准后为 52.0%。样本量较小,不能直接套用到其他业务流程。

查看基准测试与消融实验
社区视频 · 29 秒

快速了解如何把 LLM 变成 Jev 风格的决策器。

Data Science in your pocket 在 AnyJev 发布后制作了这段简短介绍。它是第三方解读,不是 Nokia Applied Research 的官方演示,也不是独立基准测试。

在 YouTube 观看“How to convert any LLM into Jev AI?”
社区实测 · 2026 年 9 月

20 张工单的实测,呈现了准确率与延迟之间的取舍。

WquGuru 在一台 MacBook 上,用 20 张中文客服工单对比了官方 Jev 与三个开源项目。帖子及后续回复包含视频、耗时和各项目准确率。

@wquguru · 上手对比

帖子显示,搭配 Qwen3-4B 的 AnyJev 答对了 20 题中的 19 题。

准确率95%19 / 20 张工单
延迟~4s单次测试报告值
测试量20中文客服工单

同一讨论串报告:官方 Jev 为 20/20、Laya 为 65%、djev 为 35%。这只能视为早期社区观察,不能当作受控基准测试:问题集很小,仅使用一台设备,而且各项目的模型配置不同。

在 X 查看对比与视频
@MorrisMz81 · AnyJev 作者
“The latency is real. We went correctness first.”

Jiamu “Morris” Zhang 表示,首个版本尚未优化推理服务路径。AnyJev 的定位不是另一款 Jev 模型,而是把团队已经在运行的模型接成决策层;vLLM/SGLang 优化工作当时刚开始。

阅读作者完整回复
@Marktechpost · 媒体概览

简要梳理项目设计与已提交的基准测试。

MarkTechPost 概述了类型化读取、L0/L1 的区别和 BANKING77 结果。这些数字来自项目自己的评测,并非媒体单独复现。

证据边界: Jev AI Dev 已核实这些帖子确实包含上述说法,但没有复现这项社区测试。阅读量和互动量会持续变化,因此正文不写死这些数字。

用于生产前

先明确当前版本没有解决哪些问题。

类型化输出解决的是接口问题,并不会自动让语义判断变得正确、安全,也不能保证结果可迁移到另一种数据分布。

01

选项越多,L0 计算量越大

包含 K 个选项的 Choice 会循环轮换,因此零标签修正需要 K 次 prefill。它用更多推理开销换取更稳定的选项顺序。

02

L1 和 L2 需要业务标签

校准器和读取头只适用于特定模型与问题;任一项变化后,都应重新构建或验证。

03

L2 需要访问隐藏状态

当前 L2 路径使用本地 Transformers 后端。vLLM、SGLang 等服务引擎仍在项目路线图中。

04

公开数字不能替代验收测试

在概率值控制重要动作前,请用代表性数据测量准确率、校准、顺序敏感性与拒绝策略。

一手资料

回到项目源头核查。

AnyJev 仍在快速变化。正式接入前,请确认最新版本、可用后端和限制。

探索生态

把 AnyJev 与其他社区 System One 项目放在一起比较。

AnyJev 的路线是在决策时适配现有开源因果语言模型。社区中也有专门训练的模型、本地运行时和兼容 API 的实验项目。

阅读 System One 指南 浏览社区项目