面向开源模型的类型化读取层
你定义输入状态和一个或多个有限问题。AnyJev 返回分类选项的概率分布、是非问题的概率,或有序评分的期望值。
AnyJev 是 Nokia Applied Research 开源的 Python 工具包。它直接从因果语言模型中读取 Choice、Score 和 Noul 风格的决策,并提供选项顺序去偏与概率校准能力。
需要说明: AnyJev 不是新的基础模型,也不是 TypeSafe Jev 权重的开源版本,更不是 Jev 官方产品。它提供的是一种方法,让你正在运行的模型具备 Jev 风格的决策接口。
anyjev(PyPI)state → typed decisions我的账户被重复扣款了,请今天帮我处理。
result.level = "L0"示意结果它保留你选择的因果语言模型,只改变如何从模型中读取边界明确的判断。因此,它更像一层决策接口,而不是经过微调的独立分类模型。
你定义输入状态和一个或多个有限问题。AnyJev 返回分类选项的概率分布、是非问题的概率,或有序评分的期望值。
原始答案 token 的 logits 可能偏爱某个标签或位置。AnyJev 会标明每项决策使用的修正级别,让应用代码可以要求符合预期的证据等级。
该项目没有发布或复现 TypeSafe 的私有权重、训练数据或 RLCD 方法。请求格式相似,并不代表两者行为等价。
L0 确实不需要训练数据。更高级别会加入标注样本;L2 会针对特定问题拟合一个小型输出头,但不会更新基础模型权重。
不修正选项位置或标签偏好。
顺序更稳定,但概率尚未针对任务校准。
能改善置信度估计,但不会修正错误排序。
只适用于特定模型和问题,并需要读取本地隐藏状态。
下面的简化示例沿用项目公开 API:Qwen 模型留在本地,AnyJev 读取两项边界明确的判断,后续动作仍由普通代码决定。
pip install "anyjev[hf]"需要 Python 3.10 或更高版本。首次实际运行时,还会下载你选择的开源模型。
Choice + Noulfrom anyjev import Decider, Question
from anyjev.backends.hf import HFBackend
decider = Decider(HFBackend("Qwen/Qwen3-8B"))
route = Question.choice(
"Which team should handle this?",
["billing", "technical", "sales", "other"],
name="route",
)
risky = Question.noul(
"Is this tool call destructive or irreversible?",
name="risky",
)
result = decider.decide(
{"message": "I was charged twice.", "tool_call": "refund"},
[route, risky],
)
result["route"].distribution
result["risky"].p_true
result.level # "L0"应用先列出允许的处理团队,并询问准备执行的工具调用是否具有破坏性。
模型不会生成自由文本;结果包含概率分布或概率值,以及本次使用的级别。
代码负责设置阈值、把不确定情况交给人工,并在风险过高时阻止副作用。
AnyJev 公布了 Qwen3-8B 在 300 条 BANKING77 测试样本上的结果。以下数字来自项目作者提交的评测产物;Jev AI Dev 尚未独立复跑该模型评测。
| 指标 | 原始 logits | AnyJev L0 | AnyJev L1 |
|---|---|---|---|
| 反转选项后答案变化率 | 0.230 | 0.073 | 0.077 |
| 准确率 | 0.747 | 0.803 | 0.807 |
| 期望校准误差 | 0.240 | 0.184 | 0.095 |
| 错误率不超过 5% 时的覆盖率 | 7.7% | 46.3% | 52.0% |
在这组测试中,准确率从 0.747 提升到 0.807。更显著的实际变化,是错误率不超过 5% 时的覆盖率:原始 logits 为 7.7%,L1 校准后为 52.0%。样本量较小,不能直接套用到其他业务流程。
查看基准测试与消融实验Data Science in your pocket 在 AnyJev 发布后制作了这段简短介绍。它是第三方解读,不是 Nokia Applied Research 的官方演示,也不是独立基准测试。
在 YouTube 观看“How to convert any LLM into Jev AI?”WquGuru 在一台 MacBook 上,用 20 张中文客服工单对比了官方 Jev 与三个开源项目。帖子及后续回复包含视频、耗时和各项目准确率。
同一讨论串报告:官方 Jev 为 20/20、Laya 为 65%、djev 为 35%。这只能视为早期社区观察,不能当作受控基准测试:问题集很小,仅使用一台设备,而且各项目的模型配置不同。
在 X 查看对比与视频证据边界: Jev AI Dev 已核实这些帖子确实包含上述说法,但没有复现这项社区测试。阅读量和互动量会持续变化,因此正文不写死这些数字。
类型化输出解决的是接口问题,并不会自动让语义判断变得正确、安全,也不能保证结果可迁移到另一种数据分布。
包含 K 个选项的 Choice 会循环轮换,因此零标签修正需要 K 次 prefill。它用更多推理开销换取更稳定的选项顺序。
校准器和读取头只适用于特定模型与问题;任一项变化后,都应重新构建或验证。
当前 L2 路径使用本地 Transformers 后端。vLLM、SGLang 等服务引擎仍在项目路线图中。
在概率值控制重要动作前,请用代表性数据测量准确率、校准、顺序敏感性与拒绝策略。
AnyJev 仍在快速变化。正式接入前,请确认最新版本、可用后端和限制。
AnyJev 的路线是在决策时适配现有开源因果语言模型。社区中也有专门训练的模型、本地运行时和兼容 API 的实验项目。