Jev AI Dev · 开发者指南

System One AI 模型是什么? 面向开发者的 Jev 指南。

System One 是 TypeSafe 提出的一类 AI 模型,帮助开发者把非结构化应用状态转成类型化答案与概率。Jev 是首个实现:一个可以嵌入应用代码的有限决策组件。

输入
文本、JSON 或文本数组
输出
Choice、Score 或 Noul
流程控制
由你的代码掌握

这是一份独立的开发者指南。产品细节和性能说法均注明来自 TypeSafe;在生产环境使用前,请务必用自己的数据验证。

System Onestate → decisions
state

“我的账户被扣了两次款,希望今天处理。”

choice账单团队0.96
noul紧急0.88
score不满程度1.7 / 2
if (confidence < threshold) → review
模型类别

System One 模型:嵌入应用代码的语义判断组件。

System One 模型会理解输入的含义,但不会继续聊天或组织一段回复。你需要先声明问题和允许返回的答案形式,模型再给出程序可以检查和处理的有限判断。

01

理解当前状态

模型解读自然语言或结构化文本,例如工单、Agent 轨迹、商品记录或游戏状态。

02

遵守答案契约

应用在调用前定义答案范围;模型负责选择选项、在量表上评分,或判断一个是非命题。

03

显式表达不确定性

每个答案都有概率信号;Choice 和 Score 还会用置信度概括概率分布,让代码区分明确与模糊结果。

04

和代码组合

阈值、规则检查、实际操作、重试、回退与人工复核,仍由普通代码负责。

Jev 工作流

开发者如何把 Jev 接入应用代码。

Jev 把一次模型调用变成一组决策信号。对开发者来说,这里的基本单位不是一轮对话,而是模型与应用之间一份小型、类型化的契约。

输入

1. 组织状态

传入完成判断所需的信息。Jev 目前只接受文本形式的输入,包括字符串、JSON 对象和文本数组。

客户消息 + 账户信息
契约

2. 定义问题

为每个问题命名,选择对应的 primitive,并描述允许的选项或量表。多个彼此独立的问题可以放进一次请求。

负责部门 · 紧急度 · 情绪
模型

3. Jev 同时判断

Jev 为每个问题返回类型化答案和概率信号;Choice 与 Score 还会单独返回置信度。

账单团队 · 0.93 · 高置信度
应用

4. 代码执行策略

把模型输出与确定性检查结合。低风险且明确时执行;不确定或影响较大的情况交给人工或推理模型。

分流 · 追问 · 复核 · 停止

三种答案形式

Choicebilling

哪个团队应该处理?

从预先定义的一组选项中选择一个,并返回每个选项的概率。

Score1.43 / 2

这个问题有多严重?

按一组有顺序、有描述的等级定位;结果可以落在两个等级之间。

Noul0.95

这条消息是否要求退款?

判断一个是非命题,并返回模型认为“是”的概率。

理念来源

TypeSafe 为什么为软件设计新的模型接口。

生成式模型擅长为人生成灵活的文本。TypeSafe 的观点是:软件需要另一种更窄的智能形式——能嵌入代码、反复运行、表达不确定性,并让控制流程保持可见。

01

字符串灵活,但结果开放

生成结果可能是文章、代码、JSON、拒答,也可能格式错误。应用在采取行动前,往往还要解析、校验和处理异常。

02

自动化需要边界

当模型在后台运行时,程序需要提前知道可能出现哪些结果,以及每种结果可以触发什么操作。

03

不确定性应该改变流程

概率分布让工作流自动处理明确情况,同时把模糊情况送到更安全的路径。

04

小判断应当可以组合

复杂工作流可以拆成多个聚焦的语义判断,再用确定性逻辑组合,而不是把全部业务逻辑藏在一个大提示词里。

适用位置

System One AI 适合哪些开发工作流。

比较合适的任务通常出现频繁,需要理解杂乱输入,并最终落到少量、应用本来就知道如何执行的动作。

01

客户支持运营

给工单分类,识别意图和紧急度,评估客户情绪,并把不确定的情况交给人工复核。

这是账单、技术、账户问题,还是其他?
02

Agent 流程控制

选择模型或工具,判断是否需要检索、结果是否完整,或检查 Agent 准备执行的工具调用。

Agent 应该继续、重试还是升级处理?
03

排序与相关性

评估候选项与查询、用户偏好、政策或上下文的匹配程度,再与业务规则组合。

这个候选项与当前请求有多相关?
04

安全与验证

按明确标准检查消息、生成结果、推理轨迹或代码变更;高风险结果仍由确定性规则把关。

它是否违反这条明确规则?
05

实时交互

为游戏、模拟、响应式界面或设备自动化选择合法动作,避免为了一个判断生成冗长文本。

当前状态下,哪个允许动作最合适?
06

数据处理

把大量记录转成类别、分数、标记与特征,供下游系统汇总、筛选或复核。

这条记录属于什么类别和风险等级?

比较适合

选项已经明确,输入含义复杂,判断会重复发生,对延迟敏感,而且代码能为每种结果安排清楚的动作或回退。

不太适合

任务需要原创文本或代码、深度多步推理、广泛研究、解释过程、多模态输入,或者可能结果根本无法提前定义。

System One 与生成式 LLM

System One 与生成式 LLM 在 AI 技术栈中扮演不同角色。

两者都可以理解语言,LLM 也可以通过结构化输出约束格式。更深层的区别在于:模型原生要产出什么,以及周围的软件如何使用它。

对比维度Jev / System One常见生成式 LLM
主要任务判断预先定义的结果生成后续内容或回复
原生输出类型化选项、评分或“是”的概率token 序列:文章、代码、JSON 或其他文本
答案范围调用前已经声明本质上开放;即使用 schema 约束最终格式也一样
不确定性每个答案都有概率;Choice 和 Score 还返回置信度可能提供 token 概率或自报置信度,但通常不是针对任务校准的决策信号
采样方式TypeSafe 称问题与输出会并行计算通常逐 token 顺序生成
擅长任务高频语义分支、评分、路由与检查写作、对话、编程、综合信息与开放式推理
主要失败方式格式完全正确,但语义判断错误生成内容错误、格式异常、缺乏依据或偏离任务
系统角色可见代码中的有限决策组件灵活的生成器或推理器,通常需要更大的编排框架

对于评估 Jev 之外 System One 方案的开发者,下面直接复用 Projects 页中的同一套社区生态模块,并区分独立训练的模型与基于现有权重实现的 Jev 类接口。

System One

受 Jev 启发的 System One 社区项目

这些社区模型和接口实验受到 Jev 启发,或探索相近的结构化决策方式。它们不是 TypeSafe 官方发布的 Jev 版本,也不参与上方的 GitHub 项目排名。

社区模型Qwen3.5-9B

Bespoke Nimble

受 Jev 启发的 LoRA 适配器和训练方法,处理选项题及是非题;支持本地运行,目前只接受文本。

GitHub
社区模型Qwen3-0.6B

NanoJev

小型决策模型,公开了训练代码,并提供游戏演示来测试动作选择。

GitHub
社区模型Qwen3.5-2B

decider

微调模型,一次计算即可返回多个结构化问题的概率分布;当前版本只支持英语。

GitHub
社区模型ModernBERT 151M

Verdict

基于小型编码器的决策模型,公开了权重,并提供浏览器内的 WebGPU 演示。

GitHub
社区模型Qwen3.5-0.8B

Dohnuts

公开权重、训练代码与评测的 0.8B 多模态决策模型;可在单次计算中处理文本和图片,权重仅限非商业研究。

GitHub
接口实验DiffusionGemma 26B-A4B

OpenJev

基于现有的 DiffusionGemma 模型,提供类似 Jev 的结构化问答接口;没有发布新的模型权重。

GitHub
接口实验Open-model logits

Simple Jev

用现有开源模型给候选答案打分,提供类似 Jev 的接口;没有发布新的模型权重。

GitHub
接口实验Spark-X2.5-4B

Rizzo Flow

本地运行的 Jev 兼容服务,通过 Spark-X2.5 的答案概率完成决策;多个问题共享一次状态预填充,并附带演示界面与基准测试。

GitHub
接口实验Any causal LLM

AnyJev

无需训练即可把因果语言模型接成结构化决策模型,提供选项顺序去偏、可选校准和可复现评测。

GitHub
接口实验Qwen3.5 / DeBERTa

local-jev

可离线运行的 Jev 兼容服务,支持 Qwen 和 DeBERTa,并已用官方 SDK 验证接口及发布 JevBench 结果。

GitHub

这些是社区独立项目,并非 Jev 官方版本。

一手资料

回到原文理解每项主张。

这份 Jev AI Dev 开发者指南用自己的语言解释 TypeSafe 的框架。API 细节、产品主张、评测方法与最新变化,请以官方资料为准。

验证这种形态,而不只是理念

从应用已经在做的一项判断开始。

先定义可能答案,收集有代表性的样本,明确不确定结果如何处理,再把 Jev 与现有规则或模型对比;不要直接自动化高影响决策。

在 Playground 体验 Jev 浏览 Jev 项目