理解当前状态
模型解读自然语言或结构化文本,例如工单、Agent 轨迹、商品记录或游戏状态。
System One 是 TypeSafe 提出的一类 AI 模型,帮助开发者把非结构化应用状态转成类型化答案与概率。Jev 是首个实现:一个可以嵌入应用代码的有限决策组件。
这是一份独立的开发者指南。产品细节和性能说法均注明来自 TypeSafe;在生产环境使用前,请务必用自己的数据验证。
state → decisions“我的账户被扣了两次款,希望今天处理。”
if (confidence < threshold) → reviewSystem One 模型会理解输入的含义,但不会继续聊天或组织一段回复。你需要先声明问题和允许返回的答案形式,模型再给出程序可以检查和处理的有限判断。
模型解读自然语言或结构化文本,例如工单、Agent 轨迹、商品记录或游戏状态。
应用在调用前定义答案范围;模型负责选择选项、在量表上评分,或判断一个是非命题。
每个答案都有概率信号;Choice 和 Score 还会用置信度概括概率分布,让代码区分明确与模糊结果。
阈值、规则检查、实际操作、重试、回退与人工复核,仍由普通代码负责。
Jev 把一次模型调用变成一组决策信号。对开发者来说,这里的基本单位不是一轮对话,而是模型与应用之间一份小型、类型化的契约。
传入完成判断所需的信息。Jev 目前只接受文本形式的输入,包括字符串、JSON 对象和文本数组。
客户消息 + 账户信息为每个问题命名,选择对应的 primitive,并描述允许的选项或量表。多个彼此独立的问题可以放进一次请求。
负责部门 · 紧急度 · 情绪Jev 为每个问题返回类型化答案和概率信号;Choice 与 Score 还会单独返回置信度。
账单团队 · 0.93 · 高置信度把模型输出与确定性检查结合。低风险且明确时执行;不确定或影响较大的情况交给人工或推理模型。
分流 · 追问 · 复核 · 停止billing从预先定义的一组选项中选择一个,并返回每个选项的概率。
1.43 / 2按一组有顺序、有描述的等级定位;结果可以落在两个等级之间。
0.95判断一个是非命题,并返回模型认为“是”的概率。
生成式模型擅长为人生成灵活的文本。TypeSafe 的观点是:软件需要另一种更窄的智能形式——能嵌入代码、反复运行、表达不确定性,并让控制流程保持可见。
生成结果可能是文章、代码、JSON、拒答,也可能格式错误。应用在采取行动前,往往还要解析、校验和处理异常。
当模型在后台运行时,程序需要提前知道可能出现哪些结果,以及每种结果可以触发什么操作。
概率分布让工作流自动处理明确情况,同时把模糊情况送到更安全的路径。
复杂工作流可以拆成多个聚焦的语义判断,再用确定性逻辑组合,而不是把全部业务逻辑藏在一个大提示词里。
比较合适的任务通常出现频繁,需要理解杂乱输入,并最终落到少量、应用本来就知道如何执行的动作。
给工单分类,识别意图和紧急度,评估客户情绪,并把不确定的情况交给人工复核。
这是账单、技术、账户问题,还是其他?
选择模型或工具,判断是否需要检索、结果是否完整,或检查 Agent 准备执行的工具调用。
Agent 应该继续、重试还是升级处理?
评估候选项与查询、用户偏好、政策或上下文的匹配程度,再与业务规则组合。
这个候选项与当前请求有多相关?
按明确标准检查消息、生成结果、推理轨迹或代码变更;高风险结果仍由确定性规则把关。
它是否违反这条明确规则?
为游戏、模拟、响应式界面或设备自动化选择合法动作,避免为了一个判断生成冗长文本。
当前状态下,哪个允许动作最合适?
把大量记录转成类别、分数、标记与特征,供下游系统汇总、筛选或复核。
这条记录属于什么类别和风险等级?
选项已经明确,输入含义复杂,判断会重复发生,对延迟敏感,而且代码能为每种结果安排清楚的动作或回退。
任务需要原创文本或代码、深度多步推理、广泛研究、解释过程、多模态输入,或者可能结果根本无法提前定义。
两者都可以理解语言,LLM 也可以通过结构化输出约束格式。更深层的区别在于:模型原生要产出什么,以及周围的软件如何使用它。
| 对比维度 | Jev / System One | 常见生成式 LLM |
|---|---|---|
| 主要任务 | 判断预先定义的结果 | 生成后续内容或回复 |
| 原生输出 | 类型化选项、评分或“是”的概率 | token 序列:文章、代码、JSON 或其他文本 |
| 答案范围 | 调用前已经声明 | 本质上开放;即使用 schema 约束最终格式也一样 |
| 不确定性 | 每个答案都有概率;Choice 和 Score 还返回置信度 | 可能提供 token 概率或自报置信度,但通常不是针对任务校准的决策信号 |
| 采样方式 | TypeSafe 称问题与输出会并行计算 | 通常逐 token 顺序生成 |
| 擅长任务 | 高频语义分支、评分、路由与检查 | 写作、对话、编程、综合信息与开放式推理 |
| 主要失败方式 | 格式完全正确,但语义判断错误 | 生成内容错误、格式异常、缺乏依据或偏离任务 |
| 系统角色 | 可见代码中的有限决策组件 | 灵活的生成器或推理器,通常需要更大的编排框架 |
对于评估 Jev 之外 System One 方案的开发者,下面直接复用 Projects 页中的同一套社区生态模块,并区分独立训练的模型与基于现有权重实现的 Jev 类接口。
这些社区模型和接口实验受到 Jev 启发,或探索相近的结构化决策方式。它们不是 TypeSafe 官方发布的 Jev 版本,也不参与上方的 GitHub 项目排名。
Qwen3.5-9B受 Jev 启发的 LoRA 适配器和训练方法,处理选项题及是非题;支持本地运行,目前只接受文本。
GitHubQwen3-0.6B小型决策模型,公开了训练代码,并提供游戏演示来测试动作选择。
GitHubQwen3.5-2B微调模型,一次计算即可返回多个结构化问题的概率分布;当前版本只支持英语。
GitHubModernBERT 151M基于小型编码器的决策模型,公开了权重,并提供浏览器内的 WebGPU 演示。
GitHubQwen3.5-0.8B公开权重、训练代码与评测的 0.8B 多模态决策模型;可在单次计算中处理文本和图片,权重仅限非商业研究。
GitHubDiffusionGemma 26B-A4B基于现有的 DiffusionGemma 模型,提供类似 Jev 的结构化问答接口;没有发布新的模型权重。
GitHubOpen-model logits用现有开源模型给候选答案打分,提供类似 Jev 的接口;没有发布新的模型权重。
GitHubSpark-X2.5-4B本地运行的 Jev 兼容服务,通过 Spark-X2.5 的答案概率完成决策;多个问题共享一次状态预填充,并附带演示界面与基准测试。
GitHubAny causal LLM无需训练即可把因果语言模型接成结构化决策模型,提供选项顺序去偏、可选校准和可复现评测。
GitHubQwen3.5 / DeBERTa可离线运行的 Jev 兼容服务,支持 Qwen 和 DeBERTa,并已用官方 SDK 验证接口及发布 JevBench 结果。
GitHub这些是社区独立项目,并非 Jev 官方版本。
这份 Jev AI Dev 开发者指南用自己的语言解释 TypeSafe 的框架。API 细节、产品主张、评测方法与最新变化,请以官方资料为准。
先定义可能答案,收集有代表性的样本,明确不确定结果如何处理,再把 Jev 与现有规则或模型对比;不要直接自动化高影响决策。