System One 模型

面向软件的快速类型化判断,而非聊天式 LLM。

System One模型能快速作出结构化决策,供软件直接使用。此类模型会评估一个state,并返回带类型的答案和概率。Jev 是TypeSafe的旗舰模型,也是首个公开的System One模型。它与 LLM 一样能理解自然语言输入,但不会撰写回复、生成代码或解释其推理过程。你可以通过Choice、Score和Noul定义可能的答案。

它与 LLM 有何不同

LLM 的训练目标是续写文本。System One模型则针对校准决策进行训练:概率会根据实际结果优化,从而反映多组预测中的不确定性。校准并不保证某个答案一定正确,但你可以直接在代码中设置门槛——执行、复核或升级处理——而不必解析一整段文字。

你不会要求 Jev 起草邮件或函数,而会询问某张工单应归入哪个队列、客户听起来有多不满,或某条消息是否要求退款。TypeSafe概念页面的表格采用了这三个例子:Choice返回 choice: "billing",Score可在 0-2 的不满程度量表上返回 1.4,Noul则可为退款与否的检查返回 0.95。

System One这一名称源自Daniel Kahneman的《思考,快与慢》。系统 1 快速而直觉化,系统 2 则更慢、更审慎。TypeSafe让模型负责快速判断,让应用程序负责缓慢的控制流。如果任务需要长链条的间接推理或自由写作,就应交给生成式模型或代码,而不是 Jev 1.13。

RLCD versus RLHF and RLVR: Jev is trained for calibrated decisions
RLCD与RLHF、RLVR的对比:Jev 专为校准决策而训练。

用RLCD替代RLHF

TypeSafe 使用 Reinforcement Learning for Calibrated Decisions(RLCD)训练 Jev。RLHF 是用于让聊天模型更顺从的技术栈。RLVR 通常用于长篇推理模型。RLCD 则是 TypeSafe 为 System One 记载的路线:奖励经过校准的决策,而非流畅的 token。发布文章还提到一种新架构,以及可针对同一个 state 评估多个问题的并行采样器。

由于权重共享,你无需使用客户数据对 Jev 进行微调或 LoRA 适配。请将专有记录放入state,在指令和判定标准中编码领域规则,将宽泛判断拆成原子问题,再在代码中合并数值。文档建议通过组合评分,或在 Jev 的概率输出之上接入下游传统模型,实现无需训练私有副本的专门化。

Jev 目前仅接受文本。字符串、JSON 对象和文本数组均为合法输入,像素和波形则不支持。英文是主要训练语言;模型也接受中日韩文字及其他文字系统,但准确率较低,因此在分流非英文工作负载前应先测试。在Choice和Score上使用Confidence,是让这些较弱语言始终经过人工把关的实用方式。

大型工作流中的快速判断

对于退款请求,文档中的流程是:构建一个包含消息、交易和政策的state;同时提出相互独立的问题(是否要求退款、证据是否表明存在重复扣款、政策是否允许退款);然后将答案与确定性检查结合,并分流至执行或复核环节。建立 Primitives 后,即可组合使用。类型化输出让代码无需解析残留的自然语言便能读取答案。

推测式 fan-out 是降低成本的关键模式。你可以发送可能并不需要的问题,包括预设了设备类型或意图的问题,并在调用结束后丢弃无关结果。顺序往返调用必须等待每一步完成。Jev 会并行评估整个映射,因此增加问题几乎不会提高延迟。正因如此,智能家居演示才能同时询问类别、领域、设备和操作。

可通过typesafe-sdk、@typesafe-ai/sdk或向https://api.typesafe.ai/v1/systemone.发送 POST 请求来调用System One模型。模型字段用于选择具体构建版本;文档示例使用jev-latest,它目前指向jev-1.13.0。先从state的结构和 Primitives 开始,再为所有自动副作用添加置信度门槛。

哪些内容应留在System One之外

按照 Kahneman 的说法,内容生成、长程规划和使用工具的智能体都属于系统二任务。Jev 1.13不会撰写退款邮件、SQL 或 Wikipedia 的下一段内容。它会告诉你工单是否涉及退款、应归入哪个队列,以及该判断有多大把握。真正需要生成词元时,请将它与生成式模型搭配使用。

数值一致性同样不在能力范围内。计数、日期顺序和十六进制距离都应交给代码处理。jaggedness 页面汇总了这些边界情况,最后审核于 17 September 2026。忽略这份目录的 System One 工作流即使看似校准良好,仍可能因字面误读而路由错误。

在 TypeSafe 推出图像输入前,像素始终不在输入范围内。Doom、Wikiracing 和智能家居助手发送的全是文本。如果产品使用摄像头,请先转录或描述画面;如果产品处理音频,同样适用此规则。64k 和 32k 是 token 预算,不是画面帧预算。

System One是一类产品,目前仅有一个公开成员。如果TypeSafe在同一端点上推出第二个模型,可通过模型字段进行选择。在此之前,jev-1.13.0是jev-latest和jev-preview背后的版本化 ID。其他所有聊天或推理模型都应视为不同类别,即使它们处在同一个整体工作流中。

RLCD是TypeSafe为此类模型命名的训练方法,并不是请求中可传入的开关。你仍需编写指令和判定标准,也仍需在代码中合并答案。区别在于权重的优化目标:校准决策,而非聊天词元。因此输出是Choice、Score或Noul,而不是一段文字。

写作任务交给聊天模型,岔路决策交给 Jev。两者可以共用一套工作流,但不应共用提示词。让System One模型与 LLM 并列使用,意义就在于这种职责划分。

Kahneman 只是名称来源,并非运行时模式。你仍需自行选择Choice、Score或Noul。

来源