大模型聊天,早就超过多数人。工作流还是慢半拍:模型吐出一长串字符,字段还可能是编的。
你要是在用 ChatGPT 或 DeepSeek,这个卡点会马上碰到。2026 年 9 月 15 日,TypeSafe 发布了 System One 模型 JEV(官方拼写 Jev)。程序状态进去,带校准概率的类型化决策出来,流程可以直接分支。
它不负责把步骤串起来。那是智能体和 AI workflow的事。JEV 只负责其中那一下判断。
下面只用一个例子把这个差别走完:电商流失预警。文中的速度和价格,都来自 TypeSafe 当天的发布文。
聊天优化的是字符串,软件要的是决策
创始人 Diogo Almeida 曾在 OpenAI 参与 ChatGPT 背后的指令跟随和对话方法。他的问题很具体:模型在聊天上已经超人类,软件自动化为什么没跟上?
答案在接口。现有大模型优化的是人类偏好的字符串。软件要的是可依赖的决策。
字符串可以写得很顺。解析却慢,也贵,字段名还可能写错。下游一崩,整条流水线停住。
所以两边的契约不一样:
-
大模型:非结构化输入,自回归、一个 token 接一个 token,吐出字符串。代码还要再解析。
-
JEV:非结构化状态输入,一次给出类型化的概率决策。schema 事先定好,类型错误在数学上不会发生。
这不是「把聊天模型缩小」。官方主张是三件套:新的模型架构、并行采样器,以及一套叫 RLCD 的训练。参数量没有公开,这里不猜。
System One 模型:快判断,直接交给代码
名字来自丹尼尔·卡尼曼的《思考,快与慢》。System 1 是快的直觉判断,System 2 是慢的审慎推理。今天的推理型大模型更像 System 2:慢、贵、串行生成,输出主要给人读。
System One 模型占的是另一头。它要快、要便宜、要并行,输出直接交给程序,而不是交给读者。
产品名 Jev 纪念经济学家 William Stanley Jevons(杰文斯)。蒸汽机变高效之后,煤炭没有少烧,反而因为用得起而烧得更多。这就是杰文斯悖论。TypeSafe 押的是同一件事:智能每便宜一个数量级,能解锁的场景会多一个数量级。
三件套各自干什么:
-
新架构。 不是一个拿来聊天的小模型。
-
并行采样。 一次查询生成全部输出字段,不用等上一个 token。
-
RLCD(Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习)。它优化的是「概率报得诚实」,不是人类更喜欢哪段话(RLHF),也不是答案能不能被程序判对(RLVR)。
校准概率是说:模型报 80%,长期看,这类判断里大约八成应该是对的。你拿到的是可以设阈值的数,不是一句「我很有把握」。
|
|
聊天大模型 |
JEV |
|---|---|---|
|
优化目标 |
RLHF / RLVR,偏人类偏好或可验证奖励 |
RLCD,偏校准后的概率 |
|
输入 |
对话、文档等非结构化文本 |
非结构化状态,强调程序状态 |
|
输出 |
字符串,往往还要解析 |
类型化的值,外加概率 |
|
采样 |
自回归,逐 token |
并行,一次出全部字段 |
|
速度与价格 |
秒到分钟级,输出通常更贵 |
官方评测约 70–500 毫秒,输出免费 |
用流失预警,看一次调用怎么分流
电商的客服和增长后台里,用户状态一直在进:订单摘要、最近投诉、活跃了多少天,再加上一段留言。你要的不是一篇分析。你要的是分流。
以前把同一段状态丢给大模型,让它慢慢生成 JSON。字段写成 risk 而不是 churn_risk,下游就崩。它还可能在约定之外发明一个等级。
JEV 读的是同一段程序状态。schema 事先写死,例如:
|
字段 |
取值 |
给代码的含义 |
|---|---|---|
|
|
|
流失风险 |
|
|
|
自动挽留、人工跟进,或升级主管 |
|
|
数值 |
可排序的强度 |
|
各字段概率,外加整体 |
0 到 1 |
这次判断有多集中 |
一次查询,这些字段一起出来。周围代码只保留分支:
if route == human or confidence < 阈值:
转人工
else if route == escalate:
升级主管
else:
走自动挽留
没有要解析的 JSON 字符串,也没有模型现编的字段名。置信度偏低时,单子自己交给人。官方把这种用法叫智能 if:模糊规则嵌进代码,分支仍由你的程序决定。
用一段现场把同一次调用走完。下面的取值只为看清接口,不是官方样例,也不是某次真实调用。
近 30 天两笔订单都取消了。昨天有一条物流超时的投诉。活跃天数是 3 天。留言写着「再这样我就再也不买了」。
示意输出:churn_risk = high,route = human,confidence 落在你事先定的阈值下方。代码因此走人工,而不是自动发一张挽留券。
判断对不对,要靠你事后对真实流失的核对。模型这里只保证:字段名和取值都在 schema 里。
这里要划清一件事。类型安全消掉的是「输出不符合 schema」。它不保证业务判断正确。
高风险被判成低风险,类型依然合法。所以阈值留在你这边,低置信度走人工。不要把标签当成事实。
官方还演示过另外两类用法,这里只点一下。Doom 把结构化的游戏状态收成动作,大约每秒 10 次查询、每小时 7 美元量级。Wikiracing 在大量链接里做选择。
单次选择的基数上限是 255。再大,就拆成两段:先独立打分,再显式选择。这篇的主例子,仍然是上面的流失分流。
70 毫秒到 500 毫秒,输出还不计费
TypeSafe 在发布文的 Speed 一节给出端到端延迟:JEV 大约 70 毫秒到 500 毫秒。他们引用的前沿大模型大约是 3 秒到 329 秒(对照来自 llm-benchmarks)。在同等 System One 形态的问题上,大约快 40 倍到 200 倍。
这组延迟测自美国西海岸的官方服务。用户若在别的地区,还要加上网络时间。拿去对实时界面做承诺之前,用自己的流量测一次。
价格在同一篇的 Cost 一节:输入 0.042 美元 / 百万 token,也就是大约 42 美元 / 十亿 token,输出免费。对照表里,大模型输入大约 0.20 到 10 美元 / 百万 token,输出往往再贵约 5 倍。
Workflow 评测上,官网引用过一组峰值:大约快 193.6 倍、便宜 444.6 倍。TypeSafe 自己说这是偏乐观的一端。评测固定了计算图,并对齐外部模型的概率。
引用时带上「官方 workflow 评测峰值」,不要当成你业务里的保证。评测页在 evals.typesafe.ai。
这些数字说明的不是聊天变快了。实时分支、高并发打分、给大模型当裁判或护栏,有机会接进流水线。你不必为每一次判断,付一次长生成的时间和钱。
JEV 适合分流和护栏,不适合写长文
适合放上去的地方,有一个共同点:程序要的是分支,不是一段新文字。
-
工作流里的分流和路由,比如挽留、人工、升级。你要是已经用 Docker 把 n8n 跑起来,这类判断适合放在流程节点上。
-
海量数据上的打分、抽取和特征,适合做成 map-reduce。
-
实时路径上的决策,延迟预算在几百毫秒。
-
给大模型的输出做裁判、护栏、越狱检测:要的是概率和阈值,不是另一段聊天。
不适合的也同样清楚。JEV 主动放弃字符串生成。换来的是速度、类型安全,以及不会在 schema 之外编字段。
长文、代码、对话回复,仍是聊天模型的活。写文章、拉长上下文,继续用 DeepSeek V4 这类模型。
任务如果要长链条的发明和反复推理,那是 System 2 的工作。图像像素也不在这篇发布文的主示例里。Doom 用的是结构化文本状态,不是画面。
单次选择超过 255 个选项,要拆成两段。
官方提供了一个开源的 System One LLM adapter,用来让大模型的输出去对齐这套结构化决策接口。适配器解决的是接口形状。它不会把聊天模型变成 JEV。
常见问题
JEV 是什么?
TypeSafe 在 2026 年 9 月发布的第一个 System One 模型。输入是非结构化状态,输出是类型化、带校准概率的决策,给代码调用,不给读者阅读。
它是更小的聊天模型吗?
按官方说法,不是。差别在新架构、并行采样和 RLCD,不在「参数更少」。参数量没有公开。
它还会幻觉吗?
在 schema 意义上,官方称类型错误不可能发生,因此不会编出 schema 之外的字段。业务判断仍可能错。低置信度要转人工。
一次最多选多少个选项?
官方给出的单次选择基数上限是 255。更高基数用两段:先独立打分,再显式选择。
延迟和价格以哪份数字为准?
以 2026-09-15 发布文为准:端到端约 70–500 毫秒(西海岸官方评测),输入 0.042 美元 / 百万 token,输出免费。193.6 倍和 444.6 倍是官方 workflow 评测峰值,官方称偏乐观。
下一步:用一段真实状态把阈值跑通
JEV 赌的未来很窄。聊天继续交给会写字符串的模型。状态进去,类型化的决策和校准概率出来,低置信度交给人。
类型安全让错误变得可管理。它没有让判断变成真理。阈值、人工兜底,以及你自己流量上的校准,仍然写在模型外面。
下一步读 TypeSafe 的发布文和文档。拿一段真实的用户状态,先把「置信度低于阈值就转人工」跑通,再谈能不能进生产。
来源
-
TypeSafe AI,Introducing System One Models & Jev,2026-09-15。https://typesafe.ai/blog/introducing-system-one-models-and-jev
-
TypeSafe Docs。https://docs.typesafe.ai/
-
TypeSafe workflow evals。https://evals.typesafe.ai/
-
typesafe-ai/system-one-adapter-python。https://github.com/typesafe-ai/system-one-adapter-python
-
Daniel Kahneman,Thinking, Fast and Slow。https://www.penguinrandomhouse.com/books/89308/thinking-fast-and-slow-by-daniel-kahneman/
-
发布文 Speed 一节引用的大模型端到端时延。https://llm-benchmarks.diegoromero.es/
评论