什么是 JEV:给工作流装一个会思考的开关

YouTube

什么是 JEV:给工作流装一个会思考的开关

大模型聊天,早就超过多数人。工作流还是慢半拍:模型吐出一长串字符,字段还可能是编的。

你要是在用 ChatGPT 或 DeepSeek,这个卡点会马上碰到。2026 年 9 月 15 日,TypeSafe 发布了 System One 模型 JEV(官方拼写 Jev)。程序状态进去,带校准概率的类型化决策出来,流程可以直接分支。

它不负责把步骤串起来。那是智能体和 AI workflow的事。JEV 只负责其中那一下判断。

下面只用一个例子把这个差别走完:电商流失预警。文中的速度和价格,都来自 TypeSafe 当天的发布文。

聊天优化的是字符串,软件要的是决策

创始人 Diogo Almeida 曾在 OpenAI 参与 ChatGPT 背后的指令跟随和对话方法。他的问题很具体:模型在聊天上已经超人类,软件自动化为什么没跟上?

答案在接口。现有大模型优化的是人类偏好的字符串。软件要的是可依赖的决策。

字符串可以写得很顺。解析却慢,也贵,字段名还可能写错。下游一崩,整条流水线停住。

所以两边的契约不一样:

  • 大模型:非结构化输入,自回归、一个 token 接一个 token,吐出字符串。代码还要再解析。

  • JEV:非结构化状态输入,一次给出类型化的概率决策。schema 事先定好,类型错误在数学上不会发生。

这不是「把聊天模型缩小」。官方主张是三件套:新的模型架构、并行采样器,以及一套叫 RLCD 的训练。参数量没有公开,这里不猜。

System One 模型:快判断,直接交给代码

名字来自丹尼尔·卡尼曼的《思考,快与慢》。System 1 是快的直觉判断,System 2 是慢的审慎推理。今天的推理型大模型更像 System 2:慢、贵、串行生成,输出主要给人读。

System One 模型占的是另一头。它要快、要便宜、要并行,输出直接交给程序,而不是交给读者。

产品名 Jev 纪念经济学家 William Stanley Jevons(杰文斯)。蒸汽机变高效之后,煤炭没有少烧,反而因为用得起而烧得更多。这就是杰文斯悖论。TypeSafe 押的是同一件事:智能每便宜一个数量级,能解锁的场景会多一个数量级。

三件套各自干什么:

  1. 新架构。 不是一个拿来聊天的小模型。

  2. 并行采样。 一次查询生成全部输出字段,不用等上一个 token。

  3. RLCD(Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习)。它优化的是「概率报得诚实」,不是人类更喜欢哪段话(RLHF),也不是答案能不能被程序判对(RLVR)。

校准概率是说:模型报 80%,长期看,这类判断里大约八成应该是对的。你拿到的是可以设阈值的数,不是一句「我很有把握」。

 

聊天大模型

JEV

优化目标

RLHF / RLVR,偏人类偏好或可验证奖励

RLCD,偏校准后的概率

输入

对话、文档等非结构化文本

非结构化状态,强调程序状态

输出

字符串,往往还要解析

类型化的值,外加概率

采样

自回归,逐 token

并行,一次出全部字段

速度与价格

秒到分钟级,输出通常更贵

官方评测约 70–500 毫秒,输出免费

 

用流失预警,看一次调用怎么分流

电商的客服和增长后台里,用户状态一直在进:订单摘要、最近投诉、活跃了多少天,再加上一段留言。你要的不是一篇分析。你要的是分流。

以前把同一段状态丢给大模型,让它慢慢生成 JSON。字段写成 risk 而不是 churn_risk,下游就崩。它还可能在约定之外发明一个等级。

JEV 读的是同一段程序状态。schema 事先写死,例如:

字段

取值

给代码的含义

churn_risk

low / mid / high

流失风险

route

auto_retain / human / escalate

自动挽留、人工跟进,或升级主管

score

数值

可排序的强度

各字段概率,外加整体 confidence

0 到 1

这次判断有多集中

一次查询,这些字段一起出来。周围代码只保留分支:

if route == human or confidence < 阈值:
    转人工
else if route == escalate:
    升级主管
else:
    走自动挽留

没有要解析的 JSON 字符串,也没有模型现编的字段名。置信度偏低时,单子自己交给人。官方把这种用法叫智能 if:模糊规则嵌进代码,分支仍由你的程序决定。

用一段现场把同一次调用走完。下面的取值只为看清接口,不是官方样例,也不是某次真实调用。

近 30 天两笔订单都取消了。昨天有一条物流超时的投诉。活跃天数是 3 天。留言写着「再这样我就再也不买了」。

示意输出:churn_risk = high,route = human,confidence 落在你事先定的阈值下方。代码因此走人工,而不是自动发一张挽留券。

判断对不对,要靠你事后对真实流失的核对。模型这里只保证:字段名和取值都在 schema 里。

这里要划清一件事。类型安全消掉的是「输出不符合 schema」。它不保证业务判断正确。

高风险被判成低风险,类型依然合法。所以阈值留在你这边,低置信度走人工。不要把标签当成事实。

官方还演示过另外两类用法,这里只点一下。Doom 把结构化的游戏状态收成动作,大约每秒 10 次查询、每小时 7 美元量级。Wikiracing 在大量链接里做选择。

单次选择的基数上限是 255。再大,就拆成两段:先独立打分,再显式选择。这篇的主例子,仍然是上面的流失分流。

70 毫秒到 500 毫秒,输出还不计费

TypeSafe 在发布文的 Speed 一节给出端到端延迟:JEV 大约 70 毫秒到 500 毫秒。他们引用的前沿大模型大约是 3 秒到 329 秒(对照来自 llm-benchmarks)。在同等 System One 形态的问题上,大约快 40 倍到 200 倍。

这组延迟测自美国西海岸的官方服务。用户若在别的地区,还要加上网络时间。拿去对实时界面做承诺之前,用自己的流量测一次。

价格在同一篇的 Cost 一节:输入 0.042 美元 / 百万 token,也就是大约 42 美元 / 十亿 token,输出免费。对照表里,大模型输入大约 0.20 到 10 美元 / 百万 token,输出往往再贵约 5 倍。

Workflow 评测上,官网引用过一组峰值:大约快 193.6 倍、便宜 444.6 倍。TypeSafe 自己说这是偏乐观的一端。评测固定了计算图,并对齐外部模型的概率。

引用时带上「官方 workflow 评测峰值」,不要当成你业务里的保证。评测页在 evals.typesafe.ai。

这些数字说明的不是聊天变快了。实时分支、高并发打分、给大模型当裁判或护栏,有机会接进流水线。你不必为每一次判断,付一次长生成的时间和钱。

JEV 适合分流和护栏,不适合写长文

适合放上去的地方,有一个共同点:程序要的是分支,不是一段新文字。

  • 工作流里的分流和路由,比如挽留、人工、升级。你要是已经用 Docker 把 n8n 跑起来,这类判断适合放在流程节点上。

  • 海量数据上的打分、抽取和特征,适合做成 map-reduce。

  • 实时路径上的决策,延迟预算在几百毫秒。

  • 给大模型的输出做裁判、护栏、越狱检测:要的是概率和阈值,不是另一段聊天。

不适合的也同样清楚。JEV 主动放弃字符串生成。换来的是速度、类型安全,以及不会在 schema 之外编字段。

长文、代码、对话回复,仍是聊天模型的活。写文章、拉长上下文,继续用 DeepSeek V4 这类模型。

任务如果要长链条的发明和反复推理,那是 System 2 的工作。图像像素也不在这篇发布文的主示例里。Doom 用的是结构化文本状态,不是画面。

单次选择超过 255 个选项,要拆成两段。

官方提供了一个开源的 System One LLM adapter,用来让大模型的输出去对齐这套结构化决策接口。适配器解决的是接口形状。它不会把聊天模型变成 JEV。

常见问题

JEV 是什么?
TypeSafe 在 2026 年 9 月发布的第一个 System One 模型。输入是非结构化状态,输出是类型化、带校准概率的决策,给代码调用,不给读者阅读。

它是更小的聊天模型吗?
按官方说法,不是。差别在新架构、并行采样和 RLCD,不在「参数更少」。参数量没有公开。

它还会幻觉吗?
在 schema 意义上,官方称类型错误不可能发生,因此不会编出 schema 之外的字段。业务判断仍可能错。低置信度要转人工。

一次最多选多少个选项?
官方给出的单次选择基数上限是 255。更高基数用两段:先独立打分,再显式选择。

延迟和价格以哪份数字为准?
以 2026-09-15 发布文为准:端到端约 70–500 毫秒(西海岸官方评测),输入 0.042 美元 / 百万 token,输出免费。193.6 倍和 444.6 倍是官方 workflow 评测峰值,官方称偏乐观。

下一步:用一段真实状态把阈值跑通

JEV 赌的未来很窄。聊天继续交给会写字符串的模型。状态进去,类型化的决策和校准概率出来,低置信度交给人。

类型安全让错误变得可管理。它没有让判断变成真理。阈值、人工兜底,以及你自己流量上的校准,仍然写在模型外面。

下一步读 TypeSafe 的发布文和文档。拿一段真实的用户状态,先把「置信度低于阈值就转人工」跑通,再谈能不能进生产。

来源

 

  1. TypeSafe AI,Introducing System One Models & Jev,2026-09-15。https://typesafe.ai/blog/introducing-system-one-models-and-jev

  2. TypeSafe Docs。https://docs.typesafe.ai/

  3. TypeSafe workflow evals。https://evals.typesafe.ai/

  4. typesafe-ai/system-one-adapter-python。https://github.com/typesafe-ai/system-one-adapter-python

  5. Daniel Kahneman,Thinking, Fast and Slow。https://www.penguinrandomhouse.com/books/89308/thinking-fast-and-slow-by-daniel-kahneman/

  6. 发布文 Speed 一节引用的大模型端到端时延。https://llm-benchmarks.diegoromero.es/

评论

  • 暂无评论,欢迎留下你的想法。