解读 · 更新于 2026-09-18

Jev 是什么?
一次讲清楚。

Jev 是 TypeSafe AI 的模型,它不写文字。你把一段内容和一个答案选项固定的问题发给它,它返回其中一个选项,并附上概率。整个思路就是这样,其余一切都由此推导而来。

我们做了一个 Jev 的恶搞版,为此把它的文档全部读了一遍。这个页面是我们读完之后的正经总结。玩笑放在最后。

一句话总结

它做什么。接收你的内容和一个带类型的问题,返回一个带类型的答案和一份概率分布。永远不返回句子。

它为谁服务。为你的代码要消费的判断,而不是给人读的判断。路由、分类、过滤、排序、决定继续还是停止。

为什么大家兴奋。它足够快也足够便宜,让你可以把判断放进那些以前根本不值得调用大模型的地方。

它不是什么。不是聊天机器人,也不是推理模型,更不能替代两者。它完全没有生成能力。

它为什么出现

大语言模型是为了产出给人阅读的文字而设计的。但当你需要模型做一个你的代码要据此行动的判断时,错配就出现了。你只能哄着一个文本生成器吐出结构化输出,再写一层解析把它变回程序敢信任的东西。凡是用大模型做过开发的人都写过这层代码,也都见过它崩掉。

TypeSafe 把 Jev 称为 System One 模型,取自人类那种快速直觉的思考方式。他们给出的对比是训练方式。聊天模型用基于人类反馈的强化学习训练。推理模型用基于可验证奖励的强化学习训练。Jev 用他们称为 RLCD 的方法训练,即面向校准决策的强化学习。目标不是一句漂亮的话,而是一个真正有意义的概率。

三种原语

Jev 只暴露三种问题类型。每一种问的东西不同,返回的东西也不同。

问题类型你在问什么返回什么
Choice从我给的列表里选一个被选中的选项、每个选项的概率,以及一个置信度
Score按我定义的标准打分一个分数、每个档位的概率,以及一个置信度
Noul这个陈述成立吗一个 0 到 1 之间的数字。没有置信度

关键细节在于,三种可以混在同一次请求里。每个问题都针对同一段内容并行且相互隔离地评估,所以多加几个问题几乎不会改变耗时。因为彼此独立,问题之间不会像长提示词那样互相污染。

真正改变使用体感的就是这个性质。你不再是写一条聪明的提示词,而是一次抛出十二个小问题,然后在自己的代码里把结果组合起来。

state(状态)

你想让它评估的内容叫做 state。它可以是一个字符串、一个 JSON 对象,或者一个文本数组。多数情况下用对象最好,因为给内容的每一部分起名字能让它们之间的关系保持清晰。

Jev 只接受文本。不支持图片、音频和视频。如果你想让它判断的东西不是文本,得先把它变成文本或结构化字段。

有一个值得尽早知道的限制:Jev 的主要训练语言是英语。它在其他语言上也能工作,但效果并不相同。如果你面向中文用户开发,请先做测试再投入。

置信度

每个 Choice 和 Score 的答案都会带回一份跨选项或跨档位的概率分布。真正的信号是这个分布的形状。集中在某一个结果上,说明模型很确定;分散开来,说明它不确定。

置信度这个值把形状压缩成 0 到 1 的一个数字,让你不用自己算就能设阈值。TypeSafe 明确说这只是一个方便的度量,而不是唯一正确的度量,所以他们同时返回完整的分布。Noul 的答案没有置信度,因为它返回的那个数字本身已经是概率了。

由此解锁的实用模式是按确定性分流。确定的情况自动处理,不确定的交给更慢的模型或者交给人。这个设计在文本生成器之上是做不出来的,因为文本生成器无论知不知道,都会用同样流畅的语气把话说完。

价格与限制

以下是当前模型 jev-1.13.0 的公开数据,由单一端点提供服务。

价格每十亿输入 token 42 美元,或每百万 token 0.042 美元。输出 token 免费,因为本来就没多少。 速率限制每秒 250,000 token,每分钟 1,200 次请求。TypeSafe 说明在需求高峰期这些数字会变动。 上下文单次请求中 state 加全部问题合计 64k token;state 加最长的那个问题合计 32k token。 输入仅限文本。字符串、JSON 对象,或文本数组。 端点POST /v1/systemone,通过请求中的字段指定模型。

只按输入计费而不按输出计费,对一个输出只有一个选项加一个数字的模型来说,是诚实的定价方式。这也解释了为什么大家不停在晒自己的账单截图。只要你发送的 state 不大,想花掉钱反而挺难。

怎么写好问题

TypeSafe 自己给的建议是他们文档里最有用的部分,也是大多数人跳过的部分。每个问题只问一件具体且范围清晰的事。把每个问题都想成一次直觉判断:一个懂行的人在拿到合适上下文后几秒钟内能给出的结论。

如果一个问题需要长链条推理,或者要权衡几个互相独立的因素,就把它拆开。与其让它给一份创业路演打分,不如分别问市场规模、技术可行性和差异化,再用你自己的公式合成。等优先级变了,你改的是代码里的一个系数,而不是重写一段提示词。

真正的转变在这里。逻辑不再住在模型里面。逻辑住在你的代码里,模型只回答这套逻辑需要的那些小的事实判断。

它做不好什么

TypeSafe 公开了当前版本的已知短板,这一点比多数实验室都做得多。以下是他们列出的失败模式,以及他们自己给的应对建议。

失败模式应该怎么做
字面理解。它回答你写下的问题,而不是你想问的问题把确切条件和每个选项的判定标准写清楚
数学和数字把算术留在你的代码里
日期和时间比较先拆出各个分量,在代码里比较
间接引用,答案隔了好几跳减少跳数,直接指向相关内容
塞满无关细节的大 state先过滤,只发送这个问题需要的部分
对抗性内容把问题写精确,上线前测试边界情况
互相矛盾的指令和标准让标准和指令保持一致
常识层面的结构一致性每个判断只从一个方向问,恒等关系由代码保证
任何形式的生成用生成模型。这个做不到

九条背后是同一个规律。Jev 字面、而且快。凡是需要推理链条、数值精度,或者同时权衡多个相互拉扯的想法的场景,都不是它该干的活。

你该用它吗

适合,如果你的代码里已经有一个人类瞬间就能下的判断,而你现在是用一堆 if、一份关键词表,或者一次让你有点心虚的大模型调用来处理它。工单路由、垃圾与滥用内容过滤、内容打标、意图识别、候选排序、决定一个 agent 该继续还是停下。

不适合,如果你需要文字、推理、算术,或者一个要直接给人读的答案。它不是更小的聊天机器人,而是另一种工具。

可能还得再等等,如果你在用中文等非英语语言开发,或者你的判断依赖精确的数值比较。这两点都是目前有文档记录的弱项。

关于这个页面

我们不是 TypeSafe AI。这个网站是对他们的恶搞,Jef 是我们对 Jev 的恶搞。写这篇解读,是因为问 Jev 是什么的人实在太多了,而诚实的答案比它周围的喧嚣更有意思。

本页所有内容均来自 TypeSafe 自己的文档 docs.typesafe.ai,查阅时间为 2026 年 9 月 18 日。数字会变,依赖之前请核对原始出处。

下面开始是玩笑。

我们太喜欢这个形态了,于是做了一个蠢版本。Jef 有同样封闭的输出空间、同样的置信度数字,唯独没有准确率。它有一整套聊天界面,却连一个句子都说不出来。它什么都不读,什么都不存,并且永远大约 97% 确定。

和 Jef 聊聊 → 看看这些应用

English · 日本語 · Español · Português · 中文