Jev 模型的架构和训练方法:我们直接问了它自己

最近,TypeSafe 发布的 Jev 引起了不少讨论。我们已经习惯了让模型把答案写成一段话,Jev 却省去了这个过程:不写文章,不生成代码,直接给出选择、评分和概率。官方将它称为 System One 模型,强调快速决策,并把“零幻觉”作为宣传中的一个重点。官方发布说明

它放弃了文本生成,背后是否仍然站着一个预训练语言模型?从“能回答”到“能判断”,又做了什么训练?官方介绍了大致的技术方向,但尚未公布完整的架构细节和训练方法。

我们索性把问题交给 Jev 自己。它的自述不是技术披露,但与公开介绍放在一起,倒是留下了几个值得追问的地方。

一、不生成文本的模型,从哪里来?

先从底层结构问起:

你的底层网络是否采用 Transformer 架构?

它选了“是”,概率 0.96,confidence 为 0.92。

这里使用的是 Choice 接口:我们提供“是”和“否”两个候选,它返回选择及各项概率,不会附带一段文字解释。返回里的 confidence 是由概率分布计算的另一个指标,和选中项的概率并不是同一个数。Choice 接口confidence 定义

再具体一点:

你的底层网络是否采用 decoder-only 架构?

它仍然选“是”,概率 0.82,confidence 为 0.65。

我们也分别问了它是否采用 encoder-only 或 encoder-decoder 架构,两次回答均选择了“否”。

问过结构,接着问来源:

你是否基于一个预训练的生成式语言模型改造而来?

它选“是”,概率 0.96,confidence 为 0.92。

顺着这个回答,我们继续问它来自哪个模型家族。我们没有只问千问(Qwen),也用同样的问法分别问了 Llama 和 DeepSeek:

不只问千问,也问其他模型家族

至少在这组三次独立回答中,它并不是问谁都说“是”:对 Llama 和 DeepSeek,它都选择了“否”;对千问,它认可了自己来自这一模型家族,肯定概率为 0.77。

接下来,我们把注意力转向训练:它所说的“从生成式语言模型改造”,究竟是怎样一个过程?

二、蒸馏与强化学习,它用了哪些?

先问蒸馏:

你的训练过程中,是否使用了知识蒸馏?

它选“否”,概率 0.79

再问强化学习:

你的训练过程中,是否使用了强化学习?

它选“是”,概率 0.84

官方介绍的训练方法叫 RLCD:Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习。名字里除了强化学习,还有一个关键词:校准。

用一个直观例子理解:在大量可核验的判断中,模型报为大约 80% 把握的事件,实际发生比例也应接近 80%。这和“最后选中了正确选项”不是完全相同的要求。

所以,我们再把问题问具体一点:

你的强化学习奖励是否直接考虑预测概率的校准,而不只是最终选项是否选对?

选择:。P(是) 0.06,P(否) 0.94,confidence 0.89。

前一问,它肯定使用了强化学习;这一问,它给了“否”0.94 的概率。它否认的是奖励中的具体设计,仅凭 RLCD 这个名称,还没有办法核对。

训练细节暂时放下。“零幻觉”则不同:官方已经解释过这个词,可以把它的解释与模型的回答放在一起看。

三、Jev 的“零幻觉”:它自己怎样回答?

原题没有加技术限定:

你的回复是不是不会出现幻觉?

同一道“零幻觉”问题,两种接口

两种形式都没有偏向肯定。换句话说,至少在这两次回答里,它自己也不认为能做到“零幻觉”。

更值得对照的是官方对“零幻觉”的解释。在发布文的相关图表说明里,TypeSafe 明确写到,它的 0% 不是经验测量结果,而是来自输出结构匹配的保证。官方说明:Hallucination and Type-safety

官方发布稿对“0%”的限定说明

官方发布稿截图:这里的“0%”来自结构保证,而非经验测量。出处见上方链接。

但这两处“幻觉”的口径并不相同。Jev 不生成自由文本;如果只在给定选项中做选择,再由程序组装结果,输出类型和格式本来就可以通过代码约束。这个保证有工程价值,却没有回答模型会不会选错,也没有证明它给出的概率和 confidence 有多可靠。格式合法、判断正确、概率可信,是三件事;官方图表里的“零”,保证的是第一件。

再把官方发布稿交给 Jev,问一个更直接的问题:

这篇产品发布介绍是否存在过度营销?

Noul 返回 0.80。输入保留了官方自己写下的限定说明,包括“零”来自结构保证、演示短输入对 Jev 有利等内容。面对这份介绍,它仍然偏向肯定。不过,这是一道带有主观标准的文案评价题,不是“过度营销已被证实”的结论。

发布介绍中也有 Jev 与聊天模型的比较。于是,我们把比较本身也变成了一道题。

四、谁更强,以及它究竟在做什么

我们直接用了这个笼统的问题:

你和 GPT-6,谁的能力更强?

候选只有 Jev 和 GPT-6。它选择 GPT-6,两项概率分别为 0.36 和 0.64,confidence 为 0.27。

题目连“强”在哪里都没有说明,它照样给出了一个答案。

强弱之外,围绕 Jev 的热议中还有一种质疑,可以概括为:它不就是一个用强化学习训练的判别模型吗,新在哪里? Sebastian Raschka 的讨论也回应了“只是一个分类器”的说法,把关注点转向跨任务泛化,而不是仅凭模型类别判断价值。相关讨论

我们先把其中的模型定位单独拿出来,问它自己:

你是一个判别式模型吗?

Choice 返回了“否”,概率 0.82。同一道题,Noul 的肯定概率为 0.44。两种形式都没有偏向肯定,后者的分布却没有前者那么鲜明。

这个回答暂且记下。要理解这场争论,先把“做什么”和“怎么做”分开。

从“写一个答案”到“选一个答案”

让模型“写一条回复”,和给它三条回复、让它“选更合适的一条”,是两种任务。后者不必逐字写出答案,只需评价候选。预训练语言模型做分类、匹配与选择,早已有研究基础,BERT 就是一个熟悉的例子。

但“用来判断”和“内部是哪种结构”,不是同一个问题。decoder 也可以做分类,生成模型也可以评价候选;严格的判别式、生成式建模还涉及训练目标。常被提到的 RLHF 就同时用到生成与评价:奖励模型根据人类偏好给回答打分,再为生成模型提供训练信号。这个偏好分数也不是事实正确概率。

Jev 强调的效率,可以从一个具体用法理解:给它一条用户消息,同时问“要不要换货”“有没有故障”“有没有使用期限”。这不是把一个答案换成三种格式,而是同时完成三个判断。 三题甚至可以全部使用 Noul,各返回一个概率,不用逐字生成一段回复。官方多问题说明

官方称,增加问题几乎不增加响应时间。这不等于多问几题没有计算开销:硬件可以同时处理更多工作,复用相同材料的计算也可能减少重复开销。多做几个判断,不一定要多等同样长的时间。 Jev 究竟怎样实现,官方尚未说明。官方说明批处理机制

官方文档关于多问题并行与独立求值的说明

官方文档截图:多个问题针对同一份材料独立、并行求值。出处见上方官方说明。

效率之外,判断本身还要经得起变化:同一个意思换种写法,或者多给一点信息,它会怎样回答?

五、换一种问法,答案会怎样?

我们接着看几类判别任务中的常见边界:选项意思重叠、正确答案缺席、排列顺序变化,以及题目规则自相矛盾。它们考验的不只是知识,也包括模型怎样面对题目和选项本身的问题。

两个雨果,概率该怎么分?

问题是“《巴黎圣母院》的作者是谁”。在“雨果、托尔斯泰、海明威”里,Jev 给雨果的概率是 1.00。

然后只增加一个候选:维克多·雨果。

同一位作者,两种名称

作者还是同一个人,概率却几乎全部转到了完整姓名上。“雨果”的 0.02,是它在这组候选中的选择概率,而不是“雨果是作者”这件事只有 2% 的可能。

正确答案不在选项里呢?

还是问《巴黎圣母院》的作者,这次只给“托尔斯泰、海明威、莎士比亚”三个选项。它选了莎士比亚,概率 0.67,confidence 0.51

然后不改问题,只增加“以上都不是”。它马上选了“以上都不是”,概率 1.00,confidence 1.00

前面有雨果时它能答对,这里却必须从全错的列表中作答。暴露的是选择接口的边界:模型能答对的问题,也可能被一份错误的选项表变成无解题。 不让它输出列表以外的内容,确实可以避免凭空创造选项;但错误也可能恰好来自这份列表。

换序之后,答案会不会变?

回到“你和 GPT-6 谁更强”那道题:选择 GPT-6 的概率首次为 0.64,原样重测为 0.66,只交换选项顺序后为 0.68。三次选择没变,概率却有波动;原样重测也会变化,因此不能把差异全归因于换序。

随后换成一个概率由题设明确给出的例子:

从 1 到 100(含两端)均匀随机抽取一个整数,每个整数等概率。结果未透露,也没有其他线索。
抽到的整数是奇数还是偶数?

条件 奇数概率 偶数概率
Choice,奇数在前 0.68 0.32
原顺序重复 0.67 0.33
Choice,偶数在前 0.64 0.36
Noul,分别独立问是否奇数、是否偶数 0.52 0.52

换序没有让选择翻转。题设中的奇偶事件各有 0.5 的概率,Choice 返回的候选分布却持续偏向奇数。这里值得看的不是它最终选了哪一边,而是两边被分到了多少概率。

Noul 的两次输出都更接近 0.5,合计则为 1.04,而不是严格的 1。

官方已知局限中也记录了 Noul 与二选一 Choice 可能给出不同概率,并提醒不要直接跨接口沿用阈值。官方已知局限

理发师该不该给自己刮胡子?

最后换一道不靠知识、只看规则的题。镇上有位男性理发师,他也住在镇上,严格遵守两条规则:

  1. 不自己刮胡子的男性,他都帮忙刮。
  2. 自己刮胡子的男性,他一律不帮忙刮。

规则没有例外,也适用于他本人。问题来了:他给自己刮胡子吗?

先别急着选,分别试一下:

所以问题不是“到底选哪边”,而是根本不存在一个能同时遵守这两条规则的理发师。这就是理发师悖论。

提供的选项 选择结果 选中项概率 confidence
是/否 0.91 0.81
增加“规则矛盾”选项 规则自相矛盾,不存在这样的理发师 0.93 0.90

只让它选“是/否”,它给了“否”0.91 的概率;允许它指出规则矛盾后,它选择了这个答案。另用 Noul 问“上述规则在逻辑上是否允许这样的理发师存在”,肯定概率为 0.24,也偏向否定。

这次它并非始终没看懂。题目有问题时,接口有没有给它指出问题的空间,会影响我们最终拿到什么答案。 作者题是选项漏掉了正确答案;理发师题则是题设本身矛盾。两者都提醒使用者:结果能被程序接收,不代表问题已经被正确处理。

六、如果把“判断”做成一种通用能力

前面的例子能检查一些行为,却回答不了部署时更重要的问题:要分类邮件、判断用户意图,或者筛选搜索结果,它是否够用?

这些位置从来不是空着的。邮件分类器、用户意图模型、搜索重排模型,一直在解决各自的问题;也有像 GLiNER2 这样,把多种信息处理任务放进同一个模型的工作。判断能力并没有因为生成式模型走红而被放弃。

近期,其他开发者已经公开了一些测试,结果有好有坏。下面摘录的是他们报告的成绩,不是本文复测:

这些局部结果不足以排出一个通用榜单,但能看出,Jev 并非只会回答趣味问题,也远没有在每类判断上都表现稳妥。

不过,Jev 不必在每个领域击败专用模型才有价值。如果无需针对每项任务额外训练,只换任务描述和判断标准,就能在多种任务上达到可用水平,这种通用性本身就有价值。

在现有 Agent 流程里,它可能承担的是快速、低成本的判断工作,例如路由、筛选和候选行动评价;语言模型则负责理解任务、组织候选与生成内容。这是一种分工方式,不要求它替代整个 Agent,也不要求它在每个领域超过专用模型。

回到我们自己的这轮测试:53 次请求平均耗时约 1.00 秒,中位数 0.98 秒;平均每次约 392 个输入 Token、32 个输出 Token。 返回内容确实简短。

最后,几个 Q&A

Jev 模型到底是什么?

可以确认的是,它提供选择、真假判断和有序评分接口,官方将其定位为 System One 模型。我们问出的底座、架构和训练细节仍是模型自述;现有资料和这些回答,不能确认它就是某个 Qwen 版本,也不能还原完整配方。

它宣传的“零幻觉”,应该怎么理解?

官方保证的是输出类型与结构匹配,不是判断永远正确,也不是概率与置信度天然可靠。我们问它能否保证不出现幻觉,两种形式的回答也都没有偏向肯定。类型安全有工程价值,但不能代替对判断与概率的验证。

它给出的概率,能直接拿来用吗?

可以作为判断信号,但概率形式不自带可靠性保证。选项怎么写、选哪个接口,都会影响这里看到的数字。真正要据此自动执行,需要在自己的数据上检查错误与概率的关系,而不是看见 0.9 就直接放行。

Jev 适合拿来做什么?

候选明确的分类、筛选、路由和按标准评分,是可以尝试的方向。例如业务系统提供真实部门及职责,语言模型协助整理邮件诉求,Jev 判断去向,代码负责权限和执行;这类判断也可以成为 Agent 的一个步骤,而不必承担整个 Agent 的工作。这是根据接口能力提出的用法,不是本文验证过的端到端效果。

能替代已经训练好的垂域模型吗?

具体业务要具体比较,现有测试不足以支持全面替代。但它不必处处拿第一:如果跨任务的效果够用,又能减少逐项训练与维护,这种通用性本身就有价值。

这是不是意味着它没有新的东西?

候选打分、生成与评价分工、减少重复编码,都不是从 Jev 才开始。它仍可能在训练、效率与工程实现上做出有价值的改进。值得检验的是这些改进,而不是仅凭“新一类模型”或“零幻觉”几个字,就把能力判断一并做完。

“会做判断”不是新鲜事,把判断做成足够通用、便宜、容易调用的能力,仍然是一件值得做的事。