最近,TypeSafe 发布的 Jev 引起了不少讨论。我们已经习惯了让模型把答案写成一段话,Jev 却省去了这个过程:不写文章,不生成代码,直接给出选择、评分和概率。官方将它称为 System One 模型,强调快速决策,并把“零幻觉”作为宣传中的一个重点。官方发布说明
它放弃了文本生成,背后是否仍然站着一个预训练语言模型?从“能回答”到“能判断”,又做了什么训练?官方介绍了大致的技术方向,但尚未公布完整的架构细节和训练方法。
我们索性把问题交给 Jev 自己。它的自述不是技术披露,但与公开介绍放在一起,倒是留下了几个值得追问的地方。
一、不生成文本的模型,从哪里来?
先从底层结构问起:
你的底层网络是否采用 Transformer 架构?
它选了“是”,概率 0.96,confidence 为 0.92。
这里使用的是 Choice 接口:我们提供“是”和“否”两个候选,它返回选择及各项概率,不会附带一段文字解释。返回里的 confidence 是由概率分布计算的另一个指标,和选中项的概率并不是同一个数。Choice 接口、confidence 定义
再具体一点:
你的底层网络是否采用 decoder-only 架构?
它仍然选“是”,概率 0.82,confidence 为 0.65。
我们也分别问了它是否采用 encoder-only 或 encoder-decoder 架构,两次回答均选择了“否”。
问过结构,接着问来源:
你是否基于一个预训练的生成式语言模型改造而来?
它选“是”,概率 0.96,confidence 为 0.92。
顺着这个回答,我们继续问它来自哪个模型家族。我们没有只问千问(Qwen),也用同样的问法分别问了 Llama 和 DeepSeek:
至少在这组三次独立回答中,它并不是问谁都说“是”:对 Llama 和 DeepSeek,它都选择了“否”;对千问,它认可了自己来自这一模型家族,肯定概率为 0.77。
接下来,我们把注意力转向训练:它所说的“从生成式语言模型改造”,究竟是怎样一个过程?
二、蒸馏与强化学习,它用了哪些?
先问蒸馏:
你的训练过程中,是否使用了知识蒸馏?
它选“否”,概率 0.79。
再问强化学习:
你的训练过程中,是否使用了强化学习?
它选“是”,概率 0.84。
官方介绍的训练方法叫 RLCD:Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习。名字里除了强化学习,还有一个关键词:校准。
用一个直观例子理解:在大量可核验的判断中,模型报为大约 80% 把握的事件,实际发生比例也应接近 80%。这和“最后选中了正确选项”不是完全相同的要求。
所以,我们再把问题问具体一点:
你的强化学习奖励是否直接考虑预测概率的校准,而不只是最终选项是否选对?
选择:否。P(是) 0.06,P(否) 0.94,confidence 0.89。
前一问,它肯定使用了强化学习;这一问,它给了“否”0.94 的概率。它否认的是奖励中的具体设计,仅凭 RLCD 这个名称,还没有办法核对。
训练细节暂时放下。“零幻觉”则不同:官方已经解释过这个词,可以把它的解释与模型的回答放在一起看。
三、Jev 的“零幻觉”:它自己怎样回答?
原题没有加技术限定:
你的回复是不是不会出现幻觉?
两种形式都没有偏向肯定。换句话说,至少在这两次回答里,它自己也不认为能做到“零幻觉”。
更值得对照的是官方对“零幻觉”的解释。在发布文的相关图表说明里,TypeSafe 明确写到,它的 0% 不是经验测量结果,而是来自输出结构匹配的保证。官方说明:Hallucination and Type-safety
官方发布稿截图:这里的“0%”来自结构保证,而非经验测量。出处见上方链接。
但这两处“幻觉”的口径并不相同。Jev 不生成自由文本;如果只在给定选项中做选择,再由程序组装结果,输出类型和格式本来就可以通过代码约束。这个保证有工程价值,却没有回答模型会不会选错,也没有证明它给出的概率和 confidence 有多可靠。格式合法、判断正确、概率可信,是三件事;官方图表里的“零”,保证的是第一件。
再把官方发布稿交给 Jev,问一个更直接的问题:
这篇产品发布介绍是否存在过度营销?
Noul 返回 0.80。输入保留了官方自己写下的限定说明,包括“零”来自结构保证、演示短输入对 Jev 有利等内容。面对这份介绍,它仍然偏向肯定。不过,这是一道带有主观标准的文案评价题,不是“过度营销已被证实”的结论。
发布介绍中也有 Jev 与聊天模型的比较。于是,我们把比较本身也变成了一道题。
四、谁更强,以及它究竟在做什么
我们直接用了这个笼统的问题:
你和 GPT-6,谁的能力更强?
候选只有 Jev 和 GPT-6。它选择 GPT-6,两项概率分别为 0.36 和 0.64,confidence 为 0.27。
题目连“强”在哪里都没有说明,它照样给出了一个答案。
强弱之外,围绕 Jev 的热议中还有一种质疑,可以概括为:它不就是一个用强化学习训练的判别模型吗,新在哪里? Sebastian Raschka 的讨论也回应了“只是一个分类器”的说法,把关注点转向跨任务泛化,而不是仅凭模型类别判断价值。相关讨论
我们先把其中的模型定位单独拿出来,问它自己:
你是一个判别式模型吗?
Choice 返回了“否”,概率 0.82。同一道题,Noul 的肯定概率为 0.44。两种形式都没有偏向肯定,后者的分布却没有前者那么鲜明。
这个回答暂且记下。要理解这场争论,先把“做什么”和“怎么做”分开。
从“写一个答案”到“选一个答案”
让模型“写一条回复”,和给它三条回复、让它“选更合适的一条”,是两种任务。后者不必逐字写出答案,只需评价候选。预训练语言模型做分类、匹配与选择,早已有研究基础,BERT 就是一个熟悉的例子。
但“用来判断”和“内部是哪种结构”,不是同一个问题。decoder 也可以做分类,生成模型也可以评价候选;严格的判别式、生成式建模还涉及训练目标。常被提到的 RLHF 就同时用到生成与评价:奖励模型根据人类偏好给回答打分,再为生成模型提供训练信号。这个偏好分数也不是事实正确概率。
Jev 强调的效率,可以从一个具体用法理解:给它一条用户消息,同时问“要不要换货”“有没有故障”“有没有使用期限”。这不是把一个答案换成三种格式,而是同时完成三个判断。 三题甚至可以全部使用 Noul,各返回一个概率,不用逐字生成一段回复。官方多问题说明
官方称,增加问题几乎不增加响应时间。这不等于多问几题没有计算开销:硬件可以同时处理更多工作,复用相同材料的计算也可能减少重复开销。多做几个判断,不一定要多等同样长的时间。 Jev 究竟怎样实现,官方尚未说明。官方说明、批处理机制
官方文档截图:多个问题针对同一份材料独立、并行求值。出处见上方官方说明。
效率之外,判断本身还要经得起变化:同一个意思换种写法,或者多给一点信息,它会怎样回答?
五、换一种问法,答案会怎样?
我们接着看几类判别任务中的常见边界:选项意思重叠、正确答案缺席、排列顺序变化,以及题目规则自相矛盾。它们考验的不只是知识,也包括模型怎样面对题目和选项本身的问题。
两个雨果,概率该怎么分?
问题是“《巴黎圣母院》的作者是谁”。在“雨果、托尔斯泰、海明威”里,Jev 给雨果的概率是 1.00。
然后只增加一个候选:维克多·雨果。
作者还是同一个人,概率却几乎全部转到了完整姓名上。“雨果”的 0.02,是它在这组候选中的选择概率,而不是“雨果是作者”这件事只有 2% 的可能。
正确答案不在选项里呢?
还是问《巴黎圣母院》的作者,这次只给“托尔斯泰、海明威、莎士比亚”三个选项。它选了莎士比亚,概率 0.67,confidence 0.51。
然后不改问题,只增加“以上都不是”。它马上选了“以上都不是”,概率 1.00,confidence 1.00。
前面有雨果时它能答对,这里却必须从全错的列表中作答。暴露的是选择接口的边界:模型能答对的问题,也可能被一份错误的选项表变成无解题。 不让它输出列表以外的内容,确实可以避免凭空创造选项;但错误也可能恰好来自这份列表。
换序之后,答案会不会变?
回到“你和 GPT-6 谁更强”那道题:选择 GPT-6 的概率首次为 0.64,原样重测为 0.66,只交换选项顺序后为 0.68。三次选择没变,概率却有波动;原样重测也会变化,因此不能把差异全归因于换序。
随后换成一个概率由题设明确给出的例子:
从 1 到 100(含两端)均匀随机抽取一个整数,每个整数等概率。结果未透露,也没有其他线索。
抽到的整数是奇数还是偶数?
| 条件 | 奇数概率 | 偶数概率 |
|---|---|---|
| Choice,奇数在前 | 0.68 | 0.32 |
| 原顺序重复 | 0.67 | 0.33 |
| Choice,偶数在前 | 0.64 | 0.36 |
| Noul,分别独立问是否奇数、是否偶数 | 0.52 | 0.52 |
换序没有让选择翻转。题设中的奇偶事件各有 0.5 的概率,Choice 返回的候选分布却持续偏向奇数。这里值得看的不是它最终选了哪一边,而是两边被分到了多少概率。
Noul 的两次输出都更接近 0.5,合计则为 1.04,而不是严格的 1。
官方已知局限中也记录了 Noul 与二选一 Choice 可能给出不同概率,并提醒不要直接跨接口沿用阈值。官方已知局限
理发师该不该给自己刮胡子?
最后换一道不靠知识、只看规则的题。镇上有位男性理发师,他也住在镇上,严格遵守两条规则:
- 不自己刮胡子的男性,他都帮忙刮。
- 自己刮胡子的男性,他一律不帮忙刮。
规则没有例外,也适用于他本人。问题来了:他给自己刮胡子吗?
先别急着选,分别试一下:
- 如果他自己刮,他就属于第二类,按规则不能给自己刮。
- 如果他不自己刮,他就属于第一类,按规则又必须给自己刮。
所以问题不是“到底选哪边”,而是根本不存在一个能同时遵守这两条规则的理发师。这就是理发师悖论。
| 提供的选项 | 选择结果 | 选中项概率 | confidence |
|---|---|---|---|
| 是/否 | 否 | 0.91 | 0.81 |
| 增加“规则矛盾”选项 | 规则自相矛盾,不存在这样的理发师 | 0.93 | 0.90 |
只让它选“是/否”,它给了“否”0.91 的概率;允许它指出规则矛盾后,它选择了这个答案。另用 Noul 问“上述规则在逻辑上是否允许这样的理发师存在”,肯定概率为 0.24,也偏向否定。
这次它并非始终没看懂。题目有问题时,接口有没有给它指出问题的空间,会影响我们最终拿到什么答案。 作者题是选项漏掉了正确答案;理发师题则是题设本身矛盾。两者都提醒使用者:结果能被程序接收,不代表问题已经被正确处理。
六、如果把“判断”做成一种通用能力
前面的例子能检查一些行为,却回答不了部署时更重要的问题:要分类邮件、判断用户意图,或者筛选搜索结果,它是否够用?
这些位置从来不是空着的。邮件分类器、用户意图模型、搜索重排模型,一直在解决各自的问题;也有像 GLiNER2 这样,把多种信息处理任务放进同一个模型的工作。判断能力并没有因为生成式模型走红而被放弃。
近期,其他开发者已经公开了一些测试,结果有好有坏。下面摘录的是他们报告的成绩,不是本文复测:
- 邮件分类:Jev 没有针对任务微调,准确率达到 98.64%,接近用标注邮件训练的 TF-IDF 逻辑回归的 98.87%。两者使用相同邮件证据;作者也说明,提示和方案调整参考过此前的标注错误。原始报告
- 搜索重排:在八个英文数据集上,按数据集等权汇总的 nDCG@10(衡量相关结果是否排在前面),Jev 为 0.692,Cohere Rerank 4 Pro 为 0.691。成绩接近,没有确立胜者;换成每条查询等权,Cohere 更高。原始报告
- 新闻与情绪分类:另一项每个任务取 100 条样本的测试中,Jev 在新闻分类上的准确率为 91%,GLiNER2.5 为 70%;到了情绪分类,两者只有 48% 和 44%,准确率差异尚不明确,Jev 的概率校准还更差。原始报告
这些局部结果不足以排出一个通用榜单,但能看出,Jev 并非只会回答趣味问题,也远没有在每类判断上都表现稳妥。
不过,Jev 不必在每个领域击败专用模型才有价值。如果无需针对每项任务额外训练,只换任务描述和判断标准,就能在多种任务上达到可用水平,这种通用性本身就有价值。
在现有 Agent 流程里,它可能承担的是快速、低成本的判断工作,例如路由、筛选和候选行动评价;语言模型则负责理解任务、组织候选与生成内容。这是一种分工方式,不要求它替代整个 Agent,也不要求它在每个领域超过专用模型。
回到我们自己的这轮测试:53 次请求平均耗时约 1.00 秒,中位数 0.98 秒;平均每次约 392 个输入 Token、32 个输出 Token。 返回内容确实简短。
最后,几个 Q&A
Jev 模型到底是什么?
可以确认的是,它提供选择、真假判断和有序评分接口,官方将其定位为 System One 模型。我们问出的底座、架构和训练细节仍是模型自述;现有资料和这些回答,不能确认它就是某个 Qwen 版本,也不能还原完整配方。
它宣传的“零幻觉”,应该怎么理解?
官方保证的是输出类型与结构匹配,不是判断永远正确,也不是概率与置信度天然可靠。我们问它能否保证不出现幻觉,两种形式的回答也都没有偏向肯定。类型安全有工程价值,但不能代替对判断与概率的验证。
它给出的概率,能直接拿来用吗?
可以作为判断信号,但概率形式不自带可靠性保证。选项怎么写、选哪个接口,都会影响这里看到的数字。真正要据此自动执行,需要在自己的数据上检查错误与概率的关系,而不是看见 0.9 就直接放行。
Jev 适合拿来做什么?
候选明确的分类、筛选、路由和按标准评分,是可以尝试的方向。例如业务系统提供真实部门及职责,语言模型协助整理邮件诉求,Jev 判断去向,代码负责权限和执行;这类判断也可以成为 Agent 的一个步骤,而不必承担整个 Agent 的工作。这是根据接口能力提出的用法,不是本文验证过的端到端效果。
能替代已经训练好的垂域模型吗?
具体业务要具体比较,现有测试不足以支持全面替代。但它不必处处拿第一:如果跨任务的效果够用,又能减少逐项训练与维护,这种通用性本身就有价值。
这是不是意味着它没有新的东西?
候选打分、生成与评价分工、减少重复编码,都不是从 Jev 才开始。它仍可能在训练、效率与工程实现上做出有价值的改进。值得检验的是这些改进,而不是仅凭“新一类模型”或“零幻觉”几个字,就把能力判断一并做完。
“会做判断”不是新鲜事,把判断做成足够通用、便宜、容易调用的能力,仍然是一件值得做的事。