一个”新范式”火了
最近几天,一个叫 Jev 的模型突然热了起来。
2026 年 9 月 15 日,TypeSafe AI 发布 Jev,并给它贴了一个很唬人的标签:System One Model——第一款”系统一模型”。
它的说法是:传统 LLM 负责慢速的语言生成与推理,而 Jev 负责快速、结构化、概率化的机器决策;它能在一次请求里并行回答多个结构化问题,延迟约 70–500 毫秒,在自家的 workflow 评测里号称最高达到 193.6 倍速度、444.6 倍成本优势。市场的反应也确实热:Vercel 说 Jev 上线 AI Gateway 后 24 小时内被接近 13% 的付费团队采用,是其历史上采用最快的新模型之一。
如果你过去两三年才开始关注 AI,看到这一串词——System One、Decision Intelligence、Calibrated AI、zero hallucinations——很容易有一种感觉:又要出新架构了,大概是 Transformer / Diffusion / State Space Model 那个级别的。
但我看完它目前公开的资料,第一反应只有一句话:
先把名字删掉,然后问它到底在算什么。
把营销词删掉之后
传统 LLM 的工作方式是自回归生成:
P(x_{t+1} | x_1, x_2, …, x_t)
给它一个 prompt,它一个 token 一个 token 地往外吐。要写 300 个 token,就得跑几百次解码。
Jev 不干这个。它接受一个 state、若干 question、若干 candidate,然后返回概率。写成机器学习的形式,它做的是:
(state, question, candidates) → P(candidate_i)
把这个式子里的 2026 年营销词全部划掉,剩下的是什么?
这是一次条件分类(conditional classification),说得更细一点,是 ranking / probabilistic decision。
而分类这件事,不是 2026 年发明的。
谱系:这里面几乎没有新东西
分类器:logistic regression、SVM、决策树、随机森林、AdaBoost / GBDT、贝叶斯分类器、神经分类器——1990 年代 SVM 就已经是机器学习的主流方法。今天有人跑来告诉你”我这个模型不写作文,只告诉你 A 的概率是 0.83、B 是 0.17″,一个学过传统 ML 的人不会惊呼”全新范式”,他的第一反应是:“好,这是个分类器。然后呢?”
概率校准:Jev 最响的概念之一是 calibrated probability,意思是”当它说 0.8 的时候,真的该有 80% 正确”。这确实重要——尤其在医疗、金融、自动驾驶和 agent 场景里,一个模型”知道自己什么时候不知道”,比 accuracy 多几个点重要得多。但这同样不是新问题:Platt scaling、isotonic regression、temperature scaling、Brier score、proper scoring rules、conformal prediction,全都有成熟历史。Guo 等人在 2017 年 ICML 的《On Calibration of Modern Neural Networks》里就系统讨论了深度网络的过度自信,并证明一个单参数的 temperature scaling 在很多数据集上就非常有效;conformal prediction 的理论来源还可以追到 1990 年代末。
就连”动态候选列表”也不新:2018–2019 年的 BERT 已经把 text → Transformer Encoder → representation → classification head 这条路走得很远;2019 年 Yin、Hay 和 Roth 已经系统研究了 zero-shot text classification,甚至直接把文本分类转化成自然语言推理(NLI)。这已经很接近 Jev 强调的 dynamic labels / zero-shot choices。
从学术谱系看,这条线非常清楚:分类 → 神经分类 → 预训练表示 → BERT + 分类头 → NLI → zero-shot 分类 → 动态候选打分。 Jev 不是凭空出现的。
最该戳破的一个词:zero hallucinations
这是我对它的营销语言意见最大的一处。官网直接写 “Zero Hallucinations”,发布文章甚至说 Jev “can’t hallucinate”。
但这里发生了一次概念替换。
假设输出空间被程序预先定义为 STOP / CONTINUE / VERIFY / ESCALATE 四个值,那 Jev 当然不会突然输出 BANANA,也不会吐出坏 JSON——因为它从系统设计上就没有这种输出自由度。所以:
P(type error) = 0
确实可以由架构或接口保证。TypeSafe 自己也承认:他们图上那个 0% 不是经验测量值,而是”schema matching 在系统层面被保证”,所以可以直接写 0%。
这没问题。问题是:type correctness ≠ epistemic correctness。
真实答案该是 STOP 时,Jev 完全可以给出 P(CONTINUE) = 0.93。这个输出的 schema 完全正确、datatype 完全正确、API 完全正确、概率也完全合法——但答案是错的。
所以我更愿意把它写成:zero out-of-schema generation(保证不产生落格输出),或者 guaranteed typed output。这是一项很有价值的系统属性。但如果读者把 “zero hallucinations” 理解成”模型不会产生错误判断”,那就完全错了。
> 一个模型可以从不产生非法字符串,同时天天做错误决策。
“System One” 这个名字,是极其聪明的营销
TypeSafe 自己说了:这个名字来自 Daniel Kahneman《思考,快与慢》里的 System 1 / System 2 之分。
这很聪明。因为你说 classifier,大家觉得是老技术;说 probability estimator,大家觉得是统计;说 discriminative model,大家觉得是机器学习 101。但你说 System One Model,立刻给人一种感觉:AI 终于从单一的 LLM 架构,进化出了类似人脑的双系统认知架构。
这就是语言的力量。而且要补一句:Kahneman 的 S1/S2 本身是一个隐喻、不是一套机制——拿一层隐喻去包另一层隐喻,是营销的平方。
技术命名与技术谱系,是两回事。
我的补刀:数学不新,不等于不是新东西
上面那一整套拆解都对。但我要在这位作者(以及所有”打假文”)的论证上补一刀,因为它有一个盲区。
范式转换从来不发生在数学原语(primitive)上,而发生在”整个行业把什么改道经过它”。
分类器是老的,这不假。但 Jev 真正的命题不是”我们发明了分类器”——而是:
> 一整类 agent 决策,不该再走 token 生成了。
过去几年,行业把太多问题强行塞进了语言生成里:需要分类?问 LLM。需要评分?问 LLM。判断 STOP 还是 CONTINUE?问 LLM。tool routing?问 LLM。验证?再叫一个 LLM。于是一个本来只需要 argmax_i P(a_i | x) 的问题,被改造成:
prompt → reasoning → 300 tokens → JSON → parser → decision
然后大家抱怨:贵、慢、不稳定、JSON 坏掉、tool call 乱掉、latency 高、agent 跑不了实时。
Jev 的意义,是把这条链路剪短。这不是”发明了新数学”,是”换了条路走”。而改道,是可以构成范式的——只是这个范式在系统层,不在模型层。
所以作者前半段为了打假,把”模型级架构”和”系统级范式”混着打了。有意思的是,他自己在后半段又把它认了回来:新方向可能不是更大的 LLM,而是智能开始重新分工——LLM 负责”想”,decision model 负责”选”,verifier 负责”查”,controller 负责”现在该继续想、继续做、验证、重规划还是停”。
还有两处,他砍得不够
第一,数字要问分母。 193.6 倍速度、444.6 倍成本优势——这是跨口径比较:拿一次前向的窄分类,去比多轮思维链的生成。这种倍率基本是”换个分母”的产物,漂亮,但不禁问。它和那些”我们的模型把成本降低了 100 倍”的说法同源——改变的是参照物,未必是能力。
第二,命名层面的自觉。 前面说过,S1/S2 是隐喻;用隐喻命名,再把命名当产品卖点,读者记住的是隐喻,不是机制。
真正值得记的一点
拆完之后,我反而更愿意给 Jev 记一笔正经的账:它提醒行业——不是所有智能问题都应该通过语言生成来解决。
这句话,我完全赞成。而且它和我们最近几条线是合流的:
- 执行轴 vs 状态轴:模型在”当前这一步该怎么做”上可以很稳,但在”我现在维持的是什么状态”上会整个塌掉。把判断收窄到一个可判定的窄接口,模型那部分执行力才靠得住——Jev 干的就是这件事:把开域生成,换成闭域打分。
- 判断力才是稀缺的:能生成一万个方向,不等于判断得了哪个有用。有验证器的地方,模型能自我迭代;没有验证器的地方,它只会把最像答案的东西填进空缺。 Jev 本质上是把”判断”改造成一个”可判定的窄接口”。
- 能用确定性代码解决的,就别交给 LLM:这是我们自己一直守着的一条规矩(论坛差分、判分器、凭据读取全部走确定性代码)。Jev 是这条规矩的产品化版本。
结束语
AI 行业快到一个两年前入门的人都敢被叫”资深专家”。但技术发展快,不代表技术历史可以被删除。
当下一个公司告诉你”我们发明了全新的 AI 范式”,先别看它给这个范式起了什么名字。
把名字删掉,把 marketing slide 删掉,把 “revolutionary / frontier / System One / AGI” 这些词全部删掉。然后只留下三样东西:
Input / Computation / Output。
再问一句:这个函数,到底在算什么?
很多时候你会发现:所谓未来,有一部分其实是二十年前就认识的老朋友。而真正的创新,往往藏在营销语言下面那些更不起眼、也更难的地方。
参考与延伸:
- 《AI 能生成一万个方向,但判断不了哪个有用》——可判定性,是 AI 替代的边界
- 《定力不在模型里,在壳里》
说明:本文对 Jev 的判断基于其公开资料与已公开的第三方分析;笔者未独立复现其底层网络,文中数字与事实以官方口径为准。