关于 Jev、System One 和确定性小模型

9 月 15 日,一家叫 TypeSafe AI 的公司放出了一个叫 Jev 的模型。创始人 Diogo Almeida 的履历有点唬人:在 OpenAI 做过让语言模型学会听人话的那套方法,也就是 ChatGPT 背后的研究。之后 stealth 两年,交出来的东西不是更大的 LLM,而是一个 不会说话的模型

这件事值得单独拿出来讲,不是因为它多新——底下的技术其实相当传统——而是因为它把一个大家嘴上说了很久但没人认真做产品的方向,第一次做成了一条完整的商业叙事。以及顺带把「软件是什么」这个问题重新翻了一遍。

一、Jev 到底是个什么东西

一句话: 它是一个函数调用,只不过里面装了前沿智能

输入是乱七八糟的非结构化状态,输出是带概率的、类型安全的结构化决策。没有字符串,没有 token 流,没有 markdown,没有「好的!让我来帮您分析一下」。

官方的对比表拉得很直白:

现有 LLMJev / System One
训练目标人类偏好(RLHF)/ 可验证奖励(RLVR)校准决策(RLCD)
输出字符串。什么都能是,包括幻觉和拒答预先声明的结构化值
采样串行,一个 token 接一个 token并行,一次 query 出全部答案
延迟端到端 3 秒 ~ 329 秒端到端 70ms ~ 500ms
输入价格$0.20 ~ $10 / MTok$0.042 / MTok
输出价格约为输入的 5 倍免费(“too cheap to meter”)
置信度问它也不准,而且不稳定每个输出都带校准概率

RLCD 是 Reinforcement Learning for Calibrated Decisions。核心思路不复杂:如果真实答案是 no,那么模型给出 {yes: 0.9} 要被狠狠罚,给出 {yes: 0.6} 只轻轻罚。训出来的结果是 概率本身可信 ——说 85% 的时候,就真的对 85%。

这一点比「快」重要得多。一个 95% 准确率的模型如果不告诉你哪 5% 是它蒙的,你就没法拿它做自动化,只能配个人在旁边看着。而一旦概率可信,「置信度 0.9 以上直接走,0.6 到 0.9 转人工,0.6 以下拒绝」这种代码就能写了。这是从 copilot 到 automation 的那道门槛。

模型名字来自 William Stanley Jevons——那个发现「蒸汽机效率提高反而让煤炭消耗暴增」的经济学家。TypeSafe 的赌注写在名字里了:智能每便宜一个数量级,用得起它的场景就多几个数量级。

至于「System One」,出处是卡尼曼的快思考与慢思考。快,直觉,不需要推理链。

二、Needle:同一件事的另一条路

差不多同一时间,YC 投的 Cactus Compute 放出了 Needle 3。路线完全不同,指向的地方却出奇一致。

Needle 3 是端侧模型。整个模型是 一个 8 到 29 MB 的二进制文件 ,29M 到 121M 参数,2-bit 量化,在树莓派 5 上 decode 能跑到 4k tokens/s。它只干三件事:调工具、按 schema 抽结构化字段、出 embedding。解码语法保证输出一定能 parse。

最有意思的设计叫 intelligence laddering——一套权重,从 2 层到 20 层,每一个深度都是一个能独立工作的模型。开发者按设备算力挑一档。手表用 4 层,车机用 20 层,同一份权重。官方说 4 层在下游任务上微调一个 epoch 就能追上 DeepSeek V4 Flash。

它的落地场景很实在:Pebble 那个没有屏幕的 Index Ring 就跑着 Needle。创始人 Eric Migicovsky 的说法是—— 没有屏幕,所以你说话之后,事情就必须发生,不管有没有网

这句话是整篇文章的题眼。

Jev 走云端、走前沿智能、走 150ms;Needle 走端侧、走 8MB、走完全离线。两条路的共同点是: 都放弃了生成文本,换来了确定性和速度

三、带智商的高速 if-else

理解这类模型最省事的方式,是把它放在延迟尺上看一眼:

1ms        10ms       100ms      1s         10s        100s
  |----------|----------|----------|----------|----------|
 手写                  ▲    ▲                ▲          ▲
if-else            Needle  Jev            LLM        推理
                  (端侧)  (150ms)      (首 token)    LLM
                            ▲
                      人类反应速度 (~200ms)

一边是纳秒级、完全确定、但只懂你亲手写进去的那几条规则的 if-else。另一边是有世界知识、能理解语义、但慢两三个数量级还会瞎编的 LLM。中间这一段以前是空的。

Jev 和 Needle 干的事,就是把这一段填上。所以「带智商的高速 if-else」这个说法虽然糙,但相当准确。它们不打算取代 LLM——它们取代的是 那些你本来要手写、但怎么写都很脆的判断分支

三个维度上的差别:

速度。 3 秒和 150ms 的区别,不是「快了 20 倍」这么简单。它是「能不能放进循环里」的区别。放进请求主链路、放进每帧渲染、放进控制回路——这些地方 3 秒是不能接受的,不是慢,是 根本用不了

确定性。 这里有两层。一层是类型安全:输出的形状事先声明,模型不可能给你返回一个多余的字段或者错误的枚举值。TypeSafe 说这一点「数学上不可能出错」,因为它压根不生成字符串。另一层是 LLM 那种「今天这么答明天那么答」的抖动,在校准过的概率输出里会小很多。

成本。 输入 $0.042/MTok,输出免费。这个价格意味着一件以前不敢想的事: 你可以在每一次调用上都跑一遍它 。每个 LLM 的输入和输出都过一遍语义检查,每条日志都打个标,每个 PR 都做一遍语义 lint。以前这些方案第一轮就被成本砍掉了。

四、为什么 Showcase 全是打游戏和操作电脑

TypeSafe 的两个招牌 demo 是玩 Doom(每秒 10 次 query,约 $7/小时)和 Wikiracing。Cactus 的 demo 是智能家居、机器人、AR 眼镜、车机。openjev 那个社区复现,两段视频都是 Doom。

这个集中度不是巧合。 这些恰好是 LLM 做不好、但价值高、而且特别容易传播的地方

  • LLM 做不好 :不是不够聪明,是太慢。Doom 每 4 个 tic 要出一个决策,预算 114ms。一个推理模型光首 token 就超预算了。这是硬约束,堆参数解决不了。
  • 价值高 :实时决策和 Computer Use 都是明摆着能变成产品的东西。
  • 传播度高 :「模型在玩 Doom」这条推,转发量是「模型在给保险理赔分流」的一百倍。

顺手说一句,TypeSafe 自己在 nuance 里很老实地承认了: 非 AI 的 Doom bot 能打得更好 。他们要展示的不是打得好,是「能按自然语言指令实时反应」。这个自我披露的程度,在当下的发布稿里算难得。

不过 Showcase 是 Showcase。真正掀桌子的地方在别处。

五、两个更掀桌子的想象空间

5.1 传统决策系统

翻一遍 TypeSafe 的 use case map,会发现列出来的东西一点都不 sexy:保险理赔分流、反洗钱告警排序、合同缺失条款检测、电商禁售品识别、内容审核、简历筛选、线索评分、工单路由、需求预测特征抽取。

熟悉吗?这些 每一个背后都是一套跑了十年的 Java 系统 。几十万行规则引擎、策略配置、决策树、评分卡,还有一层又一层的兜底逻辑。

这里有个不太舒服的类比: 写这类 Java 代码,某种程度上就是在手写权重

if (amount > 50000 && isNewDevice && !hasHistory) score += 30; —— 这个 30 是哪来的?是某位工程师和某位风控专家在会议室里吵出来的。它是一个权重。一个由人拍出来的、写死在代码里的、改一次要走一整套发布流程的权重。

一套成熟的决策系统里有几千个这样的数字。它们的总和,就是一个人工梯度下降了十年的模型。只不过学习率是「季度需求评审」,参数量是「if 语句的条数」。

以前用模型替代这套东西不现实,理由很硬:慢、贵、不确定、输出没法直接进代码、出错了不知道是哪一步错的。现在这四条正在被逐个拆掉。 模型对一个 Java 系统的替代,第一次显得可行。

这不是说明天就要把风控系统删了重训。这类系统的护城河不只是逻辑,还有审计、合规、可解释、可回滚。但「模型输出带校准概率」这一条,恰好正面回应了其中最要命的那个诉求—— 可审计的不确定性 。规则引擎能告诉你「命中了第 4712 条规则」,但它没法告诉你「这条规则在这个 case 上有多可能是对的」。

5.2 具身智能

人的简单视觉反应大约 200ms 左右。一个能在 150ms 内做出决策的模型,意味着机器人第一次可以 在人类反应速度的量级上 做语义决策。

具身智能这两年最尴尬的地方就在这儿:抓取、行走这些低层控制早就有专门的策略网络了,跑得飞快。但一旦要理解「打扫厨房但别进卧室」这种带语义的指令,就得叫云端 LLM,然后卡三秒。三秒之后,环境已经变了。

Needle 的定位就是打这个缝。8MB,离线,树莓派能跑。「打扫厨房但别进卧室」被就地翻译成一串动作调用,不出设备。

所以那个泡泡有可能被戳实: 具身智能缺的不一定是更强的大脑,而是一个够快的小脑

六、软件开发的第三次换代

把时间线拉长看,判断和决策这件事,在软件里换过位置。

第一代    需求  →  人写代码  →  代码做决策
                    ↑
              判断逻辑在人脑里,然后被翻译成 if-else

第二代    需求  →  LLM 生成代码  →  代码做决策
                    ↑
              判断逻辑还在代码里,只是写代码的换了人(模型)

第三代    需求  →  数据 + 训练  →  权重做决策
                    ↑
              判断逻辑不再是代码。它是一堆浮点数。

第二代就是这两年大家刚学会的 Agentic Coding。它很有用,但它没有改变软件的形状——决策还是发生在 if 语句里,只是那条 if 是 Claude 帮你写的。

第三代不一样。它把判断这件事,从代码里搬到了权重里。

把同一个问题丢给两种工程师,会得到两个完全不同的方案。

丢给 Java 开发:先梳理领域模型,划分模块边界,定义状态机,然后 1-2-3 地实现主流程,接着开始处理 corner case——空值、超时、并发、幂等、脏数据、上游抽风。最后写 200 个单元测试。整个过程严谨、可控、可 review,而且 只覆盖他想到的那些情况

丢给算法工程师:先想办法搞 2000 条 golden data,标注一致性拉一下,然后找个 0.2B 的底座去拟合这个目标逻辑。剩下的时间在做 error analysis 和补数据。整个过程模糊、需要评测集兜底、review 不了,但它 有可能拟合到需求文档里没写出来的那部分

后一句是关键。需求文档永远写不全。人的判断里有大量说不清的部分——什么样的工单算「语气很急」,什么样的商品标题算「疑似仿品」,什么样的代码改动算「不符合团队风格」。这些东西写成规则永远是错的,标成数据反而挺好使。

现在看起来,后者有可能真会成为软件开发的通解。

好耶。大家刚学会 Agentic Coding,技能需求版本就又更新了。

七、顺便说说能力洗牌

如果这条路真走通了,系统工程师的能力栈会被重排一遍。

会贬值的 :把业务逻辑翻译成分支结构的能力、穷举 corner case 的能力、维护规则引擎和策略配置的能力。这些今天是很值钱的手艺,而且是很多人职业生涯的立身之本。

会升值的 :定义问题边界的能力(决策该拆成哪些独立的问句,这活儿一点不比设计接口简单)、构造和治理评测集的能力、判断「这里该用规则还是该用权重」的品味、以及在概率输出上设计降级和兜底的能力。

有意思的是,最后一条其实是老 SRE 的技能—— 它跟处理不可靠的下游依赖是同一件事 。只不过以前不可靠的是网络,现在不可靠的是判断本身。

有个还算安慰的观察: 能力洗牌的方向,是从「实现」往「定义」走 。这跟 Agentic Coding 带来的迁移方向是一致的,不算是掉头。所以刚学会的那套没白学,只是还要再往上走一层。

八、然后,也有很多人觉得调子起太高了

以上都是想象空间。接下来说幻觉的部分。

HN 上那条讨论 400 多楼,质疑集中在几处,而且都挺锋利:

「这就是个 encoder」 。有人指出这看起来就是一个 Transformer encoder,在分类和回归任务上做了后训练。Encoder-only 这几年确实没人提了,但它一直在那儿。也就是说,架构上未必有传说中那么大的突破。

「RLCD 不是新东西」 。校准 RL(calibrated RL)是已有的东西,TypeSafe 的贡献更可能是「在 LLM 底座上把它调通并做成了产品」,而不是「发明了一种新范式」。这是很不一样的两件事。

「不生成文本所以不幻觉,这话太便宜」 。有人直接点出来:这个论断是 trivially satisfied 的。它不会编造一句不存在的话,但它完全可以在分布外的输入上给出 错得离谱而且很自信 的概率。类型安全 ≠ 语义正确。这两个东西被发布稿有意地混在一起讲了。

「不跑公开 benchmark 很可疑」 。TypeSafe 自己造了一套 workflow eval,参考答案是 GPT-6 Astra 和 Fable 5.1 的平均。这套评测的问题在于:workflow 是他们自己团队的人写的,参考答案是别人家模型的输出而不是 ground truth。他们在 nuance 里承认了这两点。但 FAQ 里对「公开 benchmark 表现如何」这个问题的回避,还是让不少人不舒服。

「已经有平替了」 。有人直接甩了个链接: MoritzLaurer/deberta-v3-large-zeroshot ,评论是「他们博客里那个对 LLM 的比较肯定有猫腻」。

平心而论,TypeSafe 的 nuance 章节写得比行业平均水平诚实得多——延迟是在西海岸的笔记本上测的、demo 的输入故意选短了、Doom 用的是结构化状态不是图像、Wikiracing 里 LLM 关掉了推理模式。这些自我披露都写在正文里。但一个发布同时做到「自我披露诚实」和「首页写 193.6x faster / 444.6x cheaper」,读者需要自己校准。

九、社区已经糊出来了:怎么复现一个 openjev

最有说服力的质疑不是评论,是有人直接把东西做出来了。

AlexWortega/openjev ,MIT 协议,HuggingFace 上能下。 Qwen3.5-4B + 一轮强力后训练,然后零样本玩 Doom ——文本状态玩得动,直接读像素也玩得动。

它的原理简单到有点冒犯:

把 Qwen 训成一个三分类的 NLI cross-encoder。输入一个前提(premise)和一个假设(hypothesis),输出 contradiction / entailment / neutral 三个概率。

就这一个原语。够用来做 rerank、做打分、做内容审核、做实时决策。想让它动作,就把游戏状态当 premise,把若干条陈述当 hypothesis, entailment 概率最高的那条对应的动作就是它的操作

复现步骤

训练 。就是一个 sequence classification 头:

python train.py --model Qwen/Qwen3.5-4B --out ckpt/qwen3.5-4b-nli \
  --n-train 120000 --grad-ckpt

底座换成 Qwen3_5ForSequenceClassification ,3 个标签,last-token pooling,输入模板就是 "Premise: {p}\nHypothesis: {h}" ,损失是最朴素的三分类交叉熵。数据用 SNLI / MNLI(注意原始标签顺序是 0 ent, 1 neu, 2 con ,要 remap)。

耗时很友好:0.8B 在单卡 A6000 上约 30 分钟,4B 在 RTX Pro 6000 上约 70 分钟。装一下 flash-linear-attention 走 fused 路径,4B 的单次决策从 138ms 降到 50ms 左右——这一步是能不能实时的分水岭。

让它玩游戏 。这里有一个反直觉的关键 trick,作者写得很直白:

hypothesis 要写成「关于状态的陈述」,不能写成「动作名」。

The correct action is: flap → Flappy Bird 得分 0The offset relative to the gap centre is negative / positive28/28

同一个模型,同一个权重,换个问法从完全不会玩变成满分。因为 NLI 模型学到的是「这句话在这个前提下成不成立」,而不是「该按哪个键」。你得把控制问题 翻译成一个事实判断问题 ,它才接得住。

这个 trick 大概是整个项目最值钱的一句话,也是「确定性小模型」这条路上真正的工程难点所在——不在训练,在 怎么把你的问题拆成一串独立的、可判真假的问句

Doom 那边同理:每 4 个 tic 一次决策,预算 114ms,4B 的文本决策约 57ms,塞得进去。文本状态从 labels buffer 里取,记得只保留真怪物,不然它会对着血迹开枪。

从像素玩 。走 Qwen 的 vision tower,320x240 的帧变成 80 个 image token 塞进 premise。有个坑值得单独记一下: bf16 的 cuDNN patch-embed Conv3d 在 Blackwell 上一帧要 2 秒,换成 fp32 只要 0.3ms 。差了六千倍,纯粹是踩坑。

结果要怎么读

这里必须说清楚,不然就成了另一种夸大。

好的部分 :MNLI 0.904,和专门的 ModernCE-large-nli(0.909)基本平手。给了参考答案做 grading 时,准确率 0.94-0.99。Flappy Bird 28/28。Doom 文本 11 kills(oracle 是 18.8)。Doom 读像素 5.2 kills(随机是 1.0)。

不好的部分 :不给参考答案纯做 rerank 的话,ARC-Easy 0.77,ARC-Challenge 0.59,MMLU 0.47, GPQA 基本等于瞎猜 。4B 以下加 few-shot 完全不涨。

也就是说: 这个东西在「有明确判据的判断题」上很能打,在「需要真实世界知识和推理」上远不如前沿模型 。这条边界,恐怕 Jev 自己也逃不掉——毕竟 TypeSafe 也不肯跑公开 benchmark。

还有一个诚实的细节,作者自己在文档里写了:那张对比 Jev / Terra / openjev 的雷达图, Jev 和 Terra 的数值是从 TypeSafe 的图表上目测出来硬编码进去的 。所以那张图别当证据看。

十、所以

三件事可以分开下判断:

技术上 ,没什么魔法。encoder + 校准后训练 + 并行采样,每一块都有前史。社区用 4B 底座糊一下,就能在游戏这个 showcase 上打出可比的效果——这既说明门槛不高,也说明方向大概是真的。

产品上 ,TypeSafe 做对了一件重要的事: 他们把「模型」重新定义成了「一个函数」 。类型安全、带概率、可组合、便宜到可以随便调。这个接口形态比模型本身值钱。谁能把这个接口做成事实标准,谁就拿走了「AI 进入普通软件」这一层的位置。

认知上 ,值得认真对待的不是那个 193.6x,而是那句话: 判断逻辑可以不再是代码

这个想象空间是真的大。它意味着大量今天靠人肉手写权重维持的系统,有了一个不一样的实现路径。也意味着「工程师」这个词的重心,会再往「定义问题和治理数据」挪一格。

至于它是想象空间还是幻觉——按目前的证据, 在有明确判据、高频调用、延迟敏感的判断上是想象空间;在需要真实世界知识和多步推理的地方是幻觉 。这条线画在哪里,比争论 Jev 到底有没有吹牛重要得多。

好消息是,这次不用等大厂发论文。权重在 HuggingFace 上,MIT 协议,一张卡跑一小时。谁想知道这条路能走多远,自己训一个就行了。


参考

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐