有个模型,不写字、不聊天,只会"拿主意"

——Jev 到底是个什么东西,以及它戳中了谁的痛处


列位,今天这事,得从一个人说起。

他叫 Diogo Almeida。这个名字你未必熟,但他干过的活儿你一定用过——他在 OpenAI 参与了 RLHF 和 InstructGPT 的核心研究,说白了,就是让语言模型学会“听话”的那套方法。你后来用的 ChatGPT,根子上就是他这拨人打下的。

功成名就之后,他没接着干,反而把自己关了起来,问了一个让整个行业都脸上无光的问题:

聊天模型早就比人强了,AGI,它怎么还没来?

他的答案很扎心:方向可能一开始就跑偏了。RLHF 让模型学会了讨好人类,也顺手种下了三样病根——过度自信、模式坍缩、张嘴就来。这三样东西,在聊天里你能忍,可要是塞进一个自动跑的系统里,那就是事故。

于是,他隐身了整整两年。九月十五号,他的公司 TypeSafe AI 端出来一个东西,起名 Jev。

这个模型怪得很。不写代码,不聊天,不生成一个字。它就干三件事:选哪个,打几分,是不是。然后附上一句:我有多大把握。

他自己把话说得很满——快二十到两百倍,便宜四十到四百倍,输出 token 不要钱。他管这叫“AI 经济革命最短的那条路”。

结果,四十八小时,这条推文六万多个赞,社区里冒出来十四个开源项目。有人拿它操控浏览器,有人让它开火箭落地,Vercel 干脆把它焊进了自己的框架。

那么,它到底是什么?

一、它不是大模型,它是一个“超级分类器”

你可以这么理解:它是一个能读懂人话的判断器。

你把一段乱七八糟的文本、或者一段程序状态丢给它。它返回来的不是一篇文章,而是一个下了定型的决定,外加一个概率。比如你问它:“这个工单紧急吗?“它回你:是,0.92;否,0.08。

它只有三招。

第一招,叫 Noul,就是“是不是”。这件事到底成不成立,给我一个概率。

第二招,叫 Choice,就是“选哪个”。我给你一组选项,最多两百五十五个,你选一个,顺便把每个选项的概率都给我。

第三招,叫 Score,就是“打几分”。我定好一到五级,你告诉我这个东西落在哪一档。

注意,这三招可以混在一次请求里一起问,几十个问题同时答,加问题几乎不增加时间。

最关键的一点在这里:它的输出空间,在你写接口的那一刻就已经锁死了。 所以从数学上,它永远不可能吐出一个类型错误。它不会给你一段不知道从哪冒出来的 JSON,也不会一高兴把 billing 写成 bililng。

二、它为什么这么快

这里得说技术,但我说人话。

过去我们让大模型输出结构化数据,是什么流程?它一个 token、一个 token 往下蹦,像人一个字一个字手写,写完了程序再回头去解析。你想让它吐出一个小 JSON,它可能得在心里顺序推理一百五十到五百次。慢就算了,偶尔还写错,写出个程序解不开的东西。

Jev 的路子完全不一样。它把上下文和输出格式一次性读完,然后在内部给每一个字段开一条并行的分支,几条分支同时开工,各自只看自己那几个候选词的概率,归一化,取最高的。

打个比方:大模型是在那儿一个字一个字地念稿子,Jev 是把卷子摊开,所有题目一起做,做完把答题卡一拍。

这就把“生成问题”变成了“并行分类问题”。

社区里有人用一个小模型照着复现,二十八个字段的企业工单分类,原来的基线一千九百毫秒,改成并行之后两百七十毫秒,快了七倍,格式百分之百合规。

他自己还开了句玩笑:人家隐身开发两年,我隐身开发两小时。

三、真正值钱的不是技巧,是“校准”

必须说清楚:并行解码这个技巧,跟模型架构没关系,任何开源模型改改推理引擎都能做。

Jev 真正掏钱的地方,是它的训练方法,叫 RLCD——为“校准”而做的强化学习。

这句话是什么意思?意思是它输出的那个概率,跟它实际答对的比率是对得上的。它说九成把握,那就是九成;它说五成把握,你就该知道,该叫人来了。

你回头看 RLHF,优化的是“人喜不喜欢”;后来的 RLVR,优化的是“能不能被程序验出来”。而这个 RLCD,优化的是“它到底知不知道自己在说什么”。

Almeida 有句话被反复转:生成式 AI 火起来之前,模型校准本来就是机器学习的基本功——一个不校准的模型,凭什么放进生产系统里?

四、账要算清楚:这个价格是真的狠

输入 token,每一百万个零点零四二美元。输出,免费。

他说这不是补贴,长期只会更便宜。理由也简单——它根本不往外生成 token。

延迟,七十到五百毫秒。

他在推特上问了一句:为什么现在的 SaaS,做得还跟 2019 年一个样?他自己的答案是:卡在延迟上。现在延迟掉了两个数量级,AI 终于可以进到代码的内循环里了。

官方放出来的 demo 里,有两个最有意思。

一个是《毁灭战士》。Jev 每秒做十次判断,一边判断要不要开火,一边判断当前最该解决什么,一边决定往哪边闪。所有判断大约一百毫秒内并行完成。代价呢?每小时七美元。

另一个是维基竞速。从一个词条,一路点链接,跳到目标词条。每一步面对的是成百上千个链接。它跟那几个顶尖模型同台比,更快,步数更少——因为候选一多,会不会胡编,就滚起雪球来了。

社区里还有更离谱的。有人用 MuJoCo 搭了一枚猎鹰级火箭,四十二米高,四百二十五吨,九台发动机,真实大气、真实阻力、真实风速。全程没有预设轨迹,没有安全否决脚本,Jev 从发射管到着陆。十二次实验,助推器稳稳落地,两百四十五次调用,花了四毛钱。

五、但是,先别急着鼓掌

一篇文章只夸,那是软文。这套东西,业内的质疑同样集中,我一条条给你摆。

第一,“不会幻觉”这四个字,是文字游戏。 它保证的是结构不出错,不保证判断不出错。你问它是不是退款申请,它能自信地说“是”;类型没错,答案是错的。类型安全,不等于事实正确。

第二,它没发任何公开 benchmark。 官方那套“工作流评测”,是拿最贵的几个模型的平均输出当参考答案。也就是说,衡量的不是“对不对”,而是“你有多像那几个大模型”。

第三,架构没公开。 不少工程师看完就说,这不就是编码器加判别头、并行约束解码嘛,跟当年 BERT 那一脉的零样本分类器没有本质区别。有人直接甩了句难听的:一千两百万播放,就为了一个 JSON 分类器?

第四,有人真的去测了。 一个做分类系统的人拿德州扑克上手,用求解器当标准答案。三十个牌局,Jev 跟求解器的一致率是六成三。其中一个明摆着的陷阱局——手里是场上最大的牌,正确打法是过牌,让对手继续下注——它十六次里十六次全下。全错。

所以正确的说法是:能力是真的,宣传是打了折的。

六、那它到底该怎么理解

别管那些 System One、RLCD 的名词。你只要抓住一个比喻:

大模型,是你请来做内容的人。它能写文章、能写代码、能陪你聊,但它每说一句话,你都得替它把着关。

Jev,是代码里的 if 语句。它本来只是个干巴巴的分支判断,现在它长了脑子,能读懂人话,还知道自己有多确定。而且便宜到你可以在每一个请求上都问它一遍。

过去我们把决策和生成搅在一起——让一个擅长写文章的工具,硬去吐一个 JSON,告诉你下一步该干嘛。Jev 干的事,就是把这俩掰开。

它自己在官网 FAQ 里也承认得很坦率:这不是小号的大模型,是新的架构、新的采样器、新的训练方法;目标不是刷分,是造一个软件敢依赖的接口。

七、对做 Agent 的人来说,意味着什么

这一条,是今天最实用的信息。

现在你手上的 Agent,几乎都在犯同一个毛病:把“判断”塞进 prompt 里,让大模型用自然语言告诉我该选哪个,然后我再解析。又贵,又慢,又脆。

Jev 这一类东西,正好补在决策层。

它可以干的活,我列一下,你对着自己的系统看:

第一,工具门禁。 Agent 要执行一个删文件的命令之前,先问它一句:这动作是不是破坏性的?是不是要把本机数据往外传?是不是超出了用户说的范围?它给你概率,你的代码拿阈值一卡。这就是“给 Agent 装了个刹车”。

第二,模型路由。 每一轮先问一次:这个任务难不难?简单就交给便宜模型,难就上贵的。已经有开源项目做了,token 用量直接降四成到六成。

第三,检索重排。 搜索回来的结果,谁跟问题最相关?问它。它比 embedding 更准,比大模型便宜两个数量级。

第四,上下文回收。 工具输出太长,先让它判断哪几段跟当前任务有关,没用的直接扔,省下来的全是钱。

第五,护栏与审核。 进来的 prompt 是不是越狱,出去的内容有没有违规,引用是不是编的——每一次都是几百毫秒、几分钱的事。

第六,实时控制。 游戏、仿真、机器人、无人机,凡是要求一百毫秒内做决定的地方,这东西天生合适。社区已经有人在做小马里奥和摄像头无人机了。

八、最后说一句

如果你是做 Agent 的,这周就可以动手。它已经上了 Vercel 的 AI Gateway,模型 ID 是 typesafe-ai/jev,不用排队;官方也给了 Claude Code 和 Codex 能直接装的技能包;社区里甚至有人给 Pi 这类编码 Agent 写好了插件,第一步先用“影子模式”跑一周,看它到底拦住了什么。

但有两句丑话得说在前头。

一是它不是替换,是补位。要写文案、写代码、做复杂推理,还得靠大模型。Jev 管的是“要不要、选哪个、打几分、下一步干什么”。

二是中文别急着上生产。官方文档写得很明白,英文是主战场,中文这类文字“能处理,但没到同等水平”,自己拿真实数据测过再说。

Almeida 拿 Jevons 悖论给模型命名——蒸汽机效率一提高,煤炭总消耗反而暴涨,因为便宜的能源解锁了更多的用途。

他的赌注是这个:判断的调用量,早晚会远远超过生成的调用量。

这个判断,可能对,也可能错。但有一件事已经很清楚了——

AI 的上半场,比谁更像人;下半场,比谁更像个零件——你关掉屏幕,它照样替你把事办对。


资料来源

官方原始发布

第三方与质疑来源

社区复现与集成

本文数据与引语均来自以上公开来源,截至 2026 年 9 月 18 日。Jev 仍在早期访问阶段,价格、限流与能力可能随时变动。