前OpenAI研究员造「闭嘴」AI:提速200倍成本1/400

曾深度参与ChatGPT类模型研发的前行业资深研究员,如今推出了一款不再“多嘴”的AI模型Jev。这款由专业团队推出的首款System One Model,彻底放弃了自由文本生成,却在效率和成本上带来了颠覆性的提升。
这款模型的核心开发者,是2022年InstructGPT论文的共同作者之一,也曾参与过早期的强化学习与大模型相关工作,可以说是当前主流聊天式大模型训练路线的早期亲历者。但在离开原有团队后,他开始对这条路线产生了质疑:大模型擅长聊天的能力,真的是软件自动化场景中的核心需求吗?
经过四年的思考,开发者给出了自己的答案:AI或许根本不需要如此擅长“聊天”。Jev的核心设计思路,就是砍掉了自由文本生成的环节,直接面向自动化工作流提供结构化的判断结果。
根据官方公布的数据,Jev能带来20到200倍的速度提升,成本最高可降至原有方案的1/400,甚至输出Token都无需额外付费。在内部的工作流测试中,它最高实现了193.6倍的速度优势和444.6倍的成本节约。
举个简单的例子,当需要处理一封用户邮件时,我们通常会关心三个问题:这是否是投诉?问题是否紧急?应该转接至哪个部门?传统的大模型会先阅读邮件,再生成一段自然语言的回答,之后程序还需要从这段回答中提取需要的字段,再进行后续处理。而Jev则直接跳过了中间的生成环节,用户提前定义好需要的结果类型,模型读取输入后,会直接给出带有明确类型的结构化判断,以及每个判断对应的概率和置信度。
更关键的是,Jev的判断结果可以并行生成。传统的大模型采用自回归的生成方式,每一个Token的生成都依赖于前面的内容,因此需要逐步输出结果。但Jev的目标并非生成一整段自然语言,因此不需要逐步“撰写”答案,而是通过并行计算的方式同时完成多个判断,大幅提升了响应速度。
官方表示,Jev的端到端响应时间可以做到70到500毫秒,输入Token的价格为每百万0.042美元,输出目前完全免费。第三方的实测也验证了这一优势:比如某评测负责人用Jev处理37篇文档,完成777次独立判断仅耗时不到0.7秒;在一项写作质量判断任务中,Jev仅用0.35秒,而另一款模型则需要8.83秒,速度提升约25倍,成本降低约580倍。
从传统训练思路到定制化训练:面向自动化的新路径
Jev背后的训练方法同样值得关注,团队将其命名为RLCD,即面向校准决策的强化学习,这个名字本身就是对传统RLHF的反思。
传统的RLHF通过人类评价多个答案,训练模型生成更符合人类偏好的结果,这让原本只预测下一个Token的语言模型,逐渐学会遵循指令、生成自然的聊天内容。但开发者认为,当模型需要嵌入软件系统时,“人类的偏好”未必是最重要的训练目标。
在每天自动执行数百万次的工作流中,真正重要的问题只有两个:答案是什么?这个答案的可信度有多高?因此RLCD将“校准”放在了核心位置:如果模型对一类判断给出90%的置信度,那么这些判断的实际正确率应该接近90%。基于这样的校准结果,软件系统可以形成清晰的逻辑分支:
- 置信度超过95%时直接执行
- 70%左右时交给更强的模型进一步判断
- 低于40%时则直接转交给人工处理
这样的设计让AI更像是可以嵌入程序的“模糊if语句”,也就是团队所说的“可组合智能”:智能不必每次都以一整段自然语言的形式出现,而是可以成为软件内部随时可以调用的一项能力。
“零幻觉”的真正含义
团队甚至打出了更激进的宣传口号:Jev“不会产生幻觉”。但这里的“幻觉”和我们通常理解的并不相同。
我们常说的大模型幻觉,指的是模型一本正经地编造不存在的人名、论文或事实。但Jev所规避的,是另一种问题:模型生成了程序无法定义、也无法处理的输出。
比如让AI判断一封邮件属于“投诉”“退款”还是“咨询”,传统的大模型即使被要求按照固定格式回答,本质上还是在生成字符串,它可能会突然输出一个不在预设选项中的类别,或者额外生成一大段解释。对于人类来说,这只是增加了阅读和理解的难度,但对于自动化系统来说,下游程序根本无法处理这种超出预设的输出。
Jev从源头上杜绝了这种情况。它不会自由生成字符串,所有可能的输出及其类型都提前被定义好了。如果程序只允许三个预设选项,那么Jev只能从这些选项中选择,不会临时创造出新的类别。这就是团队所说的“类型安全”。
官方甚至明确说明,Jev的“0%幻觉”并非通过大量测试统计得到的经验数据,而是因为输出匹配本身就被保证了,因此直接将这一比例记为0%。
当然,如果回到我们通常理解的幻觉定义,Jev也并非完全无关。大模型产生幻觉的一个重要原因,是其最初的训练目标只是预测下一个词,训练数据中并没有额外的“真假”标签。对于大量低频、模糊或模型未知的信息,模型仍然可以根据语言规律生成看似正确的答案。更麻烦的是,后续的训练和评测往往会奖励“给出明确答案”的行为:如果答错和回答“不知道”都无法得分,那么模型会更倾向于在不确定时继续给出答案,而不是暴露自己的不确定性。
Jev则希望保留模型的“不确定性”。它不会只输出一个最终的选择,而是强调“带类型的概率决策”:将结构化的答案连同对应的概率一起交给程序。RLCD训练的正是这种校准后的决策,让模型给出的概率尽可能真实地反映自己的把握程度。
比如同样面对三个预设选项,程序拿到的不再只是单一的结果,而是每个选项对应的概率分布。如果最高概率只有45%,自动化系统就不需要强行执行,可以将任务升级给更强的模型,或者直接转交给人工处理。
这并不会让Jev彻底不再犯错,但至少会让系统清楚地知道什么时候更可能出现错误。类型安全保证了“答案不会超出程序的处理边界”,而校准则进一步告诉程序“这个答案的可信度有多高”,两者分别解决了“程序能不能处理”和“程序要不要执行”的问题。从这个角度来看,Jev确实提供了一种降低广义幻觉风险的思路:不要强迫模型在每次不确定时都给出斩钉截铁的最终答案,而是将不确定性本身作为输出的一部分,让系统可以选择执行、升级或者放弃任务。
不过,“校准”并不等同于“没有幻觉”。相关行业研究曾指出,一个模型完全可能每次都答错,但每次都诚实地告诉你“我只有0%的把握”——它的概率可以非常校准,但答案仍然全错。因此,校准本身并不是幻觉率的衡量指标。
争议:是创新还是换汤不换药?
Jev的爆火也引发了不少质疑。有评论指出,这款看似新奇的模型,本质上只是做了分类、打分、路由和结构化输出这些大模型工作流中最常见的任务。甚至在发布不到一天的时间里,就有人用小参数模型复现了类似的功能,开发者还调侃道:“他们花了两年时间隐身开发,我只用了两个小时……”
这些质疑并非全无道理。并行生成结构化选择本身并非全新的技术,宣传中的“零幻觉”也存在偷换概念的嫌疑,而RLCD的具体训练方法、奖励函数以及系统的概率校准指标,目前都还没有完整公开。社区对Jev的质疑主要集中在这几个方面:并行结构化输出没有开创性,“零幻觉”的宣传偷换了定义,而校准的效果也缺乏公开的验证证据。
但这些质疑并没有动摇Jev所指向的核心问题。恰恰相反,它们反而从另一个角度证明了这条路线的价值:如果开发者可以用小参数模型,在短短两小时内复现类似的功能,那就说明这类结构化判断的能力,根本不需要依赖昂贵、复杂的通用大模型。
这正是Jev最初想要讨论的问题:过去几年,我们习惯了将越来越多的任务交给通用大模型,但对于很多任务来说,这其实是“杀鸡用牛刀”。Jev正是将那些最普通、数量最多、也最容易被忽略的判断任务单独拆分出来,不追求回答所有问题,甚至主动放弃了聊天、写作和自由生成的能力,只留下自动化场景真正需要的核心功能。
大多数AI产品都会通过刷新基准测试来证明自己的实力:更强的推理能力、更高的得分、更长的上下文窗口,用一张张榜单来展示能力的上限。但Jev走的是另一条路:它很难用“更强”来形容,而是将模型的能力压缩到刚好够用的程度——只做判断,不生成多余的解释,用小模型就能完成的任务,就没必要每次都调用最昂贵、最复杂的大模型。
这种产品思路更像是“贴地飞行”:它不追求展示AI能做到多么惊人的事情,而是紧贴真实工作流中那些数量庞大、重复发生、且对延迟和成本高度敏感的问题,将等待时间和Token成本都节省下来。一个看起来并不炫目的功能模块,最终获得了极高的关注度,这本身就说明:证明模型解决了人们日常遇到的实际问题,并且能力刚好够用,或许是另一种更有价值的产品思路。
未来,随着模型能力的不断增强,AI产品或许不再只需要展示“能力上限”,还需要思考另一个问题:面对各类任务,如何为用户提供最简单、最直接、最不绕弯子的解决方案。

