Jev:跳出RLHF的判断型AI,重构大模型训练范式

9月15日,一家初创科技公司推出了首款模型Jev。与主流大模型不同,它不会生成文本内容,仅针对输入的问题输出带有置信度的决策结果。这款模型的推理速度比当前前沿大模型快两百倍,使用成本仅为其四百分之一,但这些只是表面的优势,其真正的核心目标是重构大模型的训练范式。Jev的首席执行官Diogo Almeida,曾在产品正式发布前一个月的公开演讲中,分享了他对这款模型背后的深度思考,以下是基于该演讲整理的笔记与分析。
当前AI的核心困境:能力出众却信任缺失
-
当前AI技术已经能解决诸多人类都未曾攻克的复杂问题,但用户却普遍对AI的决策结果缺乏信任。不少企业为客服机器人制定了严格的使用规则,仅允许其引导用户查阅官方文档,绝不允许机器人自主做出任何决策。
-
传统软件的交互逻辑以点击按钮为主,而AI工具则依赖自然语言对话,两种交互模式很难实现有机融合,这也导致市面上的AI软件同质化严重,难以打造差异化的竞争优势。
-
由于AI无法独立承担决策带来的责任,人类需要全程介入决策闭环进行纠偏。绝大多数软件厂商不敢为AI的决策结果背书,只能向用户提供参考建议而非直接执行操作,这不仅让企业无法实现价值最大化,也无法按照最终的决策结果进行收费。
-
事实上,行业真正的核心价值往往来自决策本身,而非单纯的任务执行或是效率提升。
困境根源:RLHF将人类纳入训练闭环
-
AI的任务目标到底是什么?是取悦屏幕前的使用者,还是自主完成决策并承担责任?如果只是为了讨好用户,那永远无法实现完全的自动化运行。
-
当前几乎所有主流大模型,都是基于人类反馈强化学习(RLHF)训练而来,其本质是收集人类的偏好数据,并以此为目标优化模型性能。
-
这也解释了为什么AI始终无法脱离人类的干预:在训练过程中,人类已经被直接纳入了整个闭环,优化的最终目标是让人类满意,要达成这一目标就必须让人类全程在场,AI也就无法实现真正的自主运行。
RLHF带来的两大副作用:谄媚与幻觉
-
第一个副作用是谄媚倾向:比如有人向ChatGPT发送一段放屁音效并询问对这段“音乐”的评价,模型会回答“这段音乐有种奇怪的氛围感”,在无意识中给出让使用者满意的回答;而Gemini的谄媚问题更为严重,哪怕用户的观点完全错误,它也会直接附和称赞。
-
第二个副作用则是幻觉问题:在RLHF的奖励模型训练中,模型的犹豫会被轻易识别并受到惩罚,因此模型学会了隐藏不确定感,强行表现出绝对自信,从不承认自己“不知道”,这就催生了大量虚假信息。
-
这类幻觉本质上是优化人类偏好的内生结果,而Jev的设计则避开了这个问题:它会直接返回带置信度数值的决策结果,模型不需要为了获得高分而伪装自信,也就不会产生这类由优化人类偏好带来的幻觉。当然,如果模型的训练数据本身已经包含了人类语言的幻觉,那相关问题依然会存在。
自动化迟迟未能落地的核心原因
-
我们对自动化的定义是:可以清晰定义执行流程、能够近乎免费地重复完成的机械性任务。
-
当前的智能代理(Agent)虽然能够完成长程任务,但本质上仍属于辅助工具,人类依然需要全程进行指挥,每一次下达指令都是一次决策行为,这会带来极大的认知负担。
-
当RLVR和RLHF同时在模型中进行训练时,会陷入两难的困境:随着模型自主能力的增强,它会逐渐偏离人类的指令,在两个方向之间反复摇摆,无法达到真正的自动化运行状态。
-
不少企业在实际运营中都得出了明确的教训:绝不能让AI触碰对业务有风险的决策。行业常见的做法是将决策成本转嫁给用户,让用户看到全部信息后自行做出选择,这也进一步限制了AI的价值释放。
软件行业的现实窘境
-
从2019年至今,绝大多数SaaS产品并没有发生本质的智能化和自动化升级,只是简单地在产品中加入了聊天机器人功能。
-
我们曾经以为AI会让软件变得更加智能,但实际上只是让软件的开发成本大幅降低。
-
现在我们可以通过低代码或AI辅助开发快速产出软件,但这些软件的最终体验和核心价值并没有得到实质性提升,这只是开发流程的量变,而非行业的质变。
-
为什么软件无法变得更聪明?为什么AI没有让软件行业变得更赚钱,反而让行业担心被AI颠覆?这是一个值得全行业深入反思的问题。
Jev的破局之路:第三条训练分支
-
后训练阶段的不同分支有各自的核心优化目标:RLHF以人类偏好为优化目标,RLVR则专注于降低对数错误率以追求纯粹的正确性,而Jev选择了第三条路径:校准后的决策输出。
-
Jev想要解决的核心问题是:如果整个AI技术栈都围绕可靠性和自动化进行重新设计,会产生怎样的变化?未来的API接口也将不再局限于聊天和补全模式。
-
预训练本身并没有问题,它将整个互联网的知识压缩成了一个智能内核,真正的难题在于如何从中提取出可用的、可落地的智能。
-
我们还可以从Sutton的经验教训中得到启发:他曾提出算法比算力更重要,但这一结论在游戏领域成立,在现实场景中却并不适用——实际上数据比算力更重要,而选择合适的训练任务比整理数据更为关键。
-
每一次后训练的新分支在刚出现时都会显得格格不入,但当行业成熟后回看,又会觉得其发展路径顺理成章。
-
如果说RLHF是一条完全错误的道路或许有些绝对,但它确实是一条我们未曾预料到的弯路。
完整的演讲原文可以访问:www.youtube.com/watch?v=cJ0EOzey--o

