Jev模型多场景实测:高效降本的AI决策工具

近期,一款名为Jev的AI模型引发了行业广泛关注。与传统需要完整输入输出的大模型不同,它的核心优势在于仅需给定上下文和具体判断任务,就能直接返回选择、分数或真假判断结果。省去了冗长的内容生成步骤后,Jev的推理速度可达毫秒级,同时token调用成本也显著降低。
一、 Agent智能搜索的停止判断:效果持平,速度大幅提升
2025年,相关智能搜索技术进入大众视野,这类系统让AI代理一边搜索获取信息,一边根据已拿到的内容决定下一步行动。我们基于这一理念开发了开源项目,用于帮助智能体围绕私有数据反复搜索整理信息,最终回答复杂问题。
比如当用户询问“某部电影的导演出生在哪座城市?”时,第一轮搜索可能仅能获取导演的身份信息,此时智能体需要继续搜索;当找到导演的出生地后,即可停止搜索流程。
本次测试我们沿用了该项目的100道多跳问题数据集,让Jev和对比模型在完全相同的搜索记录基础上,判断是否需要继续展开搜索。测试结果显示,两者最终的证据召回率Recall@5均为93.25%,平均搜索轮数也基本一致,这意味着将负责停止判断的模型替换为Jev,并未对最终搜索质量造成负面影响。
但在单轮判断的耗时上,Jev表现亮眼:平均耗时从2.23秒压缩至0.55秒,API响应速度提升约4倍;按照本次测试的调用量估算,单轮判断的成本仅为原来的七分之一。
不难看出,在这类需要固定判断逻辑的场景中,Jev可以直接替代负责决策路由的通用大模型。因为这类场景并不需要模型生成回答或分析过程,仅需根据当前已获取的证据,判断“继续搜索还是停止”这类简单任务,只需给定搜索状态并返回结构化判断即可。当然,这类判断本身属于相对基础的语义决策任务。
二、 Agent记忆重排:有明显提升,但尚未追上专用重排模型
此前我们在公开检索数据集上测试过Jev,发现它与专用的重排序模型表现接近,甚至部分场景更优,但公开基准测试的结果未必能完全适配真实的私有业务场景。因此第二组测试我们没有使用通用公开数据,而是转向了代码智能体的记忆搜索场景。
我们开发的开源项目,可以为代码智能体提供持久化记忆存储:用户的开发对话和历史经验会被保存为文档,即使切换会话也能找回之前的上下文。例如当用户提问“上次这个项目的集成测试连不上数据库,最后是怎么修好的?”时,初始召回的记忆内容可能包含测试命令、数据库配置、历史报错记录以及真正解决问题的排障文档,这些内容都可能包含相关关键词,但真正需要优先展示的是包含故障原因和解决方案的那段记录。
本次测试我们使用了原项目的2172道中英文问题,所有测试的候选召回环节完全一致;重排阶段分别设置了不重排、使用Jev重排、使用专用重排模型三组对照。测试结果显示:不做重排时Recall@5为74.71%,使用Jev重排后提升至79.41%,而专用重排模型则达到了81.87%。
这说明在专用领域的记忆重排场景中,Jev确实能有效提升相关内容的排序质量,提升幅度较为明显,但无论是整体召回率还是将正确结果前置的能力,Jev都尚未追上专用的重排模型。这种差距在中英文测试数据中均有体现,更关键的是,这组测试中Jev并没有展现出明显的成本优势。
背后的原因可能在于,部分重排任务需要一定的逻辑推理,存在较为复杂的隐含判断过程,而Jev的模型架构并不支持这类深度思考,因此在这类场景下的表现尚有不足,这一点在后续的多跳图检索测试中体现得更为明显。
三、 多跳图关系检索:超越基础大模型,但仍弱于高阶模型
第三个测试场景基于我们开发的开源项目,该项目将向量检索与实体关系图相结合,让搜索可以沿着实体线索展开多步查找,从而找到单篇文档无法覆盖的答案。
比如当用户询问“某本书的作者出生在哪里?”时,系统会先召回一批候选关系:该书由某出版社出版、作者曾获某奖项、该书的作者是某人、作者出生于某城市。这些关系都与书籍或作者相关,但对回答问题的价值各不相同。关系重排的目标就是将高价值的关系排在前面,让系统能快速找到正确的证据链。
在这个项目中,关系筛选和重排原本由大模型完成,而我们尝试用Jev替代这一环节。关系筛选一直是该搜索流程中较慢的步骤:候选关系数量多、输入内容长,且需要等待大模型生成判断结果,这也是我们尝试用Jev替换的核心原因。
我们在两个公开数据集上各运行了500道测试题,测试结果显示:Jev的表现超过了基础版本的大模型,但尚未追平高阶版本的大模型。在其中一个数据集上,Jev与高阶模型的差距仅为1个百分点;而在难度更高的另一个数据集上,差距扩大到了4.13个百分点。
从成本来看,Jev每千题的调用成本约为3.15美元,接近基础大模型的估算成本,远低于高阶大模型的成本。不过在这个场景中,Jev的时延优势依然明显,是所有方案中响应最快的,如果你追求极致的速度并能接受一定的性能损失,Jev也是一个可行的选择。
我们的判断是:Jev已经可以承担基础的关系筛选任务,但在复杂多跳的关系推理场景中,我们依然会选择更强的生成式大模型;或者也可以直接放弃该方案,转而采用更适配的架构。毕竟Jev的模型架构并不支持复杂的链式思考,在关系错综复杂的多跳场景中表现稍弱也在情理之中。
四、 更多场景思考
总体来看,Jev并不擅长处理需要深度推理的任务,但它在高频、输出简短的语义判断场景中表现出色。除了本次测试的三个场景外,数据筛选、质量评估、语义缓存、查询路由以及带业务条件的内容重排等场景,都非常适合Jev发挥优势。
过去,企业要实现低成本高效率的语义判断,需要为不同任务单独训练和维护专用小模型;而现在,像工具选择、技能调用、浏览器操作等决策类任务,都可以通过同一个Jev模型,结合不同的上下文和判断标准来适配,从而大幅简化系统架构。
实验相关细节与项目代码可通过公开开源平台获取,具体包括智能搜索停止判断测试项目、记忆重排集成测试项目、多跳图关系检索测试项目,以及Jev的官方技术文档与接口说明,此外还有社区基于Jev开发的浏览器自动化项目。

