极速便宜Jev模型爆火硅谷 国内团队开源低成本复现

经济学中的杰文斯悖论指出,当一种资源的使用效率提升、单位成本降低时,其总消耗量往往不降反升。如今这一规律在大模型行业体现得淋漓尽致——模型越便宜、响应越快,调用量就会呈现爆发式增长。而近期席卷硅谷的Jev模型,正是将这一趋势推向极致的新物种。
这款被称为“哑巴模型”的产品拒绝生成无意义的闲聊或诗歌,发布不到48小时就在海外社交平台引发超3000万次讨论,吸引2.5万名开发者申请内测;上线大模型托管平台Vercel的24小时内,近13%的付费团队快速接入,其渗透速度是当年GPT-4的两倍。
作为前OpenAI核心研究员、RLHF技术的共同发明者,Jev创始人Diogo Almeida曾公开表示:“下一个时代不属于Claude Code这类辅助工具,Jev才是未来。它比通用模型快200倍,便宜400倍,且零幻觉,这将是继RLHF之后的下一个行业突破性技术。”
从毫秒级响应的浏览器插件,到高频执行的链上交易决策系统,再到每秒10次决策、通关《毁灭战士》的游戏外挂,开发者围绕Jev打造的应用案例呈井喷之势。不过,这款估值一夜飙升至2亿美元的“黑箱”模型,也引发了大量讨论:它究竟是架构层面的革命,还是被营销包装的分类器?
就在模型发布后不久,国内人工智能企业APUS旗下AI实验室公开了全球首批针对Jev的独立开源复现成果,并封装为开箱即用的Agent Skill工具fast-browser-use。该项目支持纯本地离线运行,兼容macOS、Linux、Windows三大桌面与服务器系统,甚至无需独立GPU,普通台式机或笔记本即可跑通完整功能。
目前,该项目已通过MIT协议向社区开放完整代码,团队自研的小参数规模模型也即将开源,初步测试效果已对标甚至超过Jev的表现。我们联系到该项目负责人、APUS AI首席科学家张旭博士,清华大学本硕博连读,工学博士,围绕Jev的底层技术逻辑、复现思路、应用潜力以及Agent的未来分工方向进行了深入探讨。
Jev的核心技术逻辑
张旭博士表示,理解Jev的关键在于拆解普通大模型的两个核心步骤:Prefill(输入处理)和Decode(自回归生成)。当大模型完成Prefill阶段时,其神经网络内部的隐状态已经完全理解了输入的文字或图片细节,而Decode阶段则是将内部状态逐字转化为人类可读的文本,这一步本质上是“翻译给人看”。但人类语言的带宽有限,会造成大量信息损耗——无论用多少文字描述一张包含复杂光影和细节的图片,都无法完整还原原始信息。
Jev的核心设计正是砍掉了Decode步骤,直接在模型的隐空间中完成计算并输出结果。与普通大模型在十几万词汇表中计算全量概率并逐个生成Token不同,Jev将计算过程极度收敛,仅针对有限选项进行概率测算。例如当被问及“这份提纲是否完整”时,模型只会返回“完整”与“不完整”两个选项的概率得分。这也是它宣称“零幻觉”的原因:它不会凭空生成未给定的选项,但这并不代表它不会出现判断错误。
尽管有声音认为Jev本质上是分类器,但张旭博士指出,这一设计背后代表了隐空间计算的前沿研究趋势。当前行业内很多探索都在尝试打破“理解→生成语言→处理”的传统流程,比如DeepSeek-v4.1 Flash版本已经在尝试解耦Prefill和Decode能力,最新的GPT-6(Astra)所探讨的Loop Transformer机制,则是让模型的思维过程在隐空间内循环计算,而非转化为低效的人类文字。Jev则是将这一思路产品化的典型案例,证明直接使用隐空间的中间结果足以颠覆当前的应用形态。
极致速度的来源
Jev最显著的特点是极致的速度,除了省去长文本生成的步骤外,还有三个核心优化:一是计算维度的降级,将开放式生成转为有限候选的判断;二是候选范围大幅缩小,仅需针对几个到几十个选项进行计算;三是候选之间相互独立,支持并行判断,而传统自回归生成的Token之间存在依赖,无法并行处理。团队在复现过程中还加入了类似KV Cache广播的优化,进一步提升了推理速度。
Jev的复现思路
由于Jev并未开源权重、完整架构和训练方案,APUS团队并未直接复现模型本身,而是通过公开资料、创始人背景分析以及实际调用的输入输出数据,反推其工作机制,并基于Qwen3.5系列、Google Gemma系列等开源模型还原了Jev的核心工作流,在推理速度上实现了对标。
开源当天的首轮测试显示,在真实浏览器任务中,维基百科检索约需18秒完成,表单填写、站内跳转等短链任务可在数秒内完成,全程无需调用云端模型。后续在RTX PRO 6000设备上的测试中,单次决策时间压缩到79毫秒,与Jev官方公布的70-500毫秒响应时间基本对齐。张旭博士透露,团队自研的模型可实现9B、4B参数规模的复现,效果已接近甚至超过Jev的表现。
针对底座模型的参数规模,团队测试发现,5亿参数以下的模型虽然可以运行,但效果较差,无法满足实用需求,9B参数是最低可用门槛,35B参数的模型效果更佳。选择9B参数也是为了让普通用户无需高端设备即可本地运行模型。
多场景的应用潜力
团队之所以优先将复现成果封装为浏览器自动化工具,是因为当时行业内最常见的Jev应用场景就是浏览器操作。同时团队希望开源的工具具备实际使用价值,而非仅作为技术Demo。与传统Agent需要大模型先生成操作代码再执行不同,该工具会先列出网页上可交互的元素,如输入框、链接、翻页按钮等,再让模型直接选择下一步操作:输入内容、点击链接或翻页。当模型推理速度达到毫秒级后,团队发现完整任务的大部分耗时其实来自网页加载和刷新。
团队长期致力于本地模型、CPU推理、小算力部署以及模型路由等方向,核心目标是实现AI普惠。当前绝大多数普通用户无法承担昂贵的GPU设备,若AI推理完全依赖中心化大算力,将成为大规模落地的瓶颈。因此团队希望将部分推理分散到CPU服务器甚至用户的终端设备上,通过更高的性价比让AI真正实现大规模普及。
除了浏览器自动化,这类快速决策模型的应用场景非常广泛。比如有开发者将Jev接入Monad链上交易系统,模型每0.3秒即可读取一次盘口并完成一次买卖决策;还有开发者基于Jev分析10万条社交帖子仅耗时20.4秒,花费仅0.67美元。在浏览器中可以快速过滤广告、欺诈信息和杂乱内容;在推荐系统中可以快速计算用户对不同内容的感兴趣概率;批量审核文档时,由于判断任务可并行处理,一次可完成上千份文档的审核,在速度和成本上都具备优势。
有观点认为Jev的高速度适合炒股或交易场景,但张旭博士表示,速度快并不代表投资能力强,炒股的效果最终取决于模型本身的智力水平以及是否针对金融领域进行了优化,目前Jev并未针对该场景做专项优化,因此不能仅凭决策速度就认为它适合交易。
从长期来看,这类模型可应用于工业自动化、智能家居等需要快速响应的领域。既然Jev可以用于游戏操作,那么它同样可以操控机器人,完成高频的物理交互任务。
行业趋势与未来挑战
当决策速度大幅提升后,最大的挑战在于模型的智力水平。传统大模型通过长思维链来提升数学、编程、推理等复杂能力,而Jev砍掉了生成步骤,更依赖模型的“直觉”和第一反应,对于需要多步思考的复杂任务,当前的Jev模型能力不足,更适合规则明确、候选范围清晰的任务。
Jev的火爆并非因为快思考、慢思考的思路是新鲜的,此前不少模型都提出了快慢模式,但所谓的“快模式”本质上仍是逐Token生成文本,只是思维链更短,用户体验并未达到真正的“本能级”响应。Jev的突破在于真正做到了足够快的实用级速度。
Jev无法独立完成长链条的Agent任务,需要与完整的大模型配合使用。复杂的任务规划、逻辑推演可以交给慢模型,而高频、原子化的环境交互动作则适合交给这类快速决策模型。未来快慢两种模式可能融合在同一个模型中,通用模型厂商可以通过屏蔽长生成步骤,提供快速决策模式;但拆分出不同的模型可以让每个模块更专注,效率更高,最终取决于哪家厂商能够整合完整的生态。
对于Agent和模型的关系,张旭博士打了一个比方:模型就像汽车的发动机,Harness是汽车的控制系统,而Agent则是整辆汽车。即便发动机越来越强大,也不会因此舍弃轮子、方向盘和控制系统。因此大模型会持续进化,但它始终只是Agent的驱动系统,而非完整的Agent本身。

