TypeSafe AI发布新模型Jev:不写字的决策大脑快200倍

TypeSafe AI发布新模型Jev,由前OpenAI核心研究员Diogo Almeida创办,是首个“System One”决策模型。它不生成文本,直接输出带校准概率的结构化判断,速度比前沿大模型快193.6倍,成本低至1/444.6,输入每百万Token仅0.042美元,输出免费。发布一周即落地超2000个开源项目,正重新定义AI在自动化流程中的角色。

一、当一个“教ChatGPT说话的人”决定让AI闭嘴
2026年9月15日,一条消息在硅谷开发者社区引爆:前OpenAI研究员、InstructGPT与RLHF训练范式的核心作者之一Diogo Almeida,在隐身研发两年后,带着4000万美元种子轮融资发布了他的新模型——Jev。
吊诡的地方在于,这个由“最懂怎么让AI开口说话的人”做出来的模型,连一个标点符号都吐不出来。它不写周报,不聊天,不生成代码,不翻译文本。它只做一件事:判断。
给它一封客服邮件和几个预先定义好的问题,它直接返回“紧急程度:0.95”“退款风险:高,置信度78%”这样的结构化答案。没有多余的文字,没有格式错误,没有“好的,这是您要的格式”之类的客套话。
发布当天,Jev长时间占据Hacker News首页前列,创始人发布帖浏览量达420万次、近2万次点赞。开发者平台Vercel在9月18日披露,Jev接入其AI Gateway后的24小时内,近13%的付费团队开始使用,这一比例是GPT-5.6系列上线首日的2倍,也是Claude Fable 5.1的6倍以上。
这不是一个小众工具的热度,而是一次对AI行业主流叙事的有力挑战。
Jev这个名字取自19世纪经济学家威廉·斯坦利·杰文斯(William Stanley Jevons),暗合“杰文斯悖论”——当一种资源的使用效率大幅提高、成本急剧下降时,它的总需求反而会暴涨。TypeSafe AI给Jev设定的使命正是如此:让“智能判断”变得足够便宜,便宜到可以被嵌入软件的每一个角落。
二、被忽视的错配:当代码需要AI的判断,AI却在跟你聊天
要真正理解Jev为什么能引发如此大的反响,得先看清当前AI开发者面临的一个尴尬现实。
2.1 “用大炮打蚊子”的工程荒诞
今天绝大多数工程师把大语言模型接入业务系统时,做的事情其实相当荒诞。你明明只需要模型回答“这封邮件是不是垃圾邮件”,或者“在五个API接口里选一个”,但你不得不让一个拥有上千亿参数的庞然大物,在漫长的几秒钟里,逐字逐句地把一串JSON字符敲出来。
为了保证这串字符符合代码规范,开发者得写满整整两页提示词,求着模型“不要输出任何废话,只要纯JSON格式”。即便如此,模型偶尔还是会在前后加上一句“好的,这是你要的格式”,瞬间搞崩下游的整条流水线。
更别提那些在生产环境中代价高昂的后果:一次幻觉的工具调用在Agent原型阶段只是不便,但在有延迟保证的生产系统里、在依赖链深处,幻觉和类型错误是致命的。
2.2 99%的交互不是给人看的
TypeSafe AI在发布博客中给出了一个关键判断:大规模自动化将由AI-to-AI和AI-to-software的交互主导,预计99%的交互是机器对机器,只有1%是人机交互。
这意味着,当前大模型被设计出来的核心能力——生成供人阅读的自然语言文本——在未来绝大多数应用场景中,其实是一种“冗余”。机器不需要读一段优美的段落来知道该点击哪个按钮,它只需要一个数字、一个选项、一个概率。
Jev正是从这个被忽视的错配中生长出来的。
三、System One:给AI装上“反射神经”
3.1 卡尼曼的快慢框架,被搬进了模型设计
Jev被TypeSafe AI定义为“System One Model”(系统一模型)。这个名字来自诺贝尔经济学奖得主丹尼尔·卡尼曼的经典著作《思考,快与慢》。在这本书中,人类思维被分为两个系统:系统一是无意识、极速的本能直觉;系统二是缓慢、需要调动精力的逻辑推理。
当前主流大模型——GPT、Claude、Gemini——几乎全部在“系统二”的赛道上狂奔。它们在给出答案前会默默“自言自语”几千个词,拉长推理链条,试图模拟人类深思熟虑的过程。
Jev走了完全相反的路。它不做文本生成,所有决策在一次单向并行计算中同时产出。没有逐token的推演,没有生成式的“废话”,输出永远严格锁定在开发者预先定义的结构里。
3.2 三种“原语”,覆盖所有判断场景
Jev的输出被压缩成三种类型化原语:
- Choice(选择) :从不超过255个预定义选项中选出一个,同时返回完整概率分布和置信度。
- Score(评分) :将一个状态放到2到10级的有序评分标准上,返回等级和对应概率。
- Noul(是非判断) :判断一个陈述是否为真,返回0到1之间的概率值。这个名字来自“null”的变体,是TypeSafe自创的术语。
一个风控系统可以让Jev同时判断某个用户退款风险为低、中还是高(Choice),该交易的紧急程度打几分(Score),以及这笔交易是否存在欺诈嫌疑(Noul)。模型在一次请求中并行返回所有答案,代码拿到的是可以直接和阈值比较的数字。
3.3 数学层面消灭格式幻觉
Jev最根本的技术突破在于:由于它不生成自由文本,结构化输出的格式幻觉在数学层面被彻底消灭了。
传统的结构化输出方案——无论是JSON Mode、Function Calling还是提示词约束——本质上都是在“求”模型按格式输出。模型是有可能“不听话”的。而Jev的架构决定了它只能在预定义的选项空间内作答,输出不是自由字符串,而是类型化的值。用TypeSafe自己的话说: “Building prod, not God” ——造生产系统,而不是造一个无所不能的上帝。
四、速度与成本的降维打击:数据说了什么
4.1 核心性能指标
根据TypeSafe官方公布的数据以及多家独立机构的验证,Jev在适合它的任务上展现出显著优势:
| 对比维度 | Jev(System One) | 前沿大语言模型(LLM) | 数据来源 |
|---|---|---|---|
| 端到端延迟 | 70–500毫秒 | 3–329秒 | TypeSafe官方 |
| 输入定价 | $0.042/百万Token | $0.20–$10/百万Token | 多方报道综合 |
| 输出定价 | 免费 | 通常为输入的3–5倍 | TypeSafe官方 |
| 单次决策成本 | 约$0.0004 | 约$0.03(GPT-5.6 Terra) | GreenNode评测 |
| 结构化输出错误率 | 0%(架构保证) | 依赖提示词,偶发格式错误 | 多方验证 |
| 峰值提速 | — | 快193.6倍 | TypeSafe内部测试 |
| 峰值成本优势 | — | 低444.6倍 | TypeSafe内部测试 |
4.2 独立评测:光环与真相之间
Jev的光环并非没有折扣。独立评测机构Arize AI进行了一项规模较大的对比测试——在RAGTruth和SummEval两个人工标注数据集上完成了23,325次判断,将Jev与Claude Opus 5和GPT-5.6 Terra进行对比。
结论颇为微妙:在默认0.5阈值下,Jev的表现比Opus 5差了7个百分点。但当研究人员针对人类标注数据对阈值进行校准后,Jev在幻觉检测任务上追平了Claude Opus 5(87%准确率),成本仅为后者的约1/300,速度快23倍。
独到观察:这个结果揭示了一个容易被忽视的事实——对于概率型决策模型,决策阈值的选择比模型本身的选择更重要。Jev输出的不是“是/否”的硬判断,而是“有75%的概率是”这样的软判断。使用者的工程决策(阈值定在哪里)直接影响最终准确率。这意味着Jev的实际效果很大程度上取决于使用者的校准能力,而非模型本身的“聪明程度”。
4.3 在游戏和Agent中的极端测试
TypeSafe做过一个颇为极端的测试:让Jev玩射击游戏Doom。在不需要复杂长线规划、只需要每秒做出约10次即时操作判断的场景下,Jev表现得像一个反应极快的人类玩家,而整套推理成本每小时大约只要7美元。
另一位开发者则将Jev与GPT-6 Astra组成了一套《我的世界》游戏Agent:Astra担任“指挥官”负责长线规划,Jev则负责每一步“该挖哪块石头、该往哪走”的即时判断。最终用8分43秒打赢了末影龙,总花销不到1美元,其中Jev只占了0.01美元。
这些案例指向同一个模式:昂贵的大模型负责规划等“慢思考”,高频、原子化的“快判断”交给轻量决策模型完成。 负责组装与调度这套分工的工程层,在业界被称为Harness。
五、从一个模型到一个生态:Jev的早期落地图谱
5.1 一周2170个项目,八大领域
Jev发布后一周内,GitHub上出现了2170个与Jev相关的公开项目。其中1865个是新建仓库,305个是已有项目接入Jev。
这些项目分布在八个主要领域:
| 应用领域 | 典型用法 | Jev承担的角色 |
|---|---|---|
| 界面Agent | 浏览器自动化操作 | 决定“点哪里、选哪个” |
| 软件工程 | 代码审查、风险筛查 | 判断改动是否有风险 |
| 搜索与记忆 | 结果排序与筛选 | 评估相关性 |
| 安全与治理 | 内容审核、合规检测 | 分类与评分 |
| 路由与自动化 | 工具选择、模型调度 | 选择最优路径 |
| 仿真与控制 | 游戏Agent、机器人 | 动作选择(占52%) |
| 内容与专业任务 | 工单分流、文档分类 | 判断与路由 |
| 基础设施 | 请求分发、负载管理 | 快速决策 |
从关注度分布来看,界面Agent和路由与自动化两类合计只占样本项目的19.6%,却获得了63.0%的仓库Stars。这说明开发者社区最看重的,是Jev在“Agent执行层”的决策能力。
5.2 APUS的独立复现:验证范式的可行性
9月19日,中国AI企业APUS公布了全球最早一批针对Jev的独立开源复现成果,以MIT协议向全球开发者开放。APUS在Apple M2 Pro消费级笔记本上实现了完全离线的Jev式决策:真实维基百科检索任务中位耗时约18秒,表单填报和站内导航任务耗时仅3秒左右,全程零云端调用、零API费用,用户数据不出本机。
这一复现的意义超出了技术验证本身。它证明了“用模型做Harness”这一路线在工程上可行,且在闭源API之外,开源权重加端侧算力同样能够支撑该范式。
六、争议与边界:Jev不是什么
6.1 官方承认的九类失效场景
Jev的文档页面坦诚地列出了它不擅长的事情,包括:不会数数、不会比较日期、英文之外的语言准确率偏低、对措辞敏感(把问题写得越谨慎间接,一致率越低)、需要生成文本的任务完全无法处理等。
Redis之父antirez在社交媒体上公开表达了对Jev狂热的质疑。他指出,Jev并没有因此获得复杂推理能力,它主要改变的是语义判断的成本、延迟和输出形式。而且Jev的上下文窗口只有32K token,对于需要了解此前大量上下文的复杂判断任务,数据不足以做出可靠判断。
6.2 可解释性的缺失
在金融、医疗、法律等强监管领域,决策的可追溯性往往是一项硬性要求——审查者需要知道“为什么得出这个结论”。Jev只给出数字和概率,不提供任何推理链或解释。这并非技术缺陷,而是设计取舍:要获得速度和类型的确定性,就必须放弃自由文本的灵活性。但在某些场景中,这个代价可能过高。
6.3 与“高级分类器”的边界之争
有观点认为Jev本质上是一个拥有通用语义理解能力的“智能if语句”——比传统分类器灵活,但比大模型“窄”得多。Earendil首席技术官Armin Ronacher的评价颇为犀利:行业早该想到这类方案,但由于前沿大模型价格低廉且有补贴,开发者一直没有动力另寻出路。Jev的用处显现之后,竞争者会很快出现。
独到判断:Jev的核心创新不在于模型架构上的颠覆。从技术角度看,它更接近一个经过精心训练的、以概率校准为目标的encoder类模型。它真正的创新在于产品定位的精准:在一个被“更大、更强、更通用”叙事主导的行业中,选择做“更小、更快、更专注”的决策组件。这需要的不是技术勇气,而是对软件工程本质的深刻理解——生产系统需要的不是无所不能,而是可靠、可测试、可预测。
七、System One与System Two的分工哲学
7.1 为什么“不生成”是一种超能力
在TypeSafe的设计哲学中,放弃字符串生成不是一种妥协,而是一种主动的战略取舍。字符串是极其强大和通用的输出形式,但代价高昂——它需要逐token解码,需要格式约束,需要后处理解析。而“放弃字符串”反而带来了一系列“超能力”:并行采样、输出零幻觉、输出免费、毫秒级延迟。
这个逻辑链条值得每个做AI产品的人深思:当你放弃一个看似必要的功能时,你获得了什么? 对于Jev来说,答案是一个全新的品类——不是更好的聊天机器人,而是可以像代码库一样被依赖的决策组件。
7.2 从RLHF到RLCD:一条不同的训练路径
Jev的训练方法与主流大模型有着本质区别。Diogo Almeida曾是RLHF(基于人类反馈的强化学习)的核心研究者,但Jev采用的是一种被称为RLCD(Reinforcement Learning for Calibrated Decisions,校准决策强化学习)的新方法。其核心目标是训练模型使得“更高的声明概率意味着更高的正确概率”。
换句话说,当Jev说“这个判断有80%的把握”时,在统计意义上,它的判断确实在约80%的情况下是正确的。这种概率校准能力,是传统大模型很难稳定提供的。Almeida甚至公开表示,RLHF可能是一条弯路,而TypeSafe内部有一半的实验室专门研究合成数据,“自己生成全部训练数据”是他做过的最好的决定。
7.3 未来应用场景的想象
System One模型的应用空间远不止于当前的Agent场景。以下方向值得关注:
机器人控制:机器人需要以毫秒级频率做出“该往左还是往右”“这个物体是否可抓取”的判断。Jev的延迟和成本特征天然适配这类高频决策。
实时风控:在金融交易、支付验证等场景中,每一次决策需要在极短时间内完成,同时给出风险概率。Jev的Choice和Noul原语可以直接嵌入风控管道。
大规模内容治理:当平台每天需要处理数千万条内容审核请求时,单次决策成本从几分钱降到万分之几,带来的成本差异是数量级的。
八、FAQ:关于TypeSafe AI发布新模型Jev的常见问题
Q1:TypeSafe AI发布的新模型Jev到底是什么?
Jev是一个“System One模型”(决策模型),由前OpenAI研究员Diogo Almeida创办的TypeSafe AI于2026年9月15日发布。它与传统大语言模型的核心区别在于:不生成文本,直接输出带校准概率的结构化决策(选择、评分、是非判断)。定位是为软件和Agent提供快速、可靠的判断能力,而非对话或内容生成。
Q2:Jev和ChatGPT、Claude有什么本质区别?
ChatGPT和Claude是“System Two”路线的大语言模型,核心能力是逐token生成自然语言文本,适合写作、推理、对话、代码生成等开放式任务。Jev走的是完全不同的路线:一次并行计算直接返回结构化判断,延迟70–500毫秒,输出零格式错误。两者不是替代关系,而是互补关系——大模型负责规划,Jev负责高频判断。
Q3:Jev的速度和成本优势具体有多大?
在适合Jev的任务上,TypeSafe官方公布的最高数据是比前沿大模型快193.6倍、成本低444.6倍。具体来说,Jev的输入价格为每百万Token 0.042美元,输出免费;端到端延迟70–500毫秒,而前沿大模型通常需要3–329秒。单次结构化决策的成本约为0.0004美元。
Q4:Jev有哪些已知的局限性?
Jev官方文档列出了九类失效场景:不会做算术、不会比较日期、英文之外的语言准确率偏低、对措辞敏感、无法生成任何文本、上下文窗口仅32K token、不能解释推理过程等。它适合分类、路由、评分、审核等结构化判断任务,不适合写作、推理链、多轮对话或任何需要“给理由”的场景。
Q5:开发者现在如何使用Jev?
Jev已通过API全面开放,支持Python SDK、TypeScript SDK,并已接入LiteLLM、OpenRouter、Vercel AI Gateway、LangChain和Pydantic AI等主流开发工具链。开发者可以在console.typesafe.ai获取API Key,按照官方文档的快速上手教程进行集成。

