文章摘要
2026年9月,前OpenAI核心研究员DiogoAlmeida创办的TypeSafeAI发布全球首个SystemOne决策模型Jev。该模型不生成文本,仅输出带校准概率的结构化决策,相比前沿大模型速度快193.6倍,成本低444.6倍,格式错误率为零,发布一周已落地超2000个开源项目,它与主流大模型互补,负责高频即时判断,也存在明确应用局限。

TypeSafe AI发布新模型Jev,由前OpenAI核心研究员Diogo Almeida创办,是首个“System One”决策模型。它不生成文本,直接输出带校准概率的结构化判断,速度比前沿大模型快193.6倍,成本低至1/444.6,输入每百万Token仅0.042美元,输出免费。发布一周即落地超2000个开源项目,正重新定义AI在自动化流程中的角色。

TypeSafe AI发布新模型Jev

一、当一个“教ChatGPT说话的人”决定让AI闭嘴

2026年9月15日,一条消息在硅谷开发者社区引爆:前OpenAI研究员、InstructGPT与RLHF训练范式的核心作者之一Diogo Almeida,在隐身研发两年后,带着4000万美元种子轮融资发布了他的新模型——Jev。

吊诡的地方在于,这个由“最懂怎么让AI开口说话的人”做出来的模型,连一个标点符号都吐不出来。它不写周报,不聊天,不生成代码,不翻译文本。它只做一件事:判断。

给它一封客服邮件和几个预先定义好的问题,它直接返回“紧急程度:0.95”“退款风险:高,置信度78%”这样的结构化答案。没有多余的文字,没有格式错误,没有“好的,这是您要的格式”之类的客套话。

发布当天,Jev长时间占据Hacker News首页前列,创始人发布帖浏览量达420万次、近2万次点赞。开发者平台Vercel在9月18日披露,Jev接入其AI Gateway后的24小时内,近13%的付费团队开始使用,这一比例是GPT-5.6系列上线首日的2倍,也是Claude Fable 5.1的6倍以上。

这不是一个小众工具的热度,而是一次对AI行业主流叙事的有力挑战。

Jev这个名字取自19世纪经济学家威廉·斯坦利·杰文斯(William Stanley Jevons),暗合“杰文斯悖论”——当一种资源的使用效率大幅提高、成本急剧下降时,它的总需求反而会暴涨。TypeSafe AI给Jev设定的使命正是如此:让“智能判断”变得足够便宜,便宜到可以被嵌入软件的每一个角落。

二、被忽视的错配:当代码需要AI的判断,AI却在跟你聊天

要真正理解Jev为什么能引发如此大的反响,得先看清当前AI开发者面临的一个尴尬现实。

2.1 “用大炮打蚊子”的工程荒诞

今天绝大多数工程师把大语言模型接入业务系统时,做的事情其实相当荒诞。你明明只需要模型回答“这封邮件是不是垃圾邮件”,或者“在五个API接口里选一个”,但你不得不让一个拥有上千亿参数的庞然大物,在漫长的几秒钟里,逐字逐句地把一串JSON字符敲出来。

为了保证这串字符符合代码规范,开发者得写满整整两页提示词,求着模型“不要输出任何废话,只要纯JSON格式”。即便如此,模型偶尔还是会在前后加上一句“好的,这是你要的格式”,瞬间搞崩下游的整条流水线。

更别提那些在生产环境中代价高昂的后果:一次幻觉的工具调用在Agent原型阶段只是不便,但在有延迟保证的生产系统里、在依赖链深处,幻觉和类型错误是致命的。

2.2 99%的交互不是给人看的

TypeSafe AI在发布博客中给出了一个关键判断:大规模自动化将由AI-to-AI和AI-to-software的交互主导,预计99%的交互是机器对机器,只有1%是人机交互。

这意味着,当前大模型被设计出来的核心能力——生成供人阅读的自然语言文本——在未来绝大多数应用场景中,其实是一种“冗余”。机器不需要读一段优美的段落来知道该点击哪个按钮,它只需要一个数字、一个选项、一个概率。

Jev正是从这个被忽视的错配中生长出来的。

三、System One:给AI装上“反射神经”

3.1 卡尼曼的快慢框架,被搬进了模型设计

Jev被TypeSafe AI定义为“System One Model”(系统一模型)。这个名字来自诺贝尔经济学奖得主丹尼尔·卡尼曼的经典著作《思考,快与慢》。在这本书中,人类思维被分为两个系统:系统一是无意识、极速的本能直觉;系统二是缓慢、需要调动精力的逻辑推理。

当前主流大模型——GPT、Claude、Gemini——几乎全部在“系统二”的赛道上狂奔。它们在给出答案前会默默“自言自语”几千个词,拉长推理链条,试图模拟人类深思熟虑的过程。

Jev走了完全相反的路。它不做文本生成,所有决策在一次单向并行计算中同时产出。没有逐token的推演,没有生成式的“废话”,输出永远严格锁定在开发者预先定义的结构里。

3.2 三种“原语”,覆盖所有判断场景

Jev的输出被压缩成三种类型化原语:

  • Choice(选择) :从不超过255个预定义选项中选出一个,同时返回完整概率分布和置信度。
  • Score(评分) :将一个状态放到2到10级的有序评分标准上,返回等级和对应概率。
  • Noul(是非判断) :判断一个陈述是否为真,返回0到1之间的概率值。这个名字来自“null”的变体,是TypeSafe自创的术语。

一个风控系统可以让Jev同时判断某个用户退款风险为低、中还是高(Choice),该交易的紧急程度打几分(Score),以及这笔交易是否存在欺诈嫌疑(Noul)。模型在一次请求中并行返回所有答案,代码拿到的是可以直接和阈值比较的数字。

3.3 数学层面消灭格式幻觉

Jev最根本的技术突破在于:由于它不生成自由文本,结构化输出的格式幻觉在数学层面被彻底消灭了。

传统的结构化输出方案——无论是JSON Mode、Function Calling还是提示词约束——本质上都是在“求”模型按格式输出。模型是有可能“不听话”的。而Jev的架构决定了它只能在预定义的选项空间内作答,输出不是自由字符串,而是类型化的值。用TypeSafe自己的话说: “Building prod, not God” ——造生产系统,而不是造一个无所不能的上帝。

四、速度与成本的降维打击:数据说了什么

4.1 核心性能指标

根据TypeSafe官方公布的数据以及多家独立机构的验证,Jev在适合它的任务上展现出显著优势:

对比维度 Jev(System One) 前沿大语言模型(LLM) 数据来源
端到端延迟 70–500毫秒 3–329秒 TypeSafe官方
输入定价 $0.042/百万Token $0.20–$10/百万Token 多方报道综合
输出定价 免费 通常为输入的3–5倍 TypeSafe官方
单次决策成本 约$0.0004 约$0.03(GPT-5.6 Terra) GreenNode评测
结构化输出错误率 0%(架构保证) 依赖提示词,偶发格式错误 多方验证
峰值提速 — 快193.6倍 TypeSafe内部测试
峰值成本优势 — 低444.6倍 TypeSafe内部测试

4.2 独立评测:光环与真相之间

Jev的光环并非没有折扣。独立评测机构Arize AI进行了一项规模较大的对比测试——在RAGTruth和SummEval两个人工标注数据集上完成了23,325次判断,将Jev与Claude Opus 5和GPT-5.6 Terra进行对比。

结论颇为微妙:在默认0.5阈值下,Jev的表现比Opus 5差了7个百分点。但当研究人员针对人类标注数据对阈值进行校准后,Jev在幻觉检测任务上追平了Claude Opus 5(87%准确率),成本仅为后者的约1/300,速度快23倍。

独到观察:这个结果揭示了一个容易被忽视的事实——对于概率型决策模型,决策阈值的选择比模型本身的选择更重要。Jev输出的不是“是/否”的硬判断,而是“有75%的概率是”这样的软判断。使用者的工程决策(阈值定在哪里)直接影响最终准确率。这意味着Jev的实际效果很大程度上取决于使用者的校准能力,而非模型本身的“聪明程度”。

4.3 在游戏和Agent中的极端测试

TypeSafe做过一个颇为极端的测试:让Jev玩射击游戏Doom。在不需要复杂长线规划、只需要每秒做出约10次即时操作判断的场景下,Jev表现得像一个反应极快的人类玩家,而整套推理成本每小时大约只要7美元。

另一位开发者则将Jev与GPT-6 Astra组成了一套《我的世界》游戏Agent:Astra担任“指挥官”负责长线规划,Jev则负责每一步“该挖哪块石头、该往哪走”的即时判断。最终用8分43秒打赢了末影龙,总花销不到1美元,其中Jev只占了0.01美元。

这些案例指向同一个模式:昂贵的大模型负责规划等“慢思考”,高频、原子化的“快判断”交给轻量决策模型完成。 负责组装与调度这套分工的工程层,在业界被称为Harness。

五、从一个模型到一个生态:Jev的早期落地图谱

5.1 一周2170个项目,八大领域

Jev发布后一周内,GitHub上出现了2170个与Jev相关的公开项目。其中1865个是新建仓库,305个是已有项目接入Jev。

这些项目分布在八个主要领域:

应用领域 典型用法 Jev承担的角色
界面Agent 浏览器自动化操作 决定“点哪里、选哪个”
软件工程 代码审查、风险筛查 判断改动是否有风险
搜索与记忆 结果排序与筛选 评估相关性
安全与治理 内容审核、合规检测 分类与评分
路由与自动化 工具选择、模型调度 选择最优路径
仿真与控制 游戏Agent、机器人 动作选择(占52%)
内容与专业任务 工单分流、文档分类 判断与路由
基础设施 请求分发、负载管理 快速决策

从关注度分布来看,界面Agent和路由与自动化两类合计只占样本项目的19.6%,却获得了63.0%的仓库Stars。这说明开发者社区最看重的,是Jev在“Agent执行层”的决策能力。

5.2 APUS的独立复现:验证范式的可行性

9月19日,中国AI企业APUS公布了全球最早一批针对Jev的独立开源复现成果,以MIT协议向全球开发者开放。APUS在Apple M2 Pro消费级笔记本上实现了完全离线的Jev式决策:真实维基百科检索任务中位耗时约18秒,表单填报和站内导航任务耗时仅3秒左右,全程零云端调用、零API费用,用户数据不出本机。

这一复现的意义超出了技术验证本身。它证明了“用模型做Harness”这一路线在工程上可行,且在闭源API之外,开源权重加端侧算力同样能够支撑该范式。

六、争议与边界:Jev不是什么

6.1 官方承认的九类失效场景

Jev的文档页面坦诚地列出了它不擅长的事情,包括:不会数数、不会比较日期、英文之外的语言准确率偏低、对措辞敏感(把问题写得越谨慎间接,一致率越低)、需要生成文本的任务完全无法处理等。

Redis之父antirez在社交媒体上公开表达了对Jev狂热的质疑。他指出,Jev并没有因此获得复杂推理能力,它主要改变的是语义判断的成本、延迟和输出形式。而且Jev的上下文窗口只有32K token,对于需要了解此前大量上下文的复杂判断任务,数据不足以做出可靠判断。

6.2 可解释性的缺失

在金融、医疗、法律等强监管领域,决策的可追溯性往往是一项硬性要求——审查者需要知道“为什么得出这个结论”。Jev只给出数字和概率,不提供任何推理链或解释。这并非技术缺陷,而是设计取舍:要获得速度和类型的确定性,就必须放弃自由文本的灵活性。但在某些场景中,这个代价可能过高。

6.3 与“高级分类器”的边界之争

有观点认为Jev本质上是一个拥有通用语义理解能力的“智能if语句”——比传统分类器灵活,但比大模型“窄”得多。Earendil首席技术官Armin Ronacher的评价颇为犀利:行业早该想到这类方案,但由于前沿大模型价格低廉且有补贴,开发者一直没有动力另寻出路。Jev的用处显现之后,竞争者会很快出现。

独到判断:Jev的核心创新不在于模型架构上的颠覆。从技术角度看,它更接近一个经过精心训练的、以概率校准为目标的encoder类模型。它真正的创新在于产品定位的精准:在一个被“更大、更强、更通用”叙事主导的行业中,选择做“更小、更快、更专注”的决策组件。这需要的不是技术勇气,而是对软件工程本质的深刻理解——生产系统需要的不是无所不能,而是可靠、可测试、可预测。

七、System One与System Two的分工哲学

7.1 为什么“不生成”是一种超能力

在TypeSafe的设计哲学中,放弃字符串生成不是一种妥协,而是一种主动的战略取舍。字符串是极其强大和通用的输出形式,但代价高昂——它需要逐token解码,需要格式约束,需要后处理解析。而“放弃字符串”反而带来了一系列“超能力”:并行采样、输出零幻觉、输出免费、毫秒级延迟。

这个逻辑链条值得每个做AI产品的人深思:当你放弃一个看似必要的功能时,你获得了什么? 对于Jev来说,答案是一个全新的品类——不是更好的聊天机器人,而是可以像代码库一样被依赖的决策组件。

7.2 从RLHF到RLCD:一条不同的训练路径

Jev的训练方法与主流大模型有着本质区别。Diogo Almeida曾是RLHF(基于人类反馈的强化学习)的核心研究者,但Jev采用的是一种被称为RLCD(Reinforcement Learning for Calibrated Decisions,校准决策强化学习)的新方法。其核心目标是训练模型使得“更高的声明概率意味着更高的正确概率”。

换句话说,当Jev说“这个判断有80%的把握”时,在统计意义上,它的判断确实在约80%的情况下是正确的。这种概率校准能力,是传统大模型很难稳定提供的。Almeida甚至公开表示,RLHF可能是一条弯路,而TypeSafe内部有一半的实验室专门研究合成数据,“自己生成全部训练数据”是他做过的最好的决定。

7.3 未来应用场景的想象

System One模型的应用空间远不止于当前的Agent场景。以下方向值得关注:

机器人控制:机器人需要以毫秒级频率做出“该往左还是往右”“这个物体是否可抓取”的判断。Jev的延迟和成本特征天然适配这类高频决策。

实时风控:在金融交易、支付验证等场景中,每一次决策需要在极短时间内完成,同时给出风险概率。Jev的Choice和Noul原语可以直接嵌入风控管道。

大规模内容治理:当平台每天需要处理数千万条内容审核请求时,单次决策成本从几分钱降到万分之几,带来的成本差异是数量级的。

八、FAQ:关于TypeSafe AI发布新模型Jev的常见问题

Q1:TypeSafe AI发布的新模型Jev到底是什么?

Jev是一个“System One模型”(决策模型),由前OpenAI研究员Diogo Almeida创办的TypeSafe AI于2026年9月15日发布。它与传统大语言模型的核心区别在于:不生成文本,直接输出带校准概率的结构化决策(选择、评分、是非判断)。定位是为软件和Agent提供快速、可靠的判断能力,而非对话或内容生成。

Q2:Jev和ChatGPT、Claude有什么本质区别?

ChatGPT和Claude是“System Two”路线的大语言模型,核心能力是逐token生成自然语言文本,适合写作、推理、对话、代码生成等开放式任务。Jev走的是完全不同的路线:一次并行计算直接返回结构化判断,延迟70–500毫秒,输出零格式错误。两者不是替代关系,而是互补关系——大模型负责规划,Jev负责高频判断。

Q3:Jev的速度和成本优势具体有多大?

在适合Jev的任务上,TypeSafe官方公布的最高数据是比前沿大模型快193.6倍、成本低444.6倍。具体来说,Jev的输入价格为每百万Token 0.042美元,输出免费;端到端延迟70–500毫秒,而前沿大模型通常需要3–329秒。单次结构化决策的成本约为0.0004美元。

Q4:Jev有哪些已知的局限性?

Jev官方文档列出了九类失效场景:不会做算术、不会比较日期、英文之外的语言准确率偏低、对措辞敏感、无法生成任何文本、上下文窗口仅32K token、不能解释推理过程等。它适合分类、路由、评分、审核等结构化判断任务,不适合写作、推理链、多轮对话或任何需要“给理由”的场景。

Q5:开发者现在如何使用Jev?

Jev已通过API全面开放,支持Python SDK、TypeScript SDK,并已接入LiteLLM、OpenRouter、Vercel AI Gateway、LangChain和Pydantic AI等主流开发工具链。开发者可以在console.typesafe.ai获取API Key,按照官方文档的快速上手教程进行集成。

以上内容不代表本平台立场,仅供读者参考