文章摘要
2026年8月19日,OpenAI宣布将CodexHarness智能体底层框架全面开源,开源组件基于Apache-2.0许可发布。该框架是完整的智能体执行系统,核心包括智能体循环逻辑等。其技术经生产验证且有安全机制。与其他框架对比,它采取执行层开源、模型层闭源策略。已在多场景落地,将改变软件开发范式,开发者可按需选择使用模式。

2026年8月19日,OpenAI正式宣布将Codex的底层核心框架——Codex Harness智能体底层框架——作为平台全面开源。这一举动意味着OpenAI把驱动其顶级AI智能体的“发动机”免费开放给全球开发者。Codex Harness智能体底层框架并非一个简单的代码助手,而是一套完整的智能体执行系统,负责管理对话状态、工具调用、沙箱限制和审批机制等核心能力。开源组件包括Codex CLI、Codex SDK和Codex App Server,均基于Apache-2.0许可发布。这一开源动作正在彻底改变软件开发范式的底层逻辑。

OpenAI开源Codex Harness智能体底层框架

Codex Harness智能体底层框架:AI智能体的“最强外骨骼”

大多数人通过Codex App、命令行界面或IDE扩展认识了Codex。但这些产品体验只是同一套底层系统的几种使用方式。为这些体验提供动力的,正是开源Codex Harness智能体底层框架。

什么是Harness?为什么模型不等于智能体

很多人误以为一个强大的AI智能体等于好模型加上好提示词。这是一个根本性的误解。一个真正能在业务中跑起来的智能体,需要一套极其复杂的底层执行系统。它需要理解任务、在漫长的对话中保持记忆、审查相关信息、熟练调用各种工具、对外展示进度、处理崩溃和失败、在关键时刻停下来请求人工审批,最后再返回有用的结果。

这个包揽了所有“脏活累活”的执行系统和智能体循环,就是Harness。OpenAI在官方博客中做出了一个精辟的定义:“一个有能力的智能体,远不止一段提示词和模型响应。它需要理解任务、长期维护上下文、检查相关信息、调用工具、展示进度、处理失败、在必要时请求人工批准,最后返回有用的结果。围绕模型运行的这套执行系统,就是Harness。”

OpenAI开源Codex Harness智能体底层框架,本质上是将这套经过大规模生产验证的执行基础设施向全球开发者开放。

Harness设计如何让模型脱胎换骨

OpenAI给出了非常有说服力的数据来证明Harness设计有多关键。在难度极高的ARC-AGI-3基准测试中,仅仅对Harness进行了两项关键调整——保留推理与上下文压缩——GPT-5.6 Sol模型的得分就从13.3%飙升到了38.3%,同时输出的Token数量减少了六倍。

这个数据揭示了一个深刻的真相:模型能力固然重要,但如何管理这个模型——即Harness的设计——才是决定智能体最终表现的关键。OpenAI开源Codex Harness智能体底层框架,等于把这种“如何管理模型”的工程智慧,变成了人人都可以复用的基础设施。

OpenAI开源Codex Harness智能体底层框架的三大核心组件

为了让开发者能够真正做到“拿来即用”,OpenAI在Apache-2.0许可下,一口气放出了完整的三大开源组件。只要去GitHub上的openai/codex仓库,就能解锁这个强大的武器库。

Codex CLI:命令行入口

Codex CLI是OpenAI开源Codex Harness智能体底层框架的命令行运行入口。它支持交互式和非交互式两种使用方式,适合本地开发、脚本和自动化流水线。在交互模式下,开发者可以在终端中发出自然语言指令,审查提议的更改,并逐个批准或拒绝编辑。

真正具有变革意义的是codex exec子命令——它支持非交互式的一次性任务执行,具有确定的退出码,非常适合脚本、CI/CD管道以及任何不需要人工值守的场景。这意味着OpenAI开源Codex Harness智能体底层框架可以被无缝嵌入到自动化的DevOps工作流中。

Codex SDK:编程接口

Codex SDK是官方提供的编程接口。开发者可以在代码中启动、恢复、流式调用智能体,适合自己写后端服务或应用,精细控制智能体的生命周期。Codex SDK将相同的智能体逻辑暴露为Node.js模块,可以从@openai/codex包中导入智能体类,直接在应用代码中调用方法。

Codex SDK的存在意味着OpenAI开源Codex Harness智能体底层框架不仅仅是一个终端工具,更是一个可以被深度集成的软件组件。

Codex App Server:产品级嵌入

Codex App Server是三者中最具战略意义的一个。它提供本地进程和标准化协议,支持持久对话、实时事件流和审批回调,适合把智能体真正嵌入产品——比如后台系统、运营看板、客服工作台等。通过codex serve命令启动后,它在/exec端点上通过HTTP接收任务负载。产品可以在自己的UI或API网关后面嵌入Codex,而无需通过命令行进程来调用。

Codex App Server加上Codex SDK,让OpenAI开源Codex Harness智能体底层框架真正具备了“平台级”的定位——开发者可以基于它构建自己的智能体产品,而不仅仅是使用一个现成的工具。

开源了什么,没开源什么

需要特别注意的是,OpenAI开源Codex Harness智能体底层框架并非开源了一切。IDE插件(包括VS Code、JetBrains等)、Codex网页版和完整的云端托管产品,以及模型本身,都没有开源。模型仍然需要通过OpenAI API或ChatGPT订阅来使用。

开源的是执行框架和接入层,模型能力和官方托管服务仍然是闭源的。这个边界至关重要——OpenAI开源Codex Harness智能体底层框架,本质上是把“如何运行智能体”的工程能力开放出来,但“智能体的大脑”(模型)依然掌握在OpenAI手中。

Codex Harness智能体底层框架的技术内核解析

Agent Loop:智能体循环的时间骨架

智能体循环是Harness的时间骨架。Codex风格的智能体在专用云沙箱中运行每个任务,拥有自己的文件系统快照。OpenAI开源Codex Harness智能体底层框架的核心,就是这一套经过反复打磨的智能体循环逻辑。

这个循环包括:收集上下文、推理任务、使用工具、在配置的边界内运行、请求审批、持续推进工作。OpenAI将Codex Harness智能体底层框架设计为可复用的智能体循环——不同的应用可以共享同一套执行逻辑,但拥有各自独立的界面、上下文、工具和运行边界。

Rust重构:从原型到生产级系统

OpenAI Codex在2025至2026年间经历了一次重大的技术重构——从一个早期的TypeScript原型重写为以Rust为主体的多入口Harness。重构后的codex-rs是一个Rust工作空间,包含约120个crate。这次重构的意义在于:OpenAI开源Codex Harness智能体底层框架,是一个经过生产级验证的、用系统级语言构建的高性能执行系统。

沙箱与安全:企业级的运行保障

OpenAI开源Codex Harness智能体底层框架内置了严格的沙箱隔离机制。最新版本进一步加强了沙箱的隔离性——限制挂载点、阻止额外的系统调用,减少自动编辑和全自动运行期间的意外文件系统写入。宿主应用可以决定智能体在哪里运行、能够访问哪些文件或工具、哪些操作必须审批、工作过程如何被观察。

这些安全机制使得OpenAI开源Codex Harness智能体底层框架具备了企业级应用的基础——开发者可以在不牺牲安全性的前提下,将智能体嵌入到敏感的业务系统中。

横向对比:Codex Harness vs Claude Agent SDK vs DeepSeek Harness

对比维度 Codex Harness (OpenAI) Claude Agent SDK (Anthropic) DeepSeek Harness
开源协议 Apache-2.0 闭源 MIT
核心定位 可嵌入的Agent执行平台 专有Harness 开放的Agent运行框架
模型绑定 绑定OpenAI系模型 绑定Anthropic系模型 模型可随意更换
离线部署 需要API调用 需要API调用 完全离线部署
主要技术栈 Rust + Node.js 未公开 未公开
核心能力 对话管理、工具调用、沙箱、审批 动态工作流、并行子智能体 多智能体编排、插件化
开源组件 CLI、SDK、App Server 完整框架
基准测试 ARC-AGI-3: 38.3% SWE-bench: 88.6% 待验证

独到见解:开源策略的差异化竞争

从对比中可以看出一条清晰的产业脉络:Anthropic的Claude Code是闭源成品,绑定自家模型;DeepSeek Harness是MIT协议开源、模型随便换、完全离线部署;而OpenAI开源Codex Harness智能体底层框架采取了一条中间路线——执行层开源、模型层闭源

这种策略的精妙之处在于:开源执行层降低了开发者的接入门槛,让更多人围绕Codex生态构建应用;而模型层闭源则确保了OpenAI的核心商业利益不受侵蚀。开发者可以自由使用、修改、嵌入Codex Harness智能体底层框架,但每一次智能体运行所产生的推理调用,最终都会回到OpenAI的API上。这是一种“开源获客、闭源变现”的平台化战略。

Codex Harness智能体底层框架的行业影响与落地场景

告别“通用聊天框”时代

OpenAI在官方博客中一针见血地指出:与其要求每一个团队都把他们原本熟悉的工作流程强行搬到一个通用的代码助手中去,不如把智能体直接带入那些围绕实际工作设计的软件里。

安全分析师看的是预警队列和受影响的服务状态;客服工程师看的是账户历史和产品日志;产品经理看的是需求看板。对于这些真实的从业者来说,重要的不是那个聊天框,而是他们眼前的业务看板。界面的存在是有意义的,它本身就是最重要的上下文。

OpenAI开源Codex Harness智能体底层框架,让开发者可以完全不造聊天框——直接把Harness嵌进用户已经在用的系统里:客服后台、安全仪表盘、运营系统、工单平台。用户继续在熟悉的界面操作,智能体在背后跑完整的执行循环。

真实落地案例

OpenAI开源Codex Harness智能体底层框架已经在多个真实场景中得到验证。包括GitHub和JetBrains的IDE集成、Cisco的App Builder,以及处理了7000份报税单的税务工作流。

更令人震撼的是Codex团队自身的开发实践:2026年2月,Ryan Lopopolo带领一个不到10人的小团队,用5个月时间让Codex写出了超过100万行代码,全程没有手敲一行。整个系统——包括约束条件、反馈循环、文档、代码检查工具和生命周期管理——就是行业现在所说的“Harness”。

Harness Engineering的核心理念是:工程师不再写代码,而是设计环境、明确意图、构建反馈回路,让AI智能体可靠地完成工作。OpenAI开源Codex Harness智能体底层框架,正是把这种“Harness Engineering”的方法论产品化了。

对软件开发范式的深远影响

OpenAI开源Codex Harness智能体底层框架,正在重新划定IDE与编码智能体的分工边界。通过将模型与Harness一同开发,开发者能更好地理解模型的行为——这也是Codex作为一个集成了模型和Harness的系统的核心优势。

从更宏观的视角来看,OpenAI开源Codex Harness智能体底层框架标志着AI智能体竞争的一个拐点:竞争正在从“谁的模型更强”转向“谁的Harness更好”。未来大量智能体产品的差异,会落在模型之外的这套执行系统上。

开发者如何上手Codex Harness智能体底层框架

安装与快速开始

Codex CLI基于Node.js构建,最快的方式是通过npm全局安装:

npm install -g @openai/codex

安装完成后,可以通过codex --help确认版本和支持的功能。

三种使用模式的选择

OpenAI开源Codex Harness智能体底层框架提供了三种不同的使用模式,分别对应不同的场景:

  1. 交互式CLI:直接在终端输入codex,进入提示驱动的会话模式,适合探索性任务和结对编程。

  2. 编程式SDK:在Node.js应用中导入@openai/codex包,程序化地启动、恢复和流式调用智能体。

  3. App Server:运行codex serve启动HTTP服务,通过/exec端点接收任务,适合将智能体嵌入Web应用和后端服务。

官方的建议是:你的应用负责提供上下文、业务规则和工具,Codex Harness智能体底层框架负责底下的智能体循环和沙箱执行。

集成注意事项

使用OpenAI开源Codex Harness智能体底层框架需要注意几点:推理仍需要OpenAI API的认证和订阅;沙箱在自动编辑模式下会限制文件系统写入;建议查阅GitHub上的changelog确认版本特性。

FAQ

问:OpenAI开源Codex Harness智能体底层框架,到底开源了什么?

开源的是Codex CLI、Codex SDK和Codex App Server三大组件,均基于Apache-2.0许可。这些组件构成了驱动智能体运行的完整执行层——包括对话状态管理、工具调用、沙箱限制、审批机制和多轮任务推进。模型本身、IDE插件和云端托管服务仍然是闭源的。

问:Codex Harness和普通的OpenAI API调用有什么区别?

直接调用OpenAI API只能获得模型的原生响应。而Codex Harness智能体底层框架在API之上封装了一整套执行系统——包括上下文收集、多轮状态管理、沙箱隔离、工具调用编排、审批流程和错误处理。你不需要自己从零构建这些能力。

问:使用Codex Harness需要OpenAI的API密钥吗?

是的。Codex Harness智能体底层框架开源的是执行代码,但推理仍然需要通过OpenAI API或ChatGPT订阅来调用模型。代码本身可以自由检查和修改,但运行时的模型调用需要认证。

问:Codex Harness可以在没有网络的环境下使用吗?

Codex Harness智能体底层框架的代码可以在本地运行,但模型推理需要调用OpenAI的API服务,因此需要网络连接。与之对比,DeepSeek Harness支持完全离线部署。

问:Codex Harness和Claude Agent SDK有什么区别?

Claude Code是Anthropic的专有Harness,紧密集成Claude模型家族。而OpenAI开源Codex Harness智能体底层框架是开源的,两者在开源策略、模型绑定和技术栈上都有显著差异。从Harness角度看,Codex更关注本地执行、安全沙箱和开发者命令行体验。

问:Codex Harness适合哪些应用场景?

适合需要将AI智能体嵌入现有产品的场景——工程工作流、运营面板、安全调查、客户支持控制台,或者为某个专业团队打造的内部应用。也适合CI/CD自动化、批处理任务和后台服务集成。

问:Codex Harness的ARC-AGI-3测试成绩意味着什么?

在ARC-AGI-3基准测试中,仅仅调整Harness的两项设置就让GPT-5.6 Sol的得分从13.3%提升到38.3%,同时减少六倍的输出Token。这说明Harness的设计对智能体的实际表现有着决定性的影响——甚至超过了模型本身的能力差异。

以上内容不代表本平台立场,仅供读者参考