想把 OpenAI 的智能体跑在自己产品里,又不想从零写 agent loop?Codex Harness 把驱动 Codex 的整套运行时开源了,沙箱、审批、工具调用全交到你手上。
产品概述
Codex Harness 是 OpenAI 在 2026 年 8 月 19 日一篇平台文章里正式定名的那套东西:驱动 Codex App、Codex CLI 和 VS Code 插件的底层 agent 执行框架。它管的不是模型怎么思考,而是模型之外那一整套执行系统,包括上下文维护、工具调用、沙箱隔离和人工审批。
很多人把 agent 理解成强模型加长 Prompt 加几个工具,但能跑生产的 agent 远不止这些。Codex Harness 就是把这套常被低估的执行层做成了可以白拿、可以改、可以嵌的基础设施。仓库早在 2025 年 4 月 13 日就创建了,一直挂着 Apache-2.0 许可证。
截至 2026 年 8 月,openai/codex 已经涨到约 11.4 万星,Rust 核心代码约 78 万行。最新稳定版是 v0.149.0(2026-08-20)。
官网:https://openai.com/codex | 项目地址:https://github.com/openai/codex

这次所谓的开源,严格说是一次平台化定位升级,不是凭空扔出新仓库。真正变化在于:app-server 的 JSON-RPC 协议被官方文档化,TypeScript 和 Python 两套 SDK 转正,OpenAI 明确邀请你在这一层上搭产品。模型权重和官方托管的 Cloud 服务依然闭源。
核心功能
聊完它是什么,接下来看这套运行时到底把哪些能力打包好了,以及它凭什么敢叫 harness 而不是壳。
第一层是三种接入方式。最轻的是 codex exec,一条命令跑完非交互任务,适合 CI 和脚本。再往上是官方 Codex SDK(TypeScript 和 Python),让你在代码里启动、恢复、流转 agent 任务。最重的是 app-server,一个常驻进程,用双向 JSON-RPC 把 IDE 和桌面 App 接进来。
第二层是 agent loop 本身。Core 负责对话历史、工具规范、流式采样、并发回填、中断恢复和上下文压缩。你给它一个任务,它自己组装 Prompt、调用模型、识别输出项、跑工具、把结果写回历史,然后判断要不要再采一轮。

第三层是三个核心原语。Thread 是一段可恢复、可分叉的会话;Turn 是单轮用户到 agent 的交换;Item 是会话里最细的事件,包括消息、命令、文件改动和工具结果。宿主应用拥有界面和业务上下文,app-server 拥有稳定的客户端协议,Core 拥有执行状态机,边界清清楚楚。
第四层是两个独立的安全旋钮。沙箱模式决定 agent 技术上能碰什么(只读、工作区可写、或完全放开),审批策略决定它什么时候必须问你。两者解耦,信任可以分级给,而不是一刀切。沙箱在 macOS 用 Seatbelt、Linux 用 Landlock 加 seccomp、Windows 还是实验性的 AppContainer。
最值得说的一组数据是 ARC-AGI-3。同一个 GPT-5.6 Sol 模型,只靠 harness 的两项优化(保留推理轨迹、上下文压缩),得分从 13.3% 涨到 38.3%,输出 token 降到约六分之一。模型没换,效果差近三倍,这恰恰是 harness 价值的硬证据,也说明长任务里 agent 更多是栽在上下文散掉,而不是模型变笨。
上手体验
光看架构不过瘾,实际跑一遍才清楚它到底好用在哪,以及第一次上手会撞到什么。
安装就一行:npm install -g @openai/codex,Node 22 以上即可。Windows 现在原生支持 PowerShell,早期版本得靠 WSL。登录用 codex login 走 ChatGPT 账号,账号里自带 Codex 额度,不用单独配 key,这对个人开发者是最省心的一点。

进交互会话后,最顺手的用法是给一个带验证步骤的工单式指令,比如先读某个文件、跑现有测试、收尾开个 PR。它基本能一次跑通,省掉反复对白的损耗,不像有些 agent 要你三四个来回才搞懂意图。
第一印象是稳。默认网络是关的,agent 在工作区里随便改文件都不打断你,一旦要出网才弹审批。这种默认收敛的设定,比很多一上来就全权限的 agent 让人安心,也更适合把它当承包商派活、事后验收的协作方式。
使用技巧
很多人不知道,Codex 的沙箱和审批其实是两套独立开关,分开调能既安全又省心,别被默认档位框死。
-
用 .codexignore排除 node_modules、构建产物等目录,能明显压低输入 token,单次任务成本直接下来,大模型仓库尤其明显。 -
把 --sandbox workspace-write和--ask-for-approval on-request组合成 Auto 预设,工作区内自主要、出界才问,日常最舒服。 -
CI 里跑无人值守修复,用 codex exec配--ask-for-approval never,只读模式永不停在提问上,适合接 GitHub Action。 -
reasoningEffort调到max或ultra(v0.149.0 新增)适合难的跨文件重构,普通脚本用 mini 更省,别无脑拉满。 -
写一份 AGENTS.md放在仓库根,把约定、安全预期、审查重点说清楚,Codex 会自动读并据此收敛行为。
竞品对比
三大终端 agent 里,Codex 的差异化位置最清晰。下面这张表按截至 2026 年 8 月的公开信息整理,参数类数据来自各项目文档与社区实测。
| 维度 | Codex Harness / CLI | Claude Code | Gemini CLI |
|---|---|---|---|
| 开源协议 | Apache-2.0 | 闭源 | Apache-2.0 |
| 核心语言 | Rust + TypeScript | TypeScript | TypeScript |
| 上下文窗口 | 约 200K | 约 200K | 约 1M |
| 沙箱 | Seatbelt / Landlock | 本地权限系统 | 可配信任文件夹 |
| 审批模式 | 建议 / 自动改 / 全自动 | 逐动作确认 | 信任文件夹 + YOLO |
| 免费层 | 需 ChatGPT 订阅 | 无独立免费层 | 个人账户每日 1000 次 |
| 底层模型 | codex-mini / codex-1 | Claude Opus / Sonnet | Gemini 2.5 Pro |
| 定位 | 快活、异步派活 | 大活、深度重构 | 多模态、大上下文 |
Claude Code 强在大型项目的架构级修改,Gemini CLI 赢在百万级上下文和多模态输入。Codex 的杀手锏是开源运行时加内置沙箱,适合把它当承包商派活、事后验收,而不是当结对程序员盯着它打字。三款都能同时装,按活切换最划算。
用户反馈
社区对这次开源整体偏正面,但也有几处被反复吐槽,挑重点说。
正面来看,开发者普遍认可把生产级 agent 运行时直接开放的价值,省掉自己造轮子的成本。内置沙箱加审批的默认收敛设定,被不少人称为最让人放心的终端 agent。还有人实测 Plus 档跑一整天也很难撞额度上限,性价比直接拉满,这是闭源竞品很难给到的。
负面声音集中在几点。Windows 原生沙箱仍是实验性,世界可写目录拦不住写入,合规场景只能回 WSL。模型名换来换去(codex-mini、codex-1、GPT-5-Codex 混着叫)让人选型头疼。纯 CLI 在多文件大重构上公认弱于 Claude Code,网络默认关闭也带来一些摩擦。
多维评分
逐项拉一遍,看看这套运行时到底值几分,维度按技能固定八维走。
| 维度 | 权重 | 星级 | 一句话解读 |
|---|---|---|---|
| 功能完整性 | 20% | ⭐⭐⭐⭐⭐ | agent loop、沙箱、审批、工具全开源 |
| 易用性 | 15% | ⭐⭐⭐⭐ | 一行装好,但配置项需要摸清 |
| 性能表现 | 15% | ⭐⭐⭐⭐ | ARC-AGI-3 验证 harness 增益明显 |
| AI 能力 | 15% | ⭐⭐⭐⭐ | 上限看模型,工程落地稳 |
| 价格合理性 | 10% | ⭐⭐⭐⭐⭐ | 捆绑 ChatGPT,几乎白送 |
| 生态集成 | 10% | ⭐⭐⭐⭐ | MCP、SDK、GitHub Action 齐活 |
| 文档与支持 | 10% | ⭐⭐⭐ | 平台化后改善,仍偏工程向 |
| 更新频率 | 5% | ⭐⭐⭐⭐⭐ | 仓库极活跃,周级迭代 |
加权综合约 85 分。扣分主要在 Windows 沙箱和文档成熟度,这两项对生产接入影响最直接,等它们补齐,分数还能往上走。
优缺点
优点:
-
完整 agent 运行时开源,Apache-2.0 可商用可改,生产验证过。 -
沙箱与审批双旋钮解耦,信任分级给,安全默认收敛。 -
三层集成面(exec / SDK / app-server)覆盖脚本到产品内嵌。 -
ARC-AGI-3 用同一模型证明 harness 比模型升级更见效。 -
定价捆绑 ChatGPT 订阅,个体开发者近乎零边际成本。
缺点:
-
Windows 原生沙箱仍是实验性,隔离有漏洞,合规场景只能走 WSL。 -
模型命名体系混乱,codex-mini、codex-1、GPT-5-Codex 并存,选型成本高。 -
纯 CLI 在大型多文件重构上弱于 Claude Code,深度架构改动不是它的强项。 -
网络默认关闭,出网操作需手动放行,日常有少量摩擦。 -
官方 IDE 扩展和 Codex Cloud 本体未开源,只开放了运行时这一层。
适用人群
已经订阅 ChatGPT、想顺手用上 agentic coding 的个体开发者,这是零额外成本的选择,订阅费里已经含了。
要把 agent 嵌进自家产品的团队,直接拿 SDK 或 app-server 协议接,省掉自研执行层,把精力放在业务和 UI 上。
在 CI/CD 里跑无人值守修复、依赖升级、文档同步的团队,exec 加 GitHub Action 是现成范式,接进去就能用。
对沙箱隔离和人工审批有硬要求的合规场景,默认收敛的安全模型比多数竞品省心,至少不用自己从零搭隔离。
想搞懂现代 agent 架构的人,读这套 Rust 源码比看任何博客都直接,它是目前最难得的、经过生产检验还开源的实现。
定价方案
截至 2026 年 8 月,Codex 没有独立的按席位账单,能力随 ChatGPT 订阅打包,对个体最友好。
| 方案 | 价格 | 适合谁 |
|---|---|---|
| ChatGPT Plus | $20 / 月 | 个人开发者,额度够日常 |
| ChatGPT Business | $25 / 用户 / 月 | 小团队,带管理和共享空间 |
| ChatGPT Pro | $200 / 月 | 重度用户,近乎不限量 |
| API codex-mini | $1.5 入 / $6 出 每百万 token | 自嵌脚本与 CI,75% 缓存折扣 |
| API codex | $2 入 / $8 出 每百万 token | 复杂任务走完整模型 |
走 API 最划算的是 codex-mini,中等任务单次约五分钱,比订阅更适合变量用法。选 Plus 的人基本等于白用 Codex,这也是它价格合理性拿满分的原因。
FAQ
把大家最容易卡住的问题先列一遍,能少踩不少坑。
Q1:Codex Harness 和 Codex CLI 到底什么关系?
A1:CLI 只是 Harness 的一个外壳。 Harness 是底层运行时,CLI、App、IDE 插件都跑在同一套 Core 和 app-server 之上,你天天用的 CLI 早就在跑这套 harness 了。
Q2:它真开源吗,哪些没开放?
A2:运行时和集成层是真开源。 仓库 Apache-2.0,含 Rust 核心、CLI、app-server、TS/Py SDK。但模型权重、官方 Codex Cloud、IDE 扩展本体仍闭源,运行官方模型需账号或 API 权限。
Q3:沙箱安全吗,Windows 上呢?
A3:macOS 和 Linux 较稳,Windows 仍实验性。 前两者用系统级隔离,默认断网。Windows 原生沙箱用 AppContainer,拦不住世界可写目录的写入,合规场景建议走 WSL。
Q4:能在 CI 里无人值守跑吗?
A4:可以,而且是第一公民能力。 用 codex exec 配 --ask-for-approval never,再接 openai/codex-action,就能在流水线里自动修构建、审 PR、同步文档。
Q5:模型名太多怎么选?
A5:普通活选 codex-mini,难活选 codex-1。 mini 便宜且快,适合脚本和单文件;复杂跨文件重构上完整 codex 模型,API 走 GPT-5-Codex 系列定价。
Q6:和 Claude Code 比谁更强?
A6:看任务类型,没有通杀。 大重构和架构改动 Claude Code 更强,快速派活、异步跑、要开源运行时和内置沙箱就选 Codex。很多团队两个都装,按活切换。
Q7:它免费吗?
A7:CLI 不单独收费,但需 ChatGPT 订阅。 最低 Plus 20 美元每月即含 Codex 额度;纯接 API 按 token 付费,无订阅也能用。SDK 本身开源免费。
Q8:能换别的模型吗,比如 DeepSeek 或本地?
A8:模型提供方是可抽象层,理论上能换。 model-provider 抽象允许指向任意 OpenAI 兼容端点,社区已有人接 gpt-oss 本地模型。但官方支持度和效果以 OpenAI 模型最佳。
Q9:app-server 那个协议能干嘛?
A9:把 agent 嵌进你自己的产品。 它用 JSON-RPC 暴露 thread、turn、item 三个原语,宿主应用能维持长会话、收事件流、发自定义工具、处理审批请求,不依赖聊天框。
Q10:学习成本高吗?
A10:用起来低,调优中等。 装好登录就能派活;想玩转 sandbox、approval、profile、AGENTS.md 和 SDK 内嵌,需要读一遍官方协议文档,偏工程向。
Q11:国内能直接用吗?
A11:直连有门槛,需海外 API 访问。 Codex 走 OpenAI 接口,国内网络不稳且要外币卡。可用 WSL 加代理,或等国内兼容接入方案,但不在官方支持范围。
Q12:更新频率怎么样?
A12:极快,周级甚至日级。 仓库约 11.4 万星、数百贡献者,v0.149.0 之后紧跟 0.150 alpha。平台化后文档和 SDK 也在补全,跟进成本高但生命力强。
结尾
Codex Harness 最值得记住的一点:它把模型之外的执行系统做成了可以白拿、可以改、可以嵌的基础设施。ARC-AGI-3 上同一模型三倍差的结论,比任何宣传都实在,也重新定义了 harness 和模型谁更值钱这个问题。
对个体开发者,它是 ChatGPT 订阅里顺手多出来的一份能力,不额外花钱就能用上 agentic coding。对做产品的团队,它是少见的、经过生产验证还开源的 agent 运行时,省下的自研成本按年算都不是小数。
短板也别装看不见:Windows 沙箱、文档成熟度、模型命名混乱,这三处直接影响生产接入体验。等它们补齐,这套运行时会是从 CLI 到平台都难绕开的那一层,现在入手正是读源码和建设的最佳窗口。


