Codex Harness 评测:把 OpenAI 的智能体运行时拆开给你看

想把 OpenAI 的智能体跑在自己产品里,又不想从零写 agent loop?Codex Harness 把驱动 Codex 的整套运行时开源了,沙箱、审批、工具调用全交到你手上。

产品概述

Codex Harness 是 OpenAI 在 2026 年 8 月 19 日一篇平台文章里正式定名的那套东西:驱动 Codex App、Codex CLI 和 VS Code 插件的底层 agent 执行框架。它管的不是模型怎么思考,而是模型之外那一整套执行系统,包括上下文维护、工具调用、沙箱隔离和人工审批。

很多人把 agent 理解成强模型加长 Prompt 加几个工具,但能跑生产的 agent 远不止这些。Codex Harness 就是把这套常被低估的执行层做成了可以白拿、可以改、可以嵌的基础设施。仓库早在 2025 年 4 月 13 日就创建了,一直挂着 Apache-2.0 许可证。

截至 2026 年 8 月,openai/codex 已经涨到约 11.4 万星,Rust 核心代码约 78 万行。最新稳定版是 v0.149.0(2026-08-20)。

官网:https://openai.com/codex | 项目地址:https://github.com/openai/codex

Codex Harness 评测:把 OpenAI 的智能体运行时拆开给你看

这次所谓的开源,严格说是一次平台化定位升级,不是凭空扔出新仓库。真正变化在于:app-server 的 JSON-RPC 协议被官方文档化,TypeScript 和 Python 两套 SDK 转正,OpenAI 明确邀请你在这一层上搭产品。模型权重和官方托管的 Cloud 服务依然闭源。

核心功能

聊完它是什么,接下来看这套运行时到底把哪些能力打包好了,以及它凭什么敢叫 harness 而不是壳。

第一层是三种接入方式。最轻的是 codex exec,一条命令跑完非交互任务,适合 CI 和脚本。再往上是官方 Codex SDK(TypeScript 和 Python),让你在代码里启动、恢复、流转 agent 任务。最重的是 app-server,一个常驻进程,用双向 JSON-RPC 把 IDE 和桌面 App 接进来。

第二层是 agent loop 本身。Core 负责对话历史、工具规范、流式采样、并发回填、中断恢复和上下文压缩。你给它一个任务,它自己组装 Prompt、调用模型、识别输出项、跑工具、把结果写回历史,然后判断要不要再采一轮。

Codex Harness 评测:把 OpenAI 的智能体运行时拆开给你看

第三层是三个核心原语。Thread 是一段可恢复、可分叉的会话;Turn 是单轮用户到 agent 的交换;Item 是会话里最细的事件,包括消息、命令、文件改动和工具结果。宿主应用拥有界面和业务上下文,app-server 拥有稳定的客户端协议,Core 拥有执行状态机,边界清清楚楚。

第四层是两个独立的安全旋钮。沙箱模式决定 agent 技术上能碰什么(只读、工作区可写、或完全放开),审批策略决定它什么时候必须问你。两者解耦,信任可以分级给,而不是一刀切。沙箱在 macOS 用 Seatbelt、Linux 用 Landlock 加 seccomp、Windows 还是实验性的 AppContainer。

最值得说的一组数据是 ARC-AGI-3。同一个 GPT-5.6 Sol 模型,只靠 harness 的两项优化(保留推理轨迹、上下文压缩),得分从 13.3% 涨到 38.3%,输出 token 降到约六分之一。模型没换,效果差近三倍,这恰恰是 harness 价值的硬证据,也说明长任务里 agent 更多是栽在上下文散掉,而不是模型变笨。

上手体验

光看架构不过瘾,实际跑一遍才清楚它到底好用在哪,以及第一次上手会撞到什么。

安装就一行:npm install -g @openai/codex,Node 22 以上即可。Windows 现在原生支持 PowerShell,早期版本得靠 WSL。登录用 codex login 走 ChatGPT 账号,账号里自带 Codex 额度,不用单独配 key,这对个人开发者是最省心的一点。

Codex Harness 评测:把 OpenAI 的智能体运行时拆开给你看

进交互会话后,最顺手的用法是给一个带验证步骤的工单式指令,比如先读某个文件、跑现有测试、收尾开个 PR。它基本能一次跑通,省掉反复对白的损耗,不像有些 agent 要你三四个来回才搞懂意图。

第一印象是稳。默认网络是关的,agent 在工作区里随便改文件都不打断你,一旦要出网才弹审批。这种默认收敛的设定,比很多一上来就全权限的 agent 让人安心,也更适合把它当承包商派活、事后验收的协作方式。

使用技巧

很多人不知道,Codex 的沙箱和审批其实是两套独立开关,分开调能既安全又省心,别被默认档位框死。

  • 用 .codexignore 排除 node_modules、构建产物等目录,能明显压低输入 token,单次任务成本直接下来,大模型仓库尤其明显。
  • 把 --sandbox workspace-write 和 --ask-for-approval on-request 组合成 Auto 预设,工作区内自主要、出界才问,日常最舒服。
  • CI 里跑无人值守修复,用 codex exec 配 --ask-for-approval never,只读模式永不停在提问上,适合接 GitHub Action。
  • reasoningEffort 调到 max 或 ultra(v0.149.0 新增)适合难的跨文件重构,普通脚本用 mini 更省,别无脑拉满。
  • 写一份 AGENTS.md 放在仓库根,把约定、安全预期、审查重点说清楚,Codex 会自动读并据此收敛行为。

Codex Harness 评测:把 OpenAI 的智能体运行时拆开给你看

竞品对比

三大终端 agent 里,Codex 的差异化位置最清晰。下面这张表按截至 2026 年 8 月的公开信息整理,参数类数据来自各项目文档与社区实测。

维度 Codex Harness / CLI Claude Code Gemini CLI
开源协议 Apache-2.0 闭源 Apache-2.0
核心语言 Rust + TypeScript TypeScript TypeScript
上下文窗口 约 200K 约 200K 约 1M
沙箱 Seatbelt / Landlock 本地权限系统 可配信任文件夹
审批模式 建议 / 自动改 / 全自动 逐动作确认 信任文件夹 + YOLO
免费层 需 ChatGPT 订阅 无独立免费层 个人账户每日 1000 次
底层模型 codex-mini / codex-1 Claude Opus / Sonnet Gemini 2.5 Pro
定位 快活、异步派活 大活、深度重构 多模态、大上下文

Claude Code 强在大型项目的架构级修改,Gemini CLI 赢在百万级上下文和多模态输入。Codex 的杀手锏是开源运行时加内置沙箱,适合把它当承包商派活、事后验收,而不是当结对程序员盯着它打字。三款都能同时装,按活切换最划算。

用户反馈

社区对这次开源整体偏正面,但也有几处被反复吐槽,挑重点说。

正面来看,开发者普遍认可把生产级 agent 运行时直接开放的价值,省掉自己造轮子的成本。内置沙箱加审批的默认收敛设定,被不少人称为最让人放心的终端 agent。还有人实测 Plus 档跑一整天也很难撞额度上限,性价比直接拉满,这是闭源竞品很难给到的。

负面声音集中在几点。Windows 原生沙箱仍是实验性,世界可写目录拦不住写入,合规场景只能回 WSL。模型名换来换去(codex-mini、codex-1、GPT-5-Codex 混着叫)让人选型头疼。纯 CLI 在多文件大重构上公认弱于 Claude Code,网络默认关闭也带来一些摩擦。

多维评分

逐项拉一遍,看看这套运行时到底值几分,维度按技能固定八维走。

维度 权重 星级 一句话解读
功能完整性 20% ⭐⭐⭐⭐⭐ agent loop、沙箱、审批、工具全开源
易用性 15% ⭐⭐⭐⭐ 一行装好,但配置项需要摸清
性能表现 15% ⭐⭐⭐⭐ ARC-AGI-3 验证 harness 增益明显
AI 能力 15% ⭐⭐⭐⭐ 上限看模型,工程落地稳
价格合理性 10% ⭐⭐⭐⭐⭐ 捆绑 ChatGPT,几乎白送
生态集成 10% ⭐⭐⭐⭐ MCP、SDK、GitHub Action 齐活
文档与支持 10% ⭐⭐⭐ 平台化后改善,仍偏工程向
更新频率 5% ⭐⭐⭐⭐⭐ 仓库极活跃,周级迭代

加权综合约  85 分。扣分主要在 Windows 沙箱和文档成熟度,这两项对生产接入影响最直接,等它们补齐,分数还能往上走。

优缺点

优点:

  • 完整 agent 运行时开源,Apache-2.0 可商用可改,生产验证过。
  • 沙箱与审批双旋钮解耦,信任分级给,安全默认收敛。
  • 三层集成面(exec / SDK / app-server)覆盖脚本到产品内嵌。
  • ARC-AGI-3 用同一模型证明 harness 比模型升级更见效。
  • 定价捆绑 ChatGPT 订阅,个体开发者近乎零边际成本。

缺点:

  • Windows 原生沙箱仍是实验性,隔离有漏洞,合规场景只能走 WSL。
  • 模型命名体系混乱,codex-mini、codex-1、GPT-5-Codex 并存,选型成本高。
  • 纯 CLI 在大型多文件重构上弱于 Claude Code,深度架构改动不是它的强项。
  • 网络默认关闭,出网操作需手动放行,日常有少量摩擦。
  • 官方 IDE 扩展和 Codex Cloud 本体未开源,只开放了运行时这一层。

适用人群

已经订阅 ChatGPT、想顺手用上 agentic coding 的个体开发者,这是零额外成本的选择,订阅费里已经含了。

要把 agent 嵌进自家产品的团队,直接拿 SDK 或 app-server 协议接,省掉自研执行层,把精力放在业务和 UI 上。

在 CI/CD 里跑无人值守修复、依赖升级、文档同步的团队,exec 加 GitHub Action 是现成范式,接进去就能用。

对沙箱隔离和人工审批有硬要求的合规场景,默认收敛的安全模型比多数竞品省心,至少不用自己从零搭隔离。

想搞懂现代 agent 架构的人,读这套 Rust 源码比看任何博客都直接,它是目前最难得的、经过生产检验还开源的实现。

定价方案

截至 2026 年 8 月,Codex 没有独立的按席位账单,能力随 ChatGPT 订阅打包,对个体最友好。

方案 价格 适合谁
ChatGPT Plus $20 / 月 个人开发者,额度够日常
ChatGPT Business $25 / 用户 / 月 小团队,带管理和共享空间
ChatGPT Pro $200 / 月 重度用户,近乎不限量
API codex-mini $1.5 入 / $6 出 每百万 token 自嵌脚本与 CI,75% 缓存折扣
API codex $2 入 / $8 出 每百万 token 复杂任务走完整模型

走 API 最划算的是 codex-mini,中等任务单次约五分钱,比订阅更适合变量用法。选 Plus 的人基本等于白用 Codex,这也是它价格合理性拿满分的原因。

FAQ

把大家最容易卡住的问题先列一遍,能少踩不少坑。

Q1:Codex Harness 和 Codex CLI 到底什么关系?

A1:CLI 只是 Harness 的一个外壳。 Harness 是底层运行时,CLI、App、IDE 插件都跑在同一套 Core 和 app-server 之上,你天天用的 CLI 早就在跑这套 harness 了。

Q2:它真开源吗,哪些没开放?

A2:运行时和集成层是真开源。 仓库 Apache-2.0,含 Rust 核心、CLI、app-server、TS/Py SDK。但模型权重、官方 Codex Cloud、IDE 扩展本体仍闭源,运行官方模型需账号或 API 权限。

Q3:沙箱安全吗,Windows 上呢?

A3:macOS 和 Linux 较稳,Windows 仍实验性。 前两者用系统级隔离,默认断网。Windows 原生沙箱用 AppContainer,拦不住世界可写目录的写入,合规场景建议走 WSL。

Q4:能在 CI 里无人值守跑吗?

A4:可以,而且是第一公民能力。 用 codex exec 配 --ask-for-approval never,再接 openai/codex-action,就能在流水线里自动修构建、审 PR、同步文档。

Q5:模型名太多怎么选?

A5:普通活选 codex-mini,难活选 codex-1。 mini 便宜且快,适合脚本和单文件;复杂跨文件重构上完整 codex 模型,API 走 GPT-5-Codex 系列定价。

Q6:和 Claude Code 比谁更强?

A6:看任务类型,没有通杀。 大重构和架构改动 Claude Code 更强,快速派活、异步跑、要开源运行时和内置沙箱就选 Codex。很多团队两个都装,按活切换。

Q7:它免费吗?

A7:CLI 不单独收费,但需 ChatGPT 订阅。 最低 Plus 20 美元每月即含 Codex 额度;纯接 API 按 token 付费,无订阅也能用。SDK 本身开源免费。

Q8:能换别的模型吗,比如 DeepSeek 或本地?

A8:模型提供方是可抽象层,理论上能换。 model-provider 抽象允许指向任意 OpenAI 兼容端点,社区已有人接 gpt-oss 本地模型。但官方支持度和效果以 OpenAI 模型最佳。

Q9:app-server 那个协议能干嘛?

A9:把 agent 嵌进你自己的产品。 它用 JSON-RPC 暴露 thread、turn、item 三个原语,宿主应用能维持长会话、收事件流、发自定义工具、处理审批请求,不依赖聊天框。

Q10:学习成本高吗?

A10:用起来低,调优中等。 装好登录就能派活;想玩转 sandbox、approval、profile、AGENTS.md 和 SDK 内嵌,需要读一遍官方协议文档,偏工程向。

Q11:国内能直接用吗?

A11:直连有门槛,需海外 API 访问。 Codex 走 OpenAI 接口,国内网络不稳且要外币卡。可用 WSL 加代理,或等国内兼容接入方案,但不在官方支持范围。

Q12:更新频率怎么样?

A12:极快,周级甚至日级。 仓库约 11.4 万星、数百贡献者,v0.149.0 之后紧跟 0.150 alpha。平台化后文档和 SDK 也在补全,跟进成本高但生命力强。

结尾

Codex Harness 最值得记住的一点:它把模型之外的执行系统做成了可以白拿、可以改、可以嵌的基础设施。ARC-AGI-3 上同一模型三倍差的结论,比任何宣传都实在,也重新定义了 harness 和模型谁更值钱这个问题。

对个体开发者,它是 ChatGPT 订阅里顺手多出来的一份能力,不额外花钱就能用上 agentic coding。对做产品的团队,它是少见的、经过生产验证还开源的 agent 运行时,省下的自研成本按年算都不是小数。

短板也别装看不见:Windows 沙箱、文档成熟度、模型命名混乱,这三处直接影响生产接入体验。等它们补齐,这套运行时会是从 CLI 到平台都难绕开的那一层,现在入手正是读源码和建设的最佳窗口。

AI工具

从用户意图到三端原生界面:高德端云一体化的生成式 UI 实践

2026-8-25 18:30:42

行业动态

OpenAI首款ChatGPT浏览器发布!现在就能免费下载使用

2025-10-22 8:36:23

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧