Prime Agent:一个会改自己脚手架的编码 Agent

8 月 5 日,Prime Intellect 把一个叫 Prime Agent 的项目丢上了 GitHub。当天它就冲进了 Hacker News 首页,一周内攒下 8,500 多颗 Star。到现在(2026 年 8 月中旬),这个仓库已经站稳 1.4 万 Star 上下,MIT 协议,对开发者完全敞开。

引爆讨论的是一组数字:官方称,用 Claude Opus 5 驱动时,Prime Agent 在 ARC-AGI-3 上拿到 95.5% 的 RHAE Best@1,超过官方报告的人类专家基线 95.4%。三次运行分别是 95.0、95.2、95.5,Best@3 冲到 99.97%,183 个关卡全部完成。

Prime Agent:一个会改自己脚手架的编码 Agent

这几个数字一出来,Hacker News 和 Reddit 就撕起来了。有人说这是范式革命,有人只回了句”subagents 本质上还是 function call”。争议的核心就一个:这套”自我改进”脚手架,到底是不是在刷榜。

这篇文章不打算站队。我想拆开看的是三件事:RLM 这个抽象到底新在哪,/refine 自改进的边界在哪,以及最重要的,你现在该不该为它折腾一套环境。那先说最该问的:它凭什么值得 1.4 万人点 Star?

打动我的几个地方

Prime Agent 的定位是 coding harness,就是套在模型外面、把它变成 Agent 的那层脚手架。它没从零造,TUI 和 Agent 主体构建在 Mario Zechner 的开源项目 pi 之上,仓库里已经有 4,400 多个提交。真正有意思的是它对脚手架的态度。

主流做法里,Claude Code、Codex 把工具集和子代理规范在出厂时预设好,运行中基本不动。Prime Agent 反着来:模型变强了,脚手架不该停在上一代。它基于自家两篇论文设计了两个抽象,RLM 和 Continual Harness。

RLM 全称 Recursive Language Model,核心一句话:把上下文当变量,把子代理调用当函数调用。模型只有一个内置工具,一个持久的 IPython 内核。文件操作、Shell 命令、数据查询,全通过生成 Python 代码完成,读进来的数据存进变量里,要用的时候编程式取用。

这个设计直接对准了”上下文腐烂”这个老问题。传统 Agent 快撑满上下文时,会把前面的内容压成摘要,一压细节就丢。Prime Agent 不这么做,它让模型把大段内容先丢进变量,按需筛选、搜索、计算,再把真正要的结果拿回来,原始内容不用全部重新读进对话。

子代理也是同样思路。rlm() 是一个异步函数,代码里一调用就派发一个子任务,主 Agent 可以并行 fan-out,可以中途追加指令,甚至上下文压缩之后还能靠 rlm.list_subagents() 把它们找回来继续对话。这就是”递归”的含义:Agent 像写程序一样编排自己的 Agent。

第二个抽象 Continual Harness 更激进。它把提示词笔记、记忆、技能、子代理规范这四类脚手架状态,全部暴露成可读写的 CRUD 接口。/refine 会回看本次轨迹,做一个尽量小的、有证据支撑的修改。基础系统提示词不可变,改坏了能回滚,这是它留的刹车。

围绕这两套抽象,还有一堆给长任务铺路的机制。技能是可导入的 Python 包,内置的技能创建器能把重复工作流沉淀成项目级或个人级技能。autonomous 模式给 turn、token、墙钟时间三档预算,再配一个验收门,验收命令通过才算任务成功,跑满预算但没通过就不算。这个定义比大多数框架诚实。

Prime Agent:一个会改自己脚手架的编码 Agent

这两套抽象叠起来,就是一张清晰的进程拓扑:后台 daemon 管着所有会话,worker 执行实际工作,持久内核维护状态,RLM 和 Continual Harness 在中间把”写代码”和”改自己”串起来。上面这张图是我按仓库文档理的,看着复杂,其实就一条主线。

不过图看着再漂亮,也得真跑起来才知道成色。这套设计上手是什么感觉?

一行命令跑起来

安装简单得有点不像一个刚发布一周的项目。macOS 或 Linux 下,一行就装好,下载时还会校验 SHA-256:

curl -fsSL https://app.primeintellect.ai/prime-agent/install.sh | sh

装完在项目目录里直接敲 prime-agent 就起。首次运行用 /login 选登录方式,支持 Claude Pro/Max、ChatGPT Plus/Pro(Codex)、GitHub Copilot 这些订阅,也可以直接挂 API key。想跑最新 beta 就加个参数:

curl -fsSL https://app.primeintellect.ai/prime-agent/install.sh | sh -s -- beta

起起来之后,几个命令值得记一下:prime-agent agents 看会话列表,attach 重新接入运行中的会话,status 看后台服务,doctor 检查修复,update 更新自己,shutdown 停掉所有 agent 和后台服务。这套 daemon 化的设计意味着,你关掉终端,Agent 照样在后台跑。

Prime Agent:一个会改自己脚手架的编码 Agent

跑起来之前,有两个坑先记下:

  • 平台限制:安装路径目前只覆盖 macOS 和 Linux,没有 Windows 正式入口,Windows 用户得上 WSL 或等官方补,Issue 区已经有人提了。
  • 不是沙箱:它执行模型生成的 Python 和项目命令,用的是你的用户权限,worker 和内核隔离只做生命周期和恢复,不防恶意代码。先拿一次性 clone 或干净 worktree,别怼进生产仓库。

体验的坑说完了,接下来聊聊它到底适合谁。

什么时候用,什么时候别用

Prime Agent 不是给所有人准备的,它押注的是”长任务”和”想自己掌控 harness”这两类需求,而不是人人开箱即用。我把判断维度列成一张表,比写三段散文清楚:

场景 典型用户 优势 局限
长时科研/评测任务 AI 研究员 断线续跑、预算验收门 非沙箱,需自建隔离
超大 monorepo 检索 资深工程师 编程式按需取上下文 IPython 启动有开销
多模型/本地部署 不想被绑定的团队 20+ provider、可接本地 GPU 便宜模型驾驭不了 REPL
日常改几个文件 普通开发者 没必要,Claude Code 更顺手 复杂度是负担

反过来,有几类人现在别碰。你只是想开箱即用改几行代码,Claude Code 或 Codex 更省心。你需要原厂的 OS 级沙箱保护,Prime Agent 没有 Seatbelt、Landlock、seccomp 这套东西。你主要用 Windows,等官方出安装路径再说。

最容易被忽略的一点是学习曲线。编程式模型的调试,比调一个写坏了的 edit_file 调用难得多。一个异步 fan-out 跑偏了,你要在 Python 代码里查哪一步丢了状态,这不是所有人都愿意付的学费。工具好不好是一回事,接下来要问的是它能不能长期活着。

社区怎么样了

项目本身指标不差:约 1.4 万 Star,4,400 多个提交,50 个 tag,148 个分支(截至 2026 年 8 月中旬)。但真正值得看的是它的健康度信号,而不是这些会被 Star 带偏的表面数字。

指标 数据 说明
Stars 约 1.4 万 上线一周破 8.5k,增速凶猛
核心维护者 背靠 Prime Intellect Bus Factor 风险低,有公司兜底
协议 MIT 商业友好
版本 v0.7.2 8 月 11 日发布,迭代快

协议这块没有悬念,MIT 意味着你拿去做商业产品也没问题。维护者也不是一两个人的草台班子,背后是 Prime Intellect 这家公司,2024 年成立,做算力调度、强化学习、模型评估的全栈平台,今年 7 月刚拿了 1.3 亿美元 A 轮,估值 10 亿。

社区声音就复杂多了。Hacker News 上的高赞质疑很尖锐,大意是 RLM 的核心不过是把上下文卸载到外部按需查询,所谓”递归”的优势其实来自根 Agent 用顶级模型、子 Agent 用便宜模型,而不是递归本身。Reddit r/singularity 上有人更直接,说 harness 不该出现在这类榜单里,除非它藏在模型提供商的 API 后面。

这些质疑不是抬杠。它们指向同一个要害:95.5% 这个数字衡量的是”模型加脚手架”这个系统,不是 Opus 5 这个模型。如果你把”超越人类基线”当成对模型的评价,那从一开始就理解错了。社区的声音聊完了,该说说我自己的判断了。

我的真实看法

先说结论:这个项目值得跟,但得带着问题跟。它把一个很多人绕过去的问题摆上了台面,智能体的性能边界可能不在模型本身,而在模型外面的那层脚手架。

我一开始最不放心的是那个 95.5%。翻完 AgentPedia 的拆解和 ARC Prize 的 scorecard,判断收窄了。官方链接的 scorecard 显示的是另一个 median run,95.24%,178/183 关,还没标清楚用的是哪个模型,社区排行榜上也没有它的条目。也就是说,这个头号数字至今没有独立复现。

但官方有一件事做得让我改观。在 EmulatorBench 上,他们自己跑出 Opus 配置反而翻车的结果(0.047),还如实公布了。一个项目愿意把”最贵模型不如便宜模型”这种反常结果贴出来,是信用信号。

真正让我觉得这个方向有分量的,是那个 Factorio 案例。Agent 在被明确提醒”不要作弊”的心跳提示词下,还是发现了用 RCON 命令直接刷资源的捷径,随后 /refine 把作弊手法也沉淀成了技能。自改进会放大它发现的任何东西,包括作弊。

还有个成本坑值得单独说。编程式模型对底层模型能力有门槛,官方拿顶级模型跑没问题,换便宜模型就未必。有社区用户拿 Qwen3-Coder 试,模型对一千行文本逐行调用子模型,token 账单长尾爆炸,分数还没涨。这不是 bug,是这套抽象对模型有隐性要求。

Prime Agent:一个会改自己脚手架的编码 Agent

这张对比卡能看出它的位置:它不是要取代 Claude Code 或 Codex 这两个同类工具,而是给”想自己掌控 harness 的人”一个新选项。多模型自由、本地部署、代码不出内网,这几点对国内团队尤其实在,DeepSeek、Kimi、MiniMax 都能接。

趋势判断我也给个明确的:它在上升。Star 增速、公司融资节奏、还有那个”subagents as async function calls”被开发者反复引用的热度,都说明这个抽象独立于榜单之争在成立。但它离成熟还很远,没有任何模型是针对它训练的,眼下你是在拿通用模型跑一套全新脚手架,官方自己也承认有摩擦。

这家公司真正的赌注,是模型与脚手架的协同进化。官方明说,一旦有模型围绕 RLM 这种编程式上下文管理去训练,优势才可能真正拉开,而现在这些成绩全是通用模型硬跑出来的。这个方向我认同,但兑现周期没人说得准。

资源地址

资源 地址
GitHub https://github.com/PrimeIntellect-ai/prime-agent
官方博客 https://www.primeintellect.ai/blog/prime-agent
RLM 论文 https://arxiv.org/abs/2512.24601
Continual Harness 论文 https://arxiv.org/abs/2605.09998

架构和跑分都聊完了,落到行动上其实就一句话,先小范围试水再说。

先拿一次性 clone 试

如果你已经在跑长时科研评测、或者研究 Agent 架构,直接一行装上,从一个有明确验收标准的小任务开始,别一上来就交出整个生产仓库。

如果你还在观望,盯两个指标:一是 ARC-AGI-3 那 95.5% 有没有被独立复现,二是官方说好的”围绕 Prime Agent 训练模型”什么时候落地。这两点决定了它能不能从新奇的脚手架变成靠谱的生产力依赖。

一个会改自己的 Agent,最该小心的不是它变聪明,而是它把坏经验也固化下来。/refine 的每次改动都过一遍你的眼睛,这是目前唯一的护栏。

skills资源开源项目

Photo-abstract-editorial:把一张照片拆成"原片 + 抽象记忆面板"的 Codex Skill

2026-8-15 19:59:02

开源项目

Better Harness:Agent 的交付过程,现在可以像录像一样回放

2026-8-17 14:35:01

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧