以前想让 AI 干点实事,得自己在模型外面再套一圈工具,读文件、跑命令、改代码全得手动拼。DeepSeek Harness 就是来打包这层”手脚”的,8 月 13 日以 MIT 协议放出了首个开发者预览版。它把模型、工具、会话、沙箱全做成可插拔的插件,官方只给了一句口号:“一切皆插件”。开源当晚 Star 就破了几万,但界面只有个光秃秃的对话框。到底是下一代 Agent 基础设施,还是一个门槛极高的毛坯房,上手试过才知道。
产品概述
DeepSeek 之前有个尴尬的事实:它的 API 文档里,Agent 集成板块列了一长串第三方工具,Claude Code、Codex、Cursor 都在,唯独没有自家产品。模型是它家的,干活的手却是别人家的,Harness 就是来填这个长期空白的。

2026 年 8 月 13 日晚,DeepSeek 正式开源 Harness v0.1 开发者预览版,MIT 协议,代码全开放。官方给它的定位浓缩成一个公式:Model 加 Harness 等于 Agent,模型负责理解和推理,Harness 负责把能力落到真实环境里,调用工具、操作终端、读写文件、管理上下文,最终把活干完交付。
官网:https://github.com/deepseek-ai/deepseek-harness

这个产品不是凭空冒出来的。7 月 31 日 DeepSeek-V4-Flash 正式版发布时,更新日志里藏着一行容易被忽略的话:公开 Code Agent 基准测试,用的正是”即将发布”的 Harness 极简模式。也就是说,你看到的那张 benchmark 成绩单,Harness 早就是幕后功臣,早就替自家模型跑过一轮又一轮的复现。
仓库的热度是真的。截至 8 月 14 日,仓库累计 1.2 万多次提交,TypeScript 为主,另带 Python SDK,开源首日 Star 快速破万,几天内逼近四万大关。一个 3 月才组建的新团队,三个月攒出这个工程密度和提交节奏,不算虚火。
核心功能
Harness 最核心的东西,一句话就是”一切皆插件”。接下来把它拆开看,这套插件化架构到底怎么运转,它的地基、插件层、能力边界和运行模式是怎么一层层搭起来,又是怎么互相协作的。
它的地基是一个叫 Cordis 的插件元框架,只负责插件的加载、卸载和依赖管理,所有 Agent 组件都是独立的 Cordis 插件,通过服务和事件互相协作。模型、工具、技能、会话、沙箱、存储、循环、调度、UI,全都能自由替换、灵活重组,不用改源码,在配置层就能拼装组合。
针对不同场景,Harness 预设了四种模式,每种默认加载不同插件集合。标准模式带完整工具组合,覆盖日常开发;极简模式只留一个 shell 和一个文件编辑工具,专门在最小环境下跑模型基准测试;PTC 模式让模型生成代码来编排多轮工具调用;创造模式能检查运行时、在内存里试验插件,再据此造新模式出来。
运行方式也有三种:Web UI、TUI、Headless。Web UI 适合日常交互和调试,TUI 适合终端里常驻和远程开发,Headless 适合塞进流水线做批量任务和 CI 集成。此外还有一个”轨迹”功能,相当于给 Agent 装了个黑匣子,每一步干了什么都能复盘回看,方便事后排查。
安全侧,仓库里带了一个原生的 landlock-run 包,用 Linux Landlock 做沙箱隔离,把不可信执行路径拦在内核层。架构文档里还留着”能力缝隙”和”双 LLM 适配器”两份设计决策记录,说明团队在可扩展性和多模型接入上想得比较远,不是临时拼凑出来的架构。
上手体验
看完架构,最想知道的肯定是实际跑起来是什么感觉,会不会有藏着掖着的隐藏配置等着你填表。好在官方给的起步方式极简,就一条命令,本地装好 Node.js 就能直接跑起来,先跑起来再说细节,别卡在配置阶段。

装好 Node.js 后,终端敲 npx @deepseek-ai/dsh web,它会拉起一个 Web UI,默认地址 127.0.0.1:3080。想走 Python 侧,官方还提供了 Python SDK,配合 jsonrpc-agent 在极简模式下复现基准测试,仓库的 BENCHMARK.md 有详细指引。
第一印象很直接:这是一个”毛坯房”。基础界面只有一个对话框,加上左侧栏的历史记录,没有任何 Codex 类应用该有的功能面板。那些让 V4 Flash 变快变强的智能体工具,全被藏进内置插件里,需要你自己去调用、去组装、自己去搭积木。
这个设计对老手是自由,对新手是劝退。不少参与内测的人反馈,普通工程师在一个毛坯房里根本玩不转,难怪内测要在开源社区专门招做 Agent 项目的人。官方也白纸黑字写了:这是开发者预览版,未来会有破坏兼容性的变更,别急着上生产环境。
使用技巧
摸清脾气之后,Harness 用起来其实有几个顺手的姿势。很多人不知道的是,预览版的几个隐藏用法能省掉不少重复配置,下面分享几条我自己踩过坑后的心得,给同样准备上手的人省点时间,少走一些不必要的弯路。
-
从极简模式入手。想验证模型 Agent 能力,先跑极简模式做基准,环境最小、干扰最少,结果最干净,复现也最容易。 -
用创造模式探路。不熟 Cordis 的话,先在创造模式里查看运行时、临时加载插件,摸清服务与事件机制再动手写自己的模式,循序渐进。 -
直接读仓库文档。docs 目录下有 ADR、架构说明和 cookbook,还有 AGENTS.md、CLAUDE.md,官方自己就在用 AI 协作开发,规范值得抄一份回来。 -
别急着上生产。预览阶段接口会变,拿来尝鲜、学架构没问题,业务系统再等等,等接口稳定下来再考虑迁移也不迟。 -
想省 Token 就用 PTC 模式。让模型生成代码一次性编排多轮工具调用,比逐轮对话省不少调用开销和上下文长度。
竞品对比
Agent 框架这个赛道现在卷得很厉害,Claude Code、OpenAI Codex、Pi-Agent 都是绕不开的对手,各自侧重点差得很远,闭源和开源、轻量与全栈的路线都有人在走。直接看对比表,几家差异一目了然,谁更适合你心里就有数了:
| 维度 | DeepSeek Harness | Claude Code | OpenAI Codex | Pi-Agent |
|---|---|---|---|---|
| 定位 | 开源 Agent 框架 | 终端编码智能体 | 云端编码智能体 | 轻量 Agent 运行时 |
| 开源协议 | MIT | 闭源 | 闭源 | MIT |
| 架构理念 | 一切皆插件 | 黑盒封装 | 黑盒封装 | 轻量插件化 |
| 上手门槛 | 高,毛坯房 | 低,一条命令 | 低,一条命令 | 中 |
| 模型绑定 | 模型无关 | 绑定 Claude | 绑定 GPT | 模型无关 |
核心差异在于”定义权”。Claude Code 和 Codex 把模型、工具、沙箱锁死在黑盒里,你只能用它给你的成品。Harness 连智能体循环的定义权都开放了,像医院连挂号、门诊、收费的流程都能打乱重构。这是真开放,代价就是没有开箱即用的成品给你。
用户反馈
关于 Harness,开发者社区的评价相当两极,从乐高式自由的狂热追捧,到毛坯房劝退的冷静吐槽都有。把它最真实的两面都摆出来,帮你判断它到底是不是你该上手的那盘菜,避免被单一声音带偏预期。
正面声音里,很多人喜欢这种乐高式设计。有开发者在社交平台说,完全模块化,你可以重写、替换任何你不喜欢的部分,完全不同于 Codex 的封闭黑盒。还有人看重官方身份,觉得用第三方工具接 DeepSeek 配置是黑盒,出问题不知道怪谁,官方自己下场,链路通了就是通的。
反面吐槽集中在门槛上。”一切皆插件”极度依赖配置,YAML、插件、效果组件、服务一层套一层,对只想快速用上 Agent 的普通人很不友好。有内测者直言,这就是一个毛坯房,界面毛边随处可见,对非编程用户极不友好。本质是同一件事:自由和易用,暂时没法兼得。
多维评分
光说感受不够,还是按老规矩把八个维度拆开打分,每一项都有数据或场景支撑,不靠主观印象给分。框架免费开源、性能、生态这些维度各自该拿多少分,下面拉个清单,把每一项的依据都说清楚。
| 维度 | 权重 | 评分 | 一句话解读 |
|---|---|---|---|
| 功能完整性 | 20% | ⭐⭐⭐⭐☆ | 插件化能力齐全,扣在 v0.1 细节未打磨 |
| 易用性 | 15% | ⭐⭐⭐☆☆ | 毛坯房,架构门槛高,非程序员劝退 |
| 性能表现 | 15% | ⭐⭐⭐⭐☆ | 极简模式跑出官方基准,环境开销可控 |
| AI 能力 | 15% | ⭐⭐⭐⭐☆ | PTC 模式编排省 Token,能力靠模型释放 |
| 价格合理性 | 10% | ⭐⭐⭐⭐⭐ | 框架 MIT 免费,配套 API 价格仍低 |
| 生态集成 | 10% | ⭐⭐⭐☆☆ | 刚开源,插件生态刚起步,待社区填坑 |
| 文档与支持 | 10% | ⭐⭐⭐⭐☆ | ADR、架构、cookbook 齐全,规范到位 |
| 更新频率 | 5% | ⭐⭐⭐⭐⭐ | 三个月 1.2 万提交,工程密度极高 |
综合评分:7.4 / 10
优缺点
优点:官方出品解决了信任问题,不再是第三方黑盒,链路通了就是通的,出了问题也找得到人修。插件化架构扩展性极强,社区贡献门槛低,谁都可以加自己的插件进来。MIT 开源想怎么改都行,没有协议上的限制,可以直接二次分发。文档和工程规范到位,ADR 写得很清楚,新人照着读就能上手。与自家模型深度协同,能压榨出 V4 系列的 Agent 能力上限。
缺点:v0.1 预览版界面粗糙,不是给普通用户的成品,UI 几乎要自己从头搭起。上手门槛高,过度依赖 YAML 和插件配置,不熟系统架构的人会被劝退。原生沙箱基于 Linux Landlock,Windows 原生支持不稳,要走 WSL2 才能稳定运行。插件生态刚起步,还没形成规模,可复用插件少,很多能力要自己写。官方明说会有破坏兼容的变更,生产环境风险大,建议等几个稳定版本再上。
适用人群
这套东西不是人人都合适,硬塞给所有人不现实,只会两头不讨好。先对号入座再决定要不要上手,能省掉不少试错时间和精力的浪费,也能帮你判断它是不是你当前阶段需要的那盘菜,理性决策比冲动尝试靠谱。
Agent 框架研究者是最对口的,想看清下一代智能体基础设施怎么搭,Harness 是难得的完整样本。要做自定义 Agent 的团队也合适,插件化架构省去从零拼工具的成本,可以直接复用现成插件再扩展。DeepSeek 模型重度用户同样受益,官方链路通了就是通的,配置不再黑盒。
反过来,只想开箱即用的普通开发者不合适,老老实实用 Claude Code 或 Codex 更省心,省下来的时间花在业务上更划算。非编程用户更别碰,毛坯房对没有架构功底的人就是劝退现场。想上生产环境的团队,建议等预览期结束、接口稳定后再评估,现在上等于拿业务赌兼容性。
定价方案
框架本身 MIT 协议完全免费,没有订阅费、没有席位费,成本只在模型 API 这一层。DeepSeek API 当前价格虽然很低,但 8 月 17 日起将切换为峰谷定价,高峰时段涨幅最高超过十倍,值得提前留意和规划调用时段,把高峰任务挪到闲时执行。
截至 2026 年 8 月官网显示,V4 Flash 每百万 tokens 未命中输入 1 元、输出 2 元;V4 Pro 未命中输入 3 元、输出 6 元。8 月 17 日起实行峰谷定价,高峰时段(9:00-12:00、14:00-18:00)价格上调,闲时仅为高峰的一半,具体档位见下表。
| 模型 | 缓存命中输入 | 未命中输入 | 输出 |
|---|---|---|---|
| V4 Flash(截至 2026/8/13) | ¥0.02 | ¥1 | ¥2 |
| V4 Pro(截至 2026/8/13) | ¥0.025 | ¥3 | ¥6 |
| V4 Pro(截至 2026/8/17 高峰) | ¥0.3 | ¥9 | ¥27 |
| V4 Pro(截至 2026/8/17 闲时) | ¥0.15 | ¥4.5 | ¥13.5 |
即便高峰价上涨后,V4 Pro 依然比 Claude 和 GPT 的同类模型便宜不少,性价比优势仍然在。而且 Harness 模型无关,你要接别的模型也完全自由,成本结构自己说了算,不绑定任何一家模型供应商,随时可以切换。
常见问题
关于 Harness 讨论最多的几个问题集中放在这里,先把最容易踩坑和误解最多的几条说清楚,免得上手时反复翻文档浪费时间。答案尽量短而准,每条都有明确结论和依据,看完心里就有数了,不用再到处求证。
Q1:Harness 和 Claude Code 有什么区别?
A1:一个是框架,一个是成品。 Claude Code 是开箱即用的终端编码智能体,黑盒封装,拿到就能用。Harness 是开源 Agent 框架,一切皆插件,你得自己组装,自由度高但没成品可玩,适合爱折腾的人。
Q2:Harness 免费吗?
A2:框架免费,模型另计。 代码 MIT 协议完全开源免费,没有订阅费。成本只在模型 API 上,用 DeepSeek 官方模型便宜,接其他模型也支持,成本结构自己挑。
Q3:怎么安装运行?
A3:一条命令即可。 装好 Node.js,终端执行 npx @deepseek-ai/dsh web,自动拉起 Web UI,默认地址 127.0.0.1:3080。Python 侧另有 SDK,配合 jsonrpc-agent 可以跑基准。
Q4:四种模式分别是什么?
A4:标准、极简、PTC、创造。 标准模式工具最全,覆盖日常开发;极简模式只留 shell 和文件编辑,用于最小环境基准测试;PTC 模式让模型生成代码编排多轮工具调用;创造模式用来试验插件、造新模式。
Q5:能接 DeepSeek 以外的模型吗?
A5:能,模型无关。 官方强调模型无关设计,架构里还有”双 LLM 适配器”的决策记录。理论上可接任意模型,不锁定自家生态,第三方模型也能接进来用。
Q6:现在能上生产环境吗?
A6:不建议。 官方明确标注开发者预览版,未来会有破坏兼容性的变更。目前只适合尝鲜、学习架构和跑基准测试,生产环境风险大,建议等稳定版。
Q7:支持 Windows 吗?
A7:原生支持不稳。 原生沙箱基于 Linux Landlock,Windows 原生环境存在路径和子进程处理的已知问题。建议用 WSL2 跑,避开原生环境那些坑。
Q8:”一切皆插件”和 MCP、Skills 是什么关系?
A8:都是开放生态,粒度不同。 MCP 和 Skills 是给模型接外部能力的协议;Harness 把整个 Agent 运行时都插件化,连循环、调度、UI 都能替换,开放得更彻底。
Q9:官方 benchmark 是 Harness 跑出来的吗?
A9:是的。 V4 Flash 和 V4 Pro 公布的 Agent 基准成绩,都是在 Harness 极简模式下测出来的。Harness 是官方自己的评测基础设施,跑分结果可复现。
Q10:适合谁用?
A10:Agent 开发者和框架研究者。 想做自定义 Agent 的团队、研究智能体基础设施的人最对口。只想开箱即用的普通开发者不建议碰,会被门槛劝退。
结论
DeepSeek Harness 不是一个”更好用的 Claude Code”,它回答的是另一个问题:模型之上,智能体该怎么被组织。用”一切皆插件”的极端开放,把定义权交还给开发者,这是梁文锋式哲学在工程层的落地,也是 DeepSeek 对 Agent 时代的一次表态。
它的价值现在还没完全兑现。毛坯房、高门槛、生态空白,都是真问题。但换个角度,一个 3 月组建的团队,三个月做出 1.2 万次提交的框架,还把自家模型的 Agent 基准都跑在它上面,这份工程底子让人愿意再等它几个版本。
我的判断是:现在别指望它替代你手里的 Claude Code,但如果你想理解 Agent 基础设施会往哪走,或者打算做深度定制的 Agent 产品,它值得你花一个周末读源码、跑一次极简基准。开源世界里,敢把”规则”交给社区的产品,往往能活成标准。
