DeepSeek Harness 评测:DeepSeek 的第一款 Agent 框架,凭什么”一切皆插件”

以前想让 AI 干点实事,得自己在模型外面再套一圈工具,读文件、跑命令、改代码全得手动拼。DeepSeek Harness 就是来打包这层”手脚”的,8 月 13 日以 MIT 协议放出了首个开发者预览版。它把模型、工具、会话、沙箱全做成可插拔的插件,官方只给了一句口号:“一切皆插件”。开源当晚 Star 就破了几万,但界面只有个光秃秃的对话框。到底是下一代 Agent 基础设施,还是一个门槛极高的毛坯房,上手试过才知道。

产品概述

DeepSeek 之前有个尴尬的事实:它的 API 文档里,Agent 集成板块列了一长串第三方工具,Claude Code、Codex、Cursor 都在,唯独没有自家产品。模型是它家的,干活的手却是别人家的,Harness 就是来填这个长期空白的。

DeepSeek Harness 评测:DeepSeek 的第一款 Agent 框架,凭什么"一切皆插件"

2026 年 8 月 13 日晚,DeepSeek 正式开源 Harness v0.1 开发者预览版,MIT 协议,代码全开放。官方给它的定位浓缩成一个公式:Model 加 Harness 等于 Agent,模型负责理解和推理,Harness 负责把能力落到真实环境里,调用工具、操作终端、读写文件、管理上下文,最终把活干完交付。

官网:https://github.com/deepseek-ai/deepseek-harness

DeepSeek Harness 评测:DeepSeek 的第一款 Agent 框架,凭什么"一切皆插件"

这个产品不是凭空冒出来的。7 月 31 日 DeepSeek-V4-Flash 正式版发布时,更新日志里藏着一行容易被忽略的话:公开 Code Agent 基准测试,用的正是”即将发布”的 Harness 极简模式。也就是说,你看到的那张 benchmark 成绩单,Harness 早就是幕后功臣,早就替自家模型跑过一轮又一轮的复现。

仓库的热度是真的。截至 8 月 14 日,仓库累计 1.2 万多次提交,TypeScript 为主,另带 Python SDK,开源首日 Star 快速破万,几天内逼近四万大关。一个 3 月才组建的新团队,三个月攒出这个工程密度和提交节奏,不算虚火。

核心功能

Harness 最核心的东西,一句话就是”一切皆插件”。接下来把它拆开看,这套插件化架构到底怎么运转,它的地基、插件层、能力边界和运行模式是怎么一层层搭起来,又是怎么互相协作的。

它的地基是一个叫 Cordis 的插件元框架,只负责插件的加载、卸载和依赖管理,所有 Agent 组件都是独立的 Cordis 插件,通过服务和事件互相协作。模型、工具、技能、会话、沙箱、存储、循环、调度、UI,全都能自由替换、灵活重组,不用改源码,在配置层就能拼装组合。DeepSeek Harness 评测:DeepSeek 的第一款 Agent 框架,凭什么"一切皆插件"

针对不同场景,Harness 预设了四种模式,每种默认加载不同插件集合。标准模式带完整工具组合,覆盖日常开发;极简模式只留一个 shell 和一个文件编辑工具,专门在最小环境下跑模型基准测试;PTC 模式让模型生成代码来编排多轮工具调用;创造模式能检查运行时、在内存里试验插件,再据此造新模式出来。

运行方式也有三种:Web UI、TUI、Headless。Web UI 适合日常交互和调试,TUI 适合终端里常驻和远程开发,Headless 适合塞进流水线做批量任务和 CI 集成。此外还有一个”轨迹”功能,相当于给 Agent 装了个黑匣子,每一步干了什么都能复盘回看,方便事后排查。

安全侧,仓库里带了一个原生的 landlock-run 包,用 Linux Landlock 做沙箱隔离,把不可信执行路径拦在内核层。架构文档里还留着”能力缝隙”和”双 LLM 适配器”两份设计决策记录,说明团队在可扩展性和多模型接入上想得比较远,不是临时拼凑出来的架构。

上手体验

看完架构,最想知道的肯定是实际跑起来是什么感觉,会不会有藏着掖着的隐藏配置等着你填表。好在官方给的起步方式极简,就一条命令,本地装好 Node.js 就能直接跑起来,先跑起来再说细节,别卡在配置阶段。

DeepSeek Harness 评测:DeepSeek 的第一款 Agent 框架,凭什么"一切皆插件"

装好 Node.js 后,终端敲 npx @deepseek-ai/dsh web,它会拉起一个 Web UI,默认地址 127.0.0.1:3080。想走 Python 侧,官方还提供了 Python SDK,配合 jsonrpc-agent 在极简模式下复现基准测试,仓库的 BENCHMARK.md 有详细指引。

第一印象很直接:这是一个”毛坯房”。基础界面只有一个对话框,加上左侧栏的历史记录,没有任何 Codex 类应用该有的功能面板。那些让 V4 Flash 变快变强的智能体工具,全被藏进内置插件里,需要你自己去调用、去组装、自己去搭积木。

这个设计对老手是自由,对新手是劝退。不少参与内测的人反馈,普通工程师在一个毛坯房里根本玩不转,难怪内测要在开源社区专门招做 Agent 项目的人。官方也白纸黑字写了:这是开发者预览版,未来会有破坏兼容性的变更,别急着上生产环境。

使用技巧

摸清脾气之后,Harness 用起来其实有几个顺手的姿势。很多人不知道的是,预览版的几个隐藏用法能省掉不少重复配置,下面分享几条我自己踩过坑后的心得,给同样准备上手的人省点时间,少走一些不必要的弯路。

  • 从极简模式入手。想验证模型 Agent 能力,先跑极简模式做基准,环境最小、干扰最少,结果最干净,复现也最容易。
  • 用创造模式探路。不熟 Cordis 的话,先在创造模式里查看运行时、临时加载插件,摸清服务与事件机制再动手写自己的模式,循序渐进。
  • 直接读仓库文档。docs 目录下有 ADR、架构说明和 cookbook,还有 AGENTS.md、CLAUDE.md,官方自己就在用 AI 协作开发,规范值得抄一份回来。
  • 别急着上生产。预览阶段接口会变,拿来尝鲜、学架构没问题,业务系统再等等,等接口稳定下来再考虑迁移也不迟。
  • 想省 Token 就用 PTC 模式。让模型生成代码一次性编排多轮工具调用,比逐轮对话省不少调用开销和上下文长度。

竞品对比

Agent 框架这个赛道现在卷得很厉害,Claude Code、OpenAI Codex、Pi-Agent 都是绕不开的对手,各自侧重点差得很远,闭源和开源、轻量与全栈的路线都有人在走。直接看对比表,几家差异一目了然,谁更适合你心里就有数了:

维度 DeepSeek Harness Claude Code OpenAI Codex Pi-Agent
定位 开源 Agent 框架 终端编码智能体 云端编码智能体 轻量 Agent 运行时
开源协议 MIT 闭源 闭源 MIT
架构理念 一切皆插件 黑盒封装 黑盒封装 轻量插件化
上手门槛 高,毛坯房 低,一条命令 低,一条命令
模型绑定 模型无关 绑定 Claude 绑定 GPT 模型无关

核心差异在于”定义权”。Claude Code 和 Codex 把模型、工具、沙箱锁死在黑盒里,你只能用它给你的成品。Harness 连智能体循环的定义权都开放了,像医院连挂号、门诊、收费的流程都能打乱重构。这是真开放,代价就是没有开箱即用的成品给你。

用户反馈

关于 Harness,开发者社区的评价相当两极,从乐高式自由的狂热追捧,到毛坯房劝退的冷静吐槽都有。把它最真实的两面都摆出来,帮你判断它到底是不是你该上手的那盘菜,避免被单一声音带偏预期。

正面声音里,很多人喜欢这种乐高式设计。有开发者在社交平台说,完全模块化,你可以重写、替换任何你不喜欢的部分,完全不同于 Codex 的封闭黑盒。还有人看重官方身份,觉得用第三方工具接 DeepSeek 配置是黑盒,出问题不知道怪谁,官方自己下场,链路通了就是通的。

反面吐槽集中在门槛上。”一切皆插件”极度依赖配置,YAML、插件、效果组件、服务一层套一层,对只想快速用上 Agent 的普通人很不友好。有内测者直言,这就是一个毛坯房,界面毛边随处可见,对非编程用户极不友好。本质是同一件事:自由和易用,暂时没法兼得。

多维评分

光说感受不够,还是按老规矩把八个维度拆开打分,每一项都有数据或场景支撑,不靠主观印象给分。框架免费开源、性能、生态这些维度各自该拿多少分,下面拉个清单,把每一项的依据都说清楚。

维度 权重 评分 一句话解读
功能完整性 20% ⭐⭐⭐⭐☆ 插件化能力齐全,扣在 v0.1 细节未打磨
易用性 15% ⭐⭐⭐☆☆ 毛坯房,架构门槛高,非程序员劝退
性能表现 15% ⭐⭐⭐⭐☆ 极简模式跑出官方基准,环境开销可控
AI 能力 15% ⭐⭐⭐⭐☆ PTC 模式编排省 Token,能力靠模型释放
价格合理性 10% ⭐⭐⭐⭐⭐ 框架 MIT 免费,配套 API 价格仍低
生态集成 10% ⭐⭐⭐☆☆ 刚开源,插件生态刚起步,待社区填坑
文档与支持 10% ⭐⭐⭐⭐☆ ADR、架构、cookbook 齐全,规范到位
更新频率 5% ⭐⭐⭐⭐⭐ 三个月 1.2 万提交,工程密度极高

综合评分:7.4 / 10

优缺点

优点:官方出品解决了信任问题,不再是第三方黑盒,链路通了就是通的,出了问题也找得到人修。插件化架构扩展性极强,社区贡献门槛低,谁都可以加自己的插件进来。MIT 开源想怎么改都行,没有协议上的限制,可以直接二次分发。文档和工程规范到位,ADR 写得很清楚,新人照着读就能上手。与自家模型深度协同,能压榨出 V4 系列的 Agent 能力上限。

缺点:v0.1 预览版界面粗糙,不是给普通用户的成品,UI 几乎要自己从头搭起。上手门槛高,过度依赖 YAML 和插件配置,不熟系统架构的人会被劝退。原生沙箱基于 Linux Landlock,Windows 原生支持不稳,要走 WSL2 才能稳定运行。插件生态刚起步,还没形成规模,可复用插件少,很多能力要自己写。官方明说会有破坏兼容的变更,生产环境风险大,建议等几个稳定版本再上。

适用人群

这套东西不是人人都合适,硬塞给所有人不现实,只会两头不讨好。先对号入座再决定要不要上手,能省掉不少试错时间和精力的浪费,也能帮你判断它是不是你当前阶段需要的那盘菜,理性决策比冲动尝试靠谱。

Agent 框架研究者是最对口的,想看清下一代智能体基础设施怎么搭,Harness 是难得的完整样本。要做自定义 Agent 的团队也合适,插件化架构省去从零拼工具的成本,可以直接复用现成插件再扩展。DeepSeek 模型重度用户同样受益,官方链路通了就是通的,配置不再黑盒。

反过来,只想开箱即用的普通开发者不合适,老老实实用 Claude Code 或 Codex 更省心,省下来的时间花在业务上更划算。非编程用户更别碰,毛坯房对没有架构功底的人就是劝退现场。想上生产环境的团队,建议等预览期结束、接口稳定后再评估,现在上等于拿业务赌兼容性。

定价方案

框架本身 MIT 协议完全免费,没有订阅费、没有席位费,成本只在模型 API 这一层。DeepSeek API 当前价格虽然很低,但 8 月 17 日起将切换为峰谷定价,高峰时段涨幅最高超过十倍,值得提前留意和规划调用时段,把高峰任务挪到闲时执行。

截至 2026 年 8 月官网显示,V4 Flash 每百万 tokens 未命中输入 1 元、输出 2 元;V4 Pro 未命中输入 3 元、输出 6 元。8 月 17 日起实行峰谷定价,高峰时段(9:00-12:00、14:00-18:00)价格上调,闲时仅为高峰的一半,具体档位见下表。

模型 缓存命中输入 未命中输入 输出
V4 Flash(截至 2026/8/13) ¥0.02 ¥1 ¥2
V4 Pro(截至 2026/8/13) ¥0.025 ¥3 ¥6
V4 Pro(截至 2026/8/17 高峰) ¥0.3 ¥9 ¥27
V4 Pro(截至 2026/8/17 闲时) ¥0.15 ¥4.5 ¥13.5

即便高峰价上涨后,V4 Pro 依然比 Claude 和 GPT 的同类模型便宜不少,性价比优势仍然在。而且 Harness 模型无关,你要接别的模型也完全自由,成本结构自己说了算,不绑定任何一家模型供应商,随时可以切换。

常见问题

关于 Harness 讨论最多的几个问题集中放在这里,先把最容易踩坑和误解最多的几条说清楚,免得上手时反复翻文档浪费时间。答案尽量短而准,每条都有明确结论和依据,看完心里就有数了,不用再到处求证。

Q1:Harness 和 Claude Code 有什么区别?

A1:一个是框架,一个是成品。 Claude Code 是开箱即用的终端编码智能体,黑盒封装,拿到就能用。Harness 是开源 Agent 框架,一切皆插件,你得自己组装,自由度高但没成品可玩,适合爱折腾的人。

Q2:Harness 免费吗?

A2:框架免费,模型另计。 代码 MIT 协议完全开源免费,没有订阅费。成本只在模型 API 上,用 DeepSeek 官方模型便宜,接其他模型也支持,成本结构自己挑。

Q3:怎么安装运行?

A3:一条命令即可。 装好 Node.js,终端执行 npx @deepseek-ai/dsh web,自动拉起 Web UI,默认地址 127.0.0.1:3080。Python 侧另有 SDK,配合 jsonrpc-agent 可以跑基准。

Q4:四种模式分别是什么?

A4:标准、极简、PTC、创造。 标准模式工具最全,覆盖日常开发;极简模式只留 shell 和文件编辑,用于最小环境基准测试;PTC 模式让模型生成代码编排多轮工具调用;创造模式用来试验插件、造新模式。

Q5:能接 DeepSeek 以外的模型吗?

A5:能,模型无关。 官方强调模型无关设计,架构里还有”双 LLM 适配器”的决策记录。理论上可接任意模型,不锁定自家生态,第三方模型也能接进来用。

Q6:现在能上生产环境吗?

A6:不建议。 官方明确标注开发者预览版,未来会有破坏兼容性的变更。目前只适合尝鲜、学习架构和跑基准测试,生产环境风险大,建议等稳定版。

Q7:支持 Windows 吗?

A7:原生支持不稳。 原生沙箱基于 Linux Landlock,Windows 原生环境存在路径和子进程处理的已知问题。建议用 WSL2 跑,避开原生环境那些坑。

Q8:”一切皆插件”和 MCP、Skills 是什么关系?

A8:都是开放生态,粒度不同。 MCP 和 Skills 是给模型接外部能力的协议;Harness 把整个 Agent 运行时都插件化,连循环、调度、UI 都能替换,开放得更彻底。

Q9:官方 benchmark 是 Harness 跑出来的吗?

A9:是的。 V4 Flash 和 V4 Pro 公布的 Agent 基准成绩,都是在 Harness 极简模式下测出来的。Harness 是官方自己的评测基础设施,跑分结果可复现。

Q10:适合谁用?

A10:Agent 开发者和框架研究者。 想做自定义 Agent 的团队、研究智能体基础设施的人最对口。只想开箱即用的普通开发者不建议碰,会被门槛劝退。

结论

DeepSeek Harness 不是一个”更好用的 Claude Code”,它回答的是另一个问题:模型之上,智能体该怎么被组织。用”一切皆插件”的极端开放,把定义权交还给开发者,这是梁文锋式哲学在工程层的落地,也是 DeepSeek 对 Agent 时代的一次表态。

它的价值现在还没完全兑现。毛坯房、高门槛、生态空白,都是真问题。但换个角度,一个 3 月组建的团队,三个月做出 1.2 万次提交的框架,还把自家模型的 Agent 基准都跑在它上面,这份工程底子让人愿意再等它几个版本。

我的判断是:现在别指望它替代你手里的 Claude Code,但如果你想理解 Agent 基础设施会往哪走,或者打算做深度定制的 Agent 产品,它值得你花一个周末读源码、跑一次极简基准。开源世界里,敢把”规则”交给社区的产品,往往能活成标准。

AI工具

腾讯混元 Hy ASR 3.0 preview 评测:当语音识别开始"听懂"你在说什么

2026-8-14 8:18:00

AI工具

库库AI 评测:百度把 GenFlow 更名后,金融办公的"自动挡"到底灵不灵

2026-8-14 18:00:33

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧