
在大模型的牌桌上,DeepSeek 一直是个挺特别的存在:价格还不到美国闭源旗舰的零头,靠着极致的稀疏架构,把前沿能力的使用成本压到了地板上。
面对规则复杂、验收标准明确的真实工程任务,它能不能直接交出一个能运行、能交互、能播放的成果?这次,我们让 DeepSeek-V4-Pro 和 Kimi K3、Qwen3.8-Max 站在同一个擂台上,跑完全相同的五道硬核场景题。

五个真实工程任务实测
判断一个模型能否胜任复杂工作,至少要考察三个层面:它是否真正理解了规则;它是否建立了正确的数据和状态系统,而非用静态页面或预设动画伪装;它能否把结果落成一个可以打开、运行、交互或播放的实体文件。
题目相同、验收标准相同、硬性指标相同,只接受可执行的真实文件,这也是我们第一次真正把三款模型放在同一张考卷上横向对比:
1. 视觉还原:仅凭一张截图重建 NASA Webb Images 页面;
2. 数据工程:依据真实业务口径,从零搭建动态运营驾驶舱;
3. 系统仿真:实现涵盖烟雾扩散、人群行为、防火门响应与出口容量的物理疏散仿真;
4. 图形交互:从空白代码构建一个完全可交互的 Web 3D 魔方;
5. 多模态渲染:将结构化异常日志直接转化为一段可流畅播放的 MP4 视频。
跑完五个 Case,结论很明确:DeepSeek-V4-Pro 是三个模型中功能闭环做得最彻底的一个。它在 Case 3 交出了三款模型里最完整的仿真系统,在 Case 2 补齐了 Kimi K3 缺失的全局筛选联动,在 Case 5 实现了关键数据终值零失误。省下的算力,显然被投入到了逻辑与规则执行之中。
但它的短板也很集中,丢分集中在视觉精度与交互收尾的最后一公里:全局导航的黑白反转、视频阶段标题的低对比度、形同虚设的播放控制按钮。
Case 1 – 从一张截图,重建NASA Webb Images页面

目标网页
第一项任务只给出一张页面截图和一句话提示词,模型必须自行完成视觉识别、内容提取、页面拆解与前端重建。
DeepSeek-V4-Pro 交付了一份约 230 行的单文件 HTML。就内容与结构而言,它的理解相当到位:双层导航、左侧标题与介绍段落、右侧两列共八个分类入口一应俱全,介绍文字与参考页面几乎逐字吻合,八个分类入口的文案与分组也没有任何错漏,并且完全依靠独立的 DOM 与 CSS 实现,没有把截图伪装成图片。

但在视觉还原上出现了大的纰漏:参考页面的 NASA 全局导航本是黑底白字,它却重建成白底深色字,页面最醒目区域的色彩关系被整个颠倒。NASA 标志被替换为一个简化的蓝色圆形 SVG,底部的深空天文摄影则由纯 CSS 渐变的星空插画代替,星云与星系全是程序化绘制的色块。此外,代码中未针对窄屏进行专门适配,实际缩窄窗口后布局表现也不稳定。
这道题勾勒出的画像颇具代表性:DeepSeek-V4-Pro 对页面上有什么、结构怎么组织的理解能达到及格线,但对页面风格和细节的把控明显粗糙。
Case 2 – 带真实业务口径的运营驾驶舱
第二项任务要求结合 API 运行记录与品牌规范,构建纯离线、具备多维联动与特定计算口径的运营驾驶舱。这类任务最容易陷入静态假效果的套路,也最考验模型对统计口径的理解深度。

DeepSeek-V4-Pro 没有投机取巧,还顺手补齐了 Kimi K3 当时的主要缺口。在它交付的约 44KB 单文件中,日期范围、Provider、Model 三维筛选器全部到位,且 KPI 卡片、四张图表、异常列表、明细表与成本模拟器消费同一个过滤后的数据状态——任何筛选条件变化,全页同步重算。这正是 K3 版本中筛选只作用于图表和明细表所缺失的全局联动。
计算口径同样经得起逐项核对。五项核心 KPI 全部正确:成功率按成功请求量之和除以请求量之和得出,P95 延迟与质量分均以请求量为权重加权,没有对每日百分比做算术平均。末日环比正确区分了相对变化率与百分点,与标准答案完全一致。提示词指定的四类图表,即请求量堆叠面积图、带 97% 警戒线的成功率多折线图、成本—质量气泡散点图、请求量占比环形图,无一缺席,全部由原生 SVG 绘制并绑定真实数据。

异常检测的表现尤其值得记录:三条规则全部落地,默认视图精确命中全部 5 条异常,并且正确处理了 97.00% 这一边界——规则要求低于 97% 才触发,Nova-Pro 恰好 97.00% 的成功率没有被误报。成本模拟器的公式与标准答案严丝合缝,且推演过程没有污染真实指标。
主要的不足落在两处细节上:环形图缺少鼠标悬停提示,而提示词明确要求所有图表都具备悬停能力;成本类异常依赖前一个自然日作为基线,一旦日期筛选把前一日移出范围,异常判定便会失去参照。这些都属于边界收尾问题,无碍它成为三个模型中该题功能覆盖最完整的交付。
Case 3 – 复杂规则驱动的应急疏散仿真
第三项任务是三个模型拉开差距最明显的一题:一个包含建筑网格、差异化人员、烟雾扩散、定时关门及出口限流的离散事件仿真系统。它最容易暴露表演式代码,也最能检验模型对状态链的掌控能力。
DeepSeek-V4-Pro 交出了三款模型中最完整的一份答卷。

在仿真内核层面,它采用固定 0.5 秒逻辑步长,1×/2×/4× 倍速只改变推进频率而不干扰状态转移;A* 四方向寻路将普通格代价设为 1、烟雾格设为 8,门状态变化后全体人员实时重新规划路径。几个关键对标点全部命中:烟雾源在零时刻即已生效——Qwen3.8-Max 当时首帧无烟雾的初始化语义缺口在这里并不存在;12 秒时先执行 D4 自动关闭、再执行该时刻的烟雾扩散,处理顺序与规则文档分毫不差;D4 关闭后 P11 如期进入受困状态,手动打开 D2 的下一个逻辑步即恢复路径并写入恢复路径日志;人员冲突按等待时长与 ID 字典序排定优先级,任一非出口格不会同时出现两人;两个出口独立累计通行额度,容量不足时人员排队等待而非凭空消失。
在交互功能层面,它补齐了 Kimi K3 当时缺失的三项能力:图层开关(网格/全量路径/烟雾热力图)、人员点击选中与路径高亮、自动运行至下一事件,并额外附带了规则说明面板、出口通过统计与仿真结果摘要卡。暂停期间可以开关门改变环境而时间不推进,重置后状态完整归零,无人撤离时平均撤离时间正确显示为—而非 NaN。
若吹毛求疵,撤离判定发生在当步容量累计之前,存在半个逻辑步的顺序偏移;390px 移动端的适配更多依赖整体缩放;代码中还残留了个别无效的事件绑定。但这些都不触及内核正确性。这道题证明的是:在把自然语言规则转译成真正运行的动态系统这件事上,DeepSeek-V4-Pro 做得比两位旗舰对手更加彻底。
Case 4 – 一个真正可玩的三维魔方
第四项任务要求从零实现包含真实块体、六面转动、动作队列、确定性打乱、完成态判断、撤销重做与公开测试接口的 3D 魔方。市面上不少网页魔方只是视觉玩具,连续操作之后,贴纸、历史和完成态会逐渐失去一致性。
DeepSeek-V4-Pro 选择了一条扎实的实现路径:维护 54 个面片的标准状态序列,每次转动通过预定义的置换环更新真实状态,完成态判断来自面片本身而非动作数量;页面上是 26 个 CSS 3D 块体构成的真实三维结构,层旋转动画只让对应层的 9 个块体参与;界面按钮与公开的 cubeTestAPI 共享同一套状态引擎,没有为自动验收单开捷径。

我们将官方契约测试脚本完整跑了一遍,结果为 10 组测试通过 9 组:初始 54 格快照、逆步复原、同面四转、交换子不误判、Sexy Move 六次复原、180 度记号、25 步打乱的 seed 确定性与逆序复原、撤销重做与 HTM 计步悉数通过。
唯一折戟的一组是非法算法保持原子性。值得说明的是失败的方式:它的实现会先整体校验算法串,非法记号不会污染任何一步状态——原子性本身是守住的;但它用显示错误文案并静默返回替代了契约要求的抛出异常,拒绝方式与接口约定不一致。这属于典型的契约理解偏差,而非状态引擎缺陷。
真正的功能短板在别处:算法播放的播放/暂停/单步按钮形同虚设——代码里虽然设置了暂停标志位,动作队列却从未消费它,按下暂停无法让队列停在整步边界。键盘交互也存在一个设计缺陷:先按面字母再按数字 2 触发 180 度转动的二连击设计,会在第一次按键时就已经执行一次转动,导致实际多转一步。状态引擎是对的,围绕引擎的控制台却有两处没接上电的控件——这再度印证了开头的判断:逻辑闭环彻底,交互收尾缺少验收。
Case 5 – 从结构化数据直接生成复盘视频
最后一项任务要求直接交付一支可播放的 MP4:15 秒、1920×1080、30fps、H.264、无音轨,准确呈现两次异常事件与恢复数据。
我们对视频文件做了容器级解析:单一视频流、无音频流、avc1 High 编码、1920×1080、精确 30fps、时长 15.000 秒整、共 450 帧,技术规格全部达标。视频按片头、Kestrel-R1 异常、Nova-Pro 告警、恢复与品牌收束四个阶段展开,全部画面均为程序化绘制,没有生成式视频常见的跳字、融化与 Logo 变形。
更关键的是数据准确性。我们对每个阶段逐一抽帧核对,所有数字的终值全部正确:Kestrel-R1 的 4,200ms、95.50%、成本 +49.35%;Nova-Pro 的 3,350ms、97.00%、+27.66% 与警告分级;恢复阶段的 2,448→2,006ms、-18.05%、98.07%→98.69%、+0.61 个百分点。97.00% 没有被表达成低于 97%,百分点与百分比也没有混淆。在这项最容易翻车的基础功上,它做到了零失误。
但这支视频的问题同样突出,而且全部出在看的层面。
一是数字缓动节奏过慢。在评分标准推荐的抽帧点上,数值往往仍在爬坡:5.0 秒时成本变化显示 48.96%(终值 49.35%),8.5 秒时三项指标还停在 3,136ms/76.05%/13.50% 的半途,11.8 秒时恢复数据甚至刚从 0 起跳。所有数字最终都能爬到位,但每组关键数据稳定可读约 1.8 秒的要求被明显压缩,观众在标准验收时刻看到的其实是错误读数。
二是阶段标题的对比度失控。 Kestrel-R1 阶段的橙红色标题压在粉红色巨圆上几乎无法辨认;恢复阶段的粉色标题压在青色圆上彻底隐形;而 Nova-Pro 阶段在其核心时间窗内,画面上甚至找不到日期与模型名,只剩一枚警告徽章。此外,片头的日期区间标注为 07.10—07.13,与数据周期 07.07—07.13 和事件窗口 07.10、07.12 都对不上号;占据半个画面的巨大纯色圆形背景,也让整体观感更接近粗犷的动效草稿,而非精修的品牌成片。
这道题最典型的意义在于:DeepSeek-V4-Pro 把视频任务的数据层做到了三个模型中最干净的水平,却在表现层摔了最狠的一跤。技术规格满分,数据零失误,视觉不及格。

Kimi、Qwen、DeepSeek,差距究竟出在哪里?
同一套题跑完三个模型,各自的能力画像变得非常清晰。
Kimi K3 属于骨架正确,覆盖不全:视觉还原最稳(Case 1 的 594 行重建最完整),魔方契约测试全过,但 Case 2 缺少日期与 Provider 筛选、没有全局联动,Case 3 缺少图层开关、人员选中等产品功能——它优先保证做对,功能覆盖则留有余地。
Qwen3.8-Max 属于架构严密,尺度欠校:Case 2 的统一数据状态、Case 3 的仿真内核、Case 4 的可逆状态机都展现了最强的系统架构力,但 Case 1 的整体尺度偏小、Case 3 的零时刻烟雾缺失,暴露了起始边界与绝对精度上的疏漏。
DeepSeek-V4-Pro 则是闭环最彻底,收尾最粗糙:Case 2 的联动、Case 3 的功能完整性、Case 5 的数据终值准确性均为三者最佳,可一旦走出逻辑层踏入表现层,涉及导航的颜色、标题的对比度、控件的连通性,它的粗糙便无所遁形。

V4 Pro 的长板和盲区更明显了
为了更系统地衡量模型的能力,我们比较了 DeepSeek-V4-Pro 和 Kimi K3 在 In-house benchmark 上的评测结果。

一句话总结 V4-Pro:能读复杂规则、能修真实代码、能处理多约束任务,也能在部分研究型任务里打出高上限;它的短板集中在并发一致性、严格优先级、长期搜索效率这几类问题上。
- 编码能力:有具体并发盲区
V4 Pro 已经具备比较扎实的软件工程能力:给它一个现成代码仓库、一组测试和一个隐藏 Bug,它多数时候能定位问题并把代码修到测试通过。而它的问题集中在一种很容易埋雷的场景:多个请求同时修改同一份数据时,旧请求不能覆盖新结果。V4 Pro 在两个不同任务里连续犯了同一种错误,说明它对“版本号、旧写入失效、迟到结果不能覆盖新状态”这套并发规则掌握得不够。日常代码问题可以放心交给它;如果系统涉及缓存、多人同时修改、分布式状态同步,需额外审查。
- 规则审计:业务场景规则判断接近熟练业务人员
这类题可以简单理解为:给模型几十页规则、合同和证据,让它像保险理赔员、审核员一样逐单判断“该不该赔、赔多少、缺什么材料”。
它不仅能看懂单条规则,还能处理前后关联的信息,例如上一笔业务生成的凭证,在下一笔业务里继续用来判断重复申请。弱点也比较集中:有两次连续漏掉同一类必需材料,还有一次规则已经足够支持拒绝申请,它仍然选择继续向客户补要材料。因此,可以把 V4 Pro 的能力边界解读为:业务规则读得准,但偶尔会在“材料是否齐全”和“什么时候应该果断结束流程”上偏保守。
- 规划与调度:整体能做复杂约束,分层规则的处理弱于 K3
这类题考的是:一次安排很多条件,而且所有条件都要同时满足。比如安排维修任务时,要同时考虑员工技能、班次、停机窗口、备件、预约时间和审计记录。V4 Pro 在这种任务上能把很多局部条件一起守住,一道题 12 项检查全部通过。
它失手的地方出现在规则有明确先后顺序时。另一道任务要求“高优先级对象先拿满,剩下的资源再分给低优先级对象”,V4 Pro 却把剩余资源平均分了,24 项检查过了 21 项。
K3 在同一道题上 24/24 全过。因此这轮可以说:两者都具备复杂规划能力,K3 对优先级、层级关系和细节约束处理得更严谨。
- Auto-research:上限高,但持续研究能力不稳定
这类任务可以理解成:不给模型一个标准答案,而是让它自己不断尝试、修改方案,争取把性能或结果一点点提高。V4 Pro 的表现很分化,有明确突破口时,它可以一下冲得很高:其中一道性能优化题拿到 0.9982,几乎顶格,并把程序速度提高了两个数量级。可当任务需要不断尝试新方案、慢慢寻找更优解时,它的提升能力明显弱一些;另一道近似优化题连续尝试 7 次,最后只有 0.1987。所以 V4 Pro 的研究能力更像:找到关键抓手时爆发力很强;找不到抓手时,继续投入更多轮思考也未必能产生新的突破。
- “多想”不等于“想得更好”
这轮有一个很明显的现象:高分任务往往很快就解决,低分任务反而最消耗时间。最成功的那道只用了 13 轮,几道效果一般的题却一路磨到 141、170 轮。这个样本已经能看到一个很明显的规律:V4 Pro 会做的题通常很早就能找到方向;几十轮之后还没有突破,继续增加 Token 的收益会快速下降。 - 效率与稳定性:V4 Pro 更省钱,K3 更快
V4 Pro 跑完,中位每题约 20 轮、11.5 分钟,总成本 3.71 美元;K3 中位约 16 轮、6.5 分钟,速度更快,但整包成本达到 18.81 美元。两者计价方式不同,因此不能简单理解成 K3 消耗了五倍算力,不过从实际使用的账单看,成本差距很明显。
作者:Wang Shijie, Qiu Yangtian
本轮评测统一通过 Harbor 框架执行,多模态测试集不在本次评测范围内。
本文由作者@Z Finance,授权发布于平台,未经许可禁止转载。

