DeepSeek 公布的数据显示,新模型在纯文本 Agent、推理和世界知识等能力上与正式版 V4-Flash 基本持平,而在需要视觉理解的 Agent Benchmark 上出现明显提升。DeepSeek 称,其多模态 Agent 能力已经接近 Claude Opus 4.8。从最近几次连续更新来看,DeepSeek 的路径已经越来越明确:V4 负责模型能力,Harness 负责把模型接入真实任务,而视觉则让 Agent 从主要处理文本和代码,进一步开始理解屏幕上的世界。
DeepSeek 公布的数据显示,新模型在纯文本 Agent、推理和世界知识等能力上与正式版 V4-Flash 基本持平,而在需要视觉理解的 Agent Benchmark 上出现明显提升。DeepSeek 称,其多模态 Agent 能力已经接近 Claude Opus 4.8。从最近几次连续更新来看,DeepSeek 的路径已经越来越明确:V4 负责模型能力,Harness 负责把模型接入真实任务,而视觉则让 Agent 从主要处理文本和代码,进一步开始理解屏幕上的世界。