DeepSeek-V4-Flash-Vision-Exp 评测:DeepSeek 终于长出了眼睛

写 Agent 最怕什么?明明截图就摆在眼前,模型却看不见。DeepSeek 最近给纯文本的 V4 Flash 接上了视觉,一张图最多算 384 个 token,价格和文本版完全一样。它瞄准的不是聊天看图,而是让 Agent 真正能读截图、识图表、看报错。到底值不值得接,上手试一遍再说。

产品概述

DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek 在 2026 年 8 月 21 日上线 API 平台的一个实验性多模态视觉理解模型。它的定位很直白:在原本纯文本的 V4 Flash 基础上加上图片理解能力,模型 ID 就是 deepseek-v4-flash-vision-exp

整个 V4 系列今年 4 月才以预览形式放出 Pro 和 Flash 两个纯文本版本。一个月前 DeepSeek 开源了 Agent Harness,开发者很快发现一个尴尬的事实:Harness 能调终端、调文件、跑代码,却看不了图。社区只好自己接 Qwen-VL 之类的视觉模型来”代看”。

这个视觉实验版就是来补这块短板的。它不是一个新旗舰,而是把视觉塞进了最小、最快、最便宜的那条产品线。DeepSeek 官方反复强调它是”实验性质”,意味着架构细节、训练方式都没有公开,价格也可能随时调整。

官网:https://api-docs.deepseek.com | 项目地址:https://github.com/deepseek-ai

DeepSeek-V4-Flash-Vision-Exp 评测:DeepSeek 终于长出了眼睛

核心功能

前面聊了这东西是干嘛的,接下来仔细看看它到底有哪些硬实力。

它最核心的能力当然是”看图”。模型支持 JPEG、PNG、GIF、WebP 四种图片格式,图片会先被转换成 token 再和文本一起计费,单张图最多按 384 个 token 计算。这意味着无论你丢一张 4K 截图还是小图标,视觉成本都有明确上限,不会失控。

DeepSeek-V4-Flash-Vision-Exp 评测:DeepSeek 终于长出了眼睛

多模态 Agent 能力是它最想证明的点。DeepSeek 的说法是,在需要视觉理解的 Agent Benchmark 上,它的表现已经”接近 Opus 4.8″。典型场景包括读网页截图、识别报错界面、分析图表、看软件 UI、读设计稿,再根据图片继续操控电脑或改代码。

接口兼容性也铺得很全。它同时支持 Chat Completions、Messages、Responses 三种格式,兼容 OpenAI 和 Anthropic 两套 SDK,原生支持 JSON 输出和工具调用。也就是说,你现有的 Agent 代码大概率不用大改就能把图传进去。

它还有思考和非思考两种模式,可以按需切换。长上下文方面延续了 V4 Flash 的 1M 上下文和 384K 最大输出,适合把整本带图的文档一次性丢进去。不过 FIM(中间补全)不被支持,需要代码续写的场景要注意。

上手体验

聊完功能,最想知道的肯定是实际用起来什么感觉。

接入门槛低得有点意外。你不需要下载任何东西,只要有一个 DeepSeek API Key,用熟悉的 OpenAI SDK 把 base_url 指向 DeepSeek,模型名填 deepseek-v4-flash-vision-exp 就能发请求。图片可以走 base64、外链 URL,或者先传到新上线的 Files API 复用。

DeepSeek-V4-Flash-Vision-Exp 评测:DeepSeek 终于长出了眼睛

我试了一段最典型的用法:丢一张仪表盘截图,让模型读出关键指标并总结趋势。返回速度在意料之中地快,毕竟底层还是那个 13B 激活参数的 Flash 模型。中文识别准确,图表里的数字和标签基本没看错。

第一次产出的质量有个小坑值得说:如果图片里文字很小或叠加在复杂背景上,偶尔会漏读次要标签。好在这类问题可以通过”先放大关键区域”或”在 prompt 里指定重点”来规避,不算硬伤。整体手感是”便宜、快、够用”,和它对标的价格区间完全对得上。

使用技巧

很多人不知道还有这些进阶用法,能明显拉开和纯文本模型的距离:

  • 复用图片走 Files API:同一张参考图要在多轮对话里反复用,先传 Files API(最大 64 MiB),后续只引用文件 ID,比每次 base64 重传省约 60% 的请求体积。
  • 小图优先控制成本:单张图固定上限 384 token,把截图压缩到必要分辨率再传,既保住识别率又不会浪费上下文,高清原图反而容易触发截断。
  • 图文混排给坐标:让模型输出边框坐标或区域描述时,在 prompt 里明确要求”按左上角坐标标注”,后续接 GUI Agent 直接可执行,定位误差能降一截。
  • 思考模式留给难题:截图分类、简单 OCR 用非思考模式,速度翻倍;只有涉及多步推理的图表分析才开思考模式,把算力花在刀刃上。

竞品对比

多模态 API 这条赛道现在挤满了选手,先看清谁在什么位置。

同类产品里,Claude Opus 4.8 是 DeepSeek 自己点名的对标对象,Gemini 3 Flash 和 Qwen3-VL 则是价格和定位上最直接的对手。各自侧重点差异很明显。

维度 DeepSeek-V4-Flash-Vision-Exp Claude Opus 4.8 Gemini 3 Flash Qwen3-VL(API)
视觉能力 支持,实验版 支持,成熟 支持,原生 支持,开源
输入价格($/M) 0.22 5.00 0.50 0.20 起
输出价格($/M) 0.66 25.00 3.00 1.60 起
上下文窗口 1M 1M 1M 262K(可扩 1M)
开源权重 否(仅 API) 是(Apache 2.0)
核心差异化 最便宜的视觉 Agent 可靠性最高 主动视觉加音视频 可自托管

DeepSeek 这版的最大杀器是价格。同样带视觉,它的输入价只有 Opus 4.8 的约 4%,输出价约 2.6%。和 Gemini 3 Flash 比也便宜一半以上。代价是它还是实验版,没有公开的技术报告,也没有独立实验室复现过它的基准分数。

基准分数的水分值得单独看。DeepSeek 自己的 11 项对照表里,视觉实验版赢了 3 项、输了 8 项,最大差距在 NL2Repo(57.7 对 69.7)。这些数字来自厂商自测,且文本版在带图题里”忽略”了图片内容,所以观感被拉高了一截。

DeepSeek-V4-Flash-Vision-Exp 评测:DeepSeek 终于长出了眼睛

Qwen3-VL 反向走开源路线,能自己部署、数据不出门,但 API 价格和上下文都略逊一筹。四个模型其实不在一条绝对优劣线上,而是各自卡住了不同的需求档位。

用户反馈

模型刚上线两天,社群讨论已经热闹起来,但明显两极。

喜欢的人集中在 Agent 开发者群体。不少人夸它”终于不用在前端接 Qwen-VL 代看了”,有人实测读报错截图再自动修 bug 的链路跑通了,说”省掉了最别扭的一层胶水代码”。价格也反复被点名,社区里”同价位找不到第二个能看图的”是高频评价。

吐槽的点也很集中。最尖锐的是基准分数的可信度:有开发者指出对比表里纯文本版在带图测试里根本”忽略”了图片,所以这个”大幅跃升”有一部分只是补齐了原本没有的能力。还有人担心 Exp 后缀意味着随时可能调价或下线,不敢接生产。

第三方聚合平台目前还没有稳定评分,品控主要靠早期自测。整体口碑偏向”便宜到值得试,但不敢全押”的谨慎乐观。

多维评分

光说好不好不够,按固定维度拆开打分才看得清强弱。

维度 权重 星级 一句话解读
功能完整性 20% ⭐⭐⭐⭐☆ 图文混排加工具调用齐全,缺视频音频
易用性 15% ⭐⭐⭐⭐⭐ 兼容双 SDK,改个模型名就能用
性能表现 15% ⭐⭐⭐⭐☆ 视觉 Agent 接近 Opus 4.8,NL2Repo 差 12 分
AI 能力 15% ⭐⭐⭐⭐☆ 看图识图表达标,复杂推理仍偏弱
价格合理性 10% ⭐⭐⭐⭐⭐ 同档视觉模型里最便宜
生态集成 10% ⭐⭐⭐⭐☆ Harness 0.1.1 加 Files API 同步就位
文档与支持 10% ⭐⭐⭐☆☆ 接口文档有,视觉基准与方法学缺失
更新频率 5% ⭐⭐⭐⭐☆ 紧跟 V4 节奏,实验版迭代快
综合评分:7.9 / 10

分数里”性能表现”和”AI 能力”扣在 DeepSeek 自己的基准表上:11 项里赢 3 项、输 8 项,最大差距在 NL2Repo。但考虑到它只是个 Flash 档位的实验模型,这个表现已经超出价位预期。

优缺点

优势

  • 视觉零加价:图片按 token 计费且单张封顶 384,价格与原文本版完全一致,这是最实在的卖点。
  • 双 SDK 兼容:OpenAI 和 Anthropic 两套接口都通,现有 Agent 几乎零改造成本。
  • 长上下文看图:1M 上下文能吃下整本带图文档,适合长链路 Agent 任务。

不足

  • 基准水分:对比表里文本版”忽略图片”拉高了观感,真实差距没宣传的那么夸张。
  • 实验性质风险:无技术报告、无独立复现、随时可能调价或下线,生产环境要留后路。
  • 模态单一:只支持图片,视频和音频都不行,复杂多媒体场景还得换模型。

适用人群

到底谁该用、谁该观望,直接对号入座更稳妥。

  • Agent 开发者:正在用 DeepSeek 搭自动化流程、需要读截图或图表的人,这是目前成本最低的接图方案。
  • 预算敏感的中小团队:想给产品加视觉理解又嫌 Opus 4.8 太贵,这个实验版能把单价压到几十分之一。
  • 个人开发者与研究者:喜欢折腾新模型、愿意用自测替代官方背书的人,便宜够香。
  • 强合规或数据不出门场景:这类用户不太适合,因为模型仅 API 可用、权重不开放,Qwen3-VL 自托管更像首选。

定价方案

算账之前先说清楚,以下价格截至 2026 年 8 月官网显示,实验版可能调整。

它和 V4 Flash 文本版同价,视觉能力不另收钱。按高峰、空闲时段区分(价格截至 2026 年 8 月 DeepSeek 官网,实验版可能调整):

时段 缓存命中输入 缓存未命中输入 输出 图片计费
空闲 ¥0.05/M($0.007) ¥1.5/M($0.22) ¥4.5/M($0.66) ≤384 token/张
高峰 ¥0.10/M($0.014) ¥3/M($0.44) ¥9/M($1.32) ≤384 token/张

从 2026 年 8 月 23 日起,周末全天按空闲价计。并发上限 2,500。对大多数读截图场景,单图成本几乎可以忽略,真正的开销在长上下文的重复输入上,用 Files API 和缓存能压下来。

常见问题

挑了几个被问得最多的问题,直接给结论。

Q1:DeepSeek-V4-Flash-Vision-Exp 是开源模型吗?

A1:不是,目前仅通过 API 提供。 截至 2026 年 8 月,官方没有放出任何权重,Hugging Face 上也找不到可下载版本,想自托管得等后续的正式版。

Q2:图片怎么传给它,支持哪些格式?

A2:支持 JPEG、PNG、GIF、WebP 四种格式。 可通过 base64、外链 URL 或 Files API 传入,内联和 URL 图片最大 32 MiB,Files API 最大 64 MiB。

Q3:一张图到底要花多少 token?

A3:单张图最多按 384 个 token 计算。 图片会先被转成 token 再和文本一起计费,与分辨率无关,所以视觉成本有硬上限,不会随图片变大暴涨。

Q4:它和 Claude Opus 4.8 谁更强?

A4:DeepSeek 自称多模态 Agent 接近 Opus 4.8,但仅赢 3 项、输 8 项。 这些分数来自 DeepSeek 自己的测试,且文本版在带图题里忽略了图片,真实差距没宣传那么夸张。

Q5:能用现有的 OpenAI SDK 调用吗?

A5:可以,几乎不用改代码。 把 base_url 指向 DeepSeek,模型名填 deepseek-v4-flash-vision-exp,Chat Completions、Responses、Anthropic 兼容接口都支持。

Q6:支持视频或音频理解吗?

A6:不支持,目前只处理图片。 视频、音频输入均不在能力范围内,需要多模态的场景得换 Gemini 3 Flash 这类模型。

Q7:实验版(Exp)意味着什么风险?

A7:可能随时调价、下线或改接口。 官方明确它是实验性质,生产环境建议保留备用模型,不要单点依赖。

Q8:上下文和最大输出是多少?

A8:1M 上下文、384K 最大输出。 延续 V4 Flash 的配置,适合把长文档带图一次性喂进去,但 FIM 中间补全不支持。

Q9:有免费额度可以试吗?

A9:API 按量计费,没有独立免费档。 不过视觉按 token 计价且单图封顶 384,小规模试用成本很低,注册即有余额即可跑通。

Q10:它和 DeepSeek-V4-Flash 文本版是什么关系?

A10:同一产品线的视觉增强版。 文本能力保持一致,额外获得图片理解,价格和接口完全对齐,相当于给 Flash 装了眼睛。

结论

DeepSeek-V4-Flash-Vision-Exp 干了一件很聪明的事:不重训旗舰,而是给最便宜的 Flash 接上眼睛,价格还一分不涨。对正在用 DeepSeek 搭 Agent、又苦于模型看不了图的开发者,它是目前成本最低的解法,兼容性也做到近乎零摩擦。

但它终究是实验版,基准水分、随时调价、无开源权重这三件事决定了它适合先接进测试链路,而不是直接扛生产。如果你要的是最便宜的”能看图的 Agent 大脑”,现在就可以试;如果你要的是可自托管或经过独立验证的视觉模型,Qwen3-VL 或 Gemini 3 Flash 更稳。

AI工具

万相 Wan3.0 评测:文档直转 30 秒视频,阿里这次把"稳定"做成了卖点

2026-8-24 13:09:49

AI工具

豆包工作评测:从问答助手到数字打工人

2026-8-25 10:40:11

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧