大家好,我是苍何。
终于,DeepSeek 支持多模态了,发布了最新的多模态模型 deepseek-v4-flash-vision-exp。
该模型为实验性模型,额外支持图片输入。

现在 API 已经支持,只需要将模型名改为 deepseek-v4-flash-vision-exp 就能直接调用。
deepseek-v4-flash-vision-exp 模型支持在文本之外输入图片,你可以让模型描述图片、识别截图中的文字、分析图表等。
支持的图片格式:JPEG、PNG、GIF、WebP。格式由文件实际内容判断,而非文件名或声明的 MIME 类型。

图片会根据其尺寸换算成 token,并与文本 token 一起计费。
模型价格方面,同 deepseek-v 4-flash,百万tokens输入(缓存命中)空闲时段 0.05 元,高峰时段 0.1 元。
百万 tokens 输出空闲时段 4.5 元,高峰时段 9.0 元。

现在大家都可以直接接入 Codex、WorkBuddy、Claude Code 等 Agent。
我在 WeSight 中接入后,发现能对图片直接识别了。

现在 WeSight-Obsidian 插件中直接使用 deepseek-v4-flash-vision-exp 也能直接识图了,而且具备图片理解能力,比如我让他分析图片一共有几个男生。

在 Codex 中也能直接使用该模型可识别理解图片。

那如何接入 Codex 或者 WorkBuddy 呢?可以看看苍何之前分享的文章:
也可以在 CodexGuide 网站上查看接入教程:codexguide. ai。
如果你以前接入过 DeepSeek,只需要更换模型 id,即可使用。
下面实测几个 case 来验证下 DeepSeek 的识图能力。
网页复刻
我让它复刻一下 GitHub 前端页面,我把截图直接丢给他.。

然后这个是 deepseek-v4-flash-vision-exp 出来的效果:

我放大对比了一下,还原度还可以。整个页面的基础信息结构它都读懂了。但还原效果和 K3 我觉得还是差些。
这个是 k3 的效果,头像以及整个页面还原度就比较多:

这个是我给的同一个原始截图,大家可以对比一下:

报错截图
我直接丢一段报错的代码截图丢给它,解决代码能力还是很不错的。

它能够从截图中准确定位到 github-dashboard.html 第 682 行,并识别出空对象被继续读取 user 属性,最终触发 TypeError: Cannot read properties of null。
在明确报错原因后,它还补充了完整的空值保护逻辑并直接修改相关代码,形成了从视觉识别、错误定位到代码修复的完整闭环。
发票识别
我还直接丢了一张发票的截图给到 DeepSeek,能够很快的做出识别。

从识别结果来看,它不仅能够准确提取发票类型、号码、开票日期等核心字段,还会按照基础信息、购买方和销售方等维度自动完成结构化整理。
对于日常报销、财务录入和票据归档等场景,这种从图像识别到信息提取与分类的完整处理能力,已经具备较强的实用价值。
不过我感觉这些也是一个合格的图像理解模型必须具备的能力了。
我以前一直觉得 DeepSeek 会只专注于文本模型,但 DeepSeek harness 推出后,我发现社区很多人反馈,不支持图像识别理解,很不方便。
为此社区诞生出了非常多的插件和解决方案。
现在 DeepSeek 官方终于支持了,如果整体价格能够回到降价前,那就更好了。
无论如何,多模态能力的补齐,意味着 DeepSeek 终于补上了 Agent 应用生态中的关键一环。
当然了国产模型多模态你也可以使用 k3、Doubao-Seed-Evolving 这样的模型,支持的也比较早。
本文由作者@苍何,授权发布于平台,未经许可禁止转载。
