给智能体跑长上下文,账单总比预期崩得快。DeepSeek 把 5520 亿参数的模型压到只激活 80 亿,KV Cache 砍到上一代的四分之一,闲时输出每百万 token 四块钱,榜单直接追平 Claude Opus。官方甚至把自家旗舰的请求路由到它身上。便宜归便宜,最难的那批榜它仍差一截,切换通知只给了一天。
产品概述
DeepSeek V4.1 Flash 是 DeepSeek 在 2026 年 9 月 10 日发布的新一代 Flash 模型,也是它全新模型结构系列里尺寸最小的一个。定位有点反常识:名字带着 Flash,官方却宣称它在性能、费用、速度、总用时四项上全面超越自家旗舰 V4 Pro。硬件规格上,它是 552B 参数的 MoE 模型,读入侧只激活 8B,生成侧激活 16B,上下文 1M,最大输出 384K。
上一代的 V4 Flash 与 V4 Flash Vision Exp 已经下线,旧模型名会被临时路由到 V4.1 Flash。V4 Pro 的处理更微妙,官方最初通告 9 月 14 日 12 点起把 Pro 的请求全部转到 Flash 并按 Flash 计费,只给了用户四天适配期。随后官方又发通告,称 9 月 14 日之后继续提供 V4 Pro 的 API 调用服务且计费方式不变,对接方最好直接盯官方文档。
过去的 Flash 档基本等同于降级版,能力往下砍、价格往下压。这款换了思路,它把最贵的成本项,也就是长上下文带来的显存占用和缓存开销,从结构上削掉,再用省下的钱把参数和训练规模堆上去,结果在编码和智能体任务上追到了前沿阵营。
API 文档:https://api-docs.deepseek.com
模型权重:https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash

核心功能
参数听完还是抽象的,真正决定它便宜在哪的是结构。
非对称结构:读得省,写得贵
CED 把 40 层 Transformer 拆成两半,前 20 层是因果编码器,负责读完整个输入上下文;后 20 层是解码器,往外吐 token。关键在于解码器的全局 KV Cache 不再逐层各算一份,而是直接从编码器输出投影出来,省掉的不只是重复计算,还有每层要占的那份显存。

这么一拆,读入阶段只跑编码器,每 token 激活 8B;生成阶段才跑完整模型,激活 16B。上一代是读写各 13B,等于把算力预算从读挪到了写。设计前提很直白:生成比读入更难,而智能体循环里读入 token 又远多于生成 token,这笔账就很划算。
KV Cache 压到 890 字节
缓存是小模型省钱的关键战场。这款模型的全局 KV Cache 约 890 字节每 token,相对上一代,HBM 需求降到四分之一,SSD 持久化需求降到八分之一,相对初代 V1 缩小了 437 倍。缓存命中费用常年占智能体账单大头,砍在这里才砍得动总成本。
除了 CED 的投影机制,第三方技术解读还提到两条路径:把 KV 条目跨注意力层共享,以及用 FP4 四比特精度存缓存。另有一个 196B 参数的条件记忆模块 Engram,靠稀疏查找按需访问,不参与主干的常规计算。三条路叠加,才是四分之一的来源。
原生多模态与超长输出
这一代第一次把视觉能力原生训练进主干,而不是外挂一个视觉编码器。图表理解 Chartography 从上一代视觉实验版的 64.3 提到 78.9,文档问答 DocVQA 拿到 95.6。但图像逻辑推理的 ZeroBench 只有 49 分,用截图做重要判断时还是得留个复核环节。
1M 上下文配 384K 的最大输出长度,整仓库代码审计、长文档抽取这类活才谈得上可用。并发上限提到 2500,是 V4 Pro 的 5 倍,对半夜跑批量的团队是实打实的容量差别。推理强度还能从 1 连续调到 100,让精度和成本在同一模型里调节。
| 能力 | 规格 | 说明 |
|---|---|---|
| 骨干参数 | 552B MoE(40 层) | 20 层编码器 + 20 层解码器 |
| 激活参数 | 读入 8B / 生成 16B | 上一代为读写各 13B |
| 上下文 / 输出 | 1M / 384K | 训练在 34T token 处扩到百万级 |
| 图像理解 | 原生支持 | DocVQA 95.6,ZeroBench 49 |
| 并发上限 | 2500 | V4 Pro 为 500 |
| 推理强度 | 1 到 100 连续可调 | 同一模型内切换精度与成本 |
| 开源许可 | MIT | 权重与技术报告已公开 |
上手体验
换成自己上手,从注册到跑出第一段代码大概只要几分钟。
走 API 是最短路径。到开放平台注册、充值、生成 API Key,把模型名从 deepseek-v4-pro 改成 deepseek-flash 就能调用,OpenAI 格式的基址是 https://api.deepseek.com,Anthropic 格式是 https://api.deepseek.com/anthropic。如果你本来在 Claude Code 里干活,迁移成本就是改一组环境变量,不用换客户端也不用打补丁。官方接入指南给的配置长这样,注意模型名后面的方括号后缀,它表示按 1M 上下文调用,配好之后重启终端就生效。
export ANTHROPIC_BASE_URL=https://api.deepseek.com/anthropic
export ANTHROPIC_AUTH_TOKEN=<你的 DeepSeek API Key>
export ANTHROPIC_MODEL=deepseek-flash[1m]
export ANTHROPIC_DEFAULT_OPUS_MODEL=deepseek-flash[1m]
export ANTHROPIC_DEFAULT_SONNET_MODEL=deepseek-flash[1m]
export ANTHROPIC_DEFAULT_HAIKU_MODEL=deepseek-flash
export CLAUDE_CODE_SUBAGENT_MODEL=deepseek-flash

第一次跑起来最直观的感受是快,社区实测输出速度落在 300 到 500 tokens 每秒,本地部署的玩家还提到它比要调用的工具响应更快。国内科技媒体做过一组对照实测,三个任务分别是 3D 停车游戏、带优惠码的小店和预约改期系统。
三个任务它都没超过五分钟,最慢的停车游戏用了 4 分 47 秒。上一代同一题花了 11 分 27 秒,而且 3D 场景上下颠倒,原因是相机上方向的向量叉乘顺序写反了。小店那题上一代重启后订单查询返回空,生成用时差着三到四倍。
也不是没问题。内测期间有开发者反馈,几分钟花掉十块钱,速度提升和 token 消耗是绑在一起的。Web 端还有语言跟随的毛病,用英文提问却拿到中文思考链和中文回答,重试约一半概率复现,官方 API 的复现率据反馈明显更低。
使用技巧
几个能立刻省钱的开关,官方文档写得比较低调。
很多人不知道还有这些进阶用法:
- 把缓存命中吃满:系统提示词、工具定义、检索文档前缀尽量固定,重复部分走缓存命中价,闲时每百万 token 两分钱,只有未命中价的五十分之一
- 错峰跑批:高峰是工作日 9 点到 12 点、14 点到 18 点,其余含周末全按闲时计价,可延迟的任务排到晚上直接省五成
- 显式声明长上下文:模型名后面补上 1m 后缀,别让框架按默认窗口截断,长仓库任务能省掉大量重复预填
- 推理强度按任务调:简单改写别拉满,复杂重构再往上加,它的档位曲线偏极端,低档约等于关、高档约等于满
- 在 harness 侧做兜底:工具 schema 校验、请求带幂等编号、失败重试加上限,能挡下大部分无效工具调用
竞品对比
跑分之外,真正决定选型的是它在同定位里排第几。
同赛道里绕不开的名字有 Claude Opus 5.0、GPT-5.6 Sol,以及国内的 GLM-5.3 和 Kimi-K3。四方侧重点各不相同,而这个定位的正面较量几乎集中在编码和智能体任务上,所以先看一组同源的基准数据,全部取自 DeepSeek 官方发布页,方便横向对齐口径。
| 对比维度 | V4.1 Flash | Opus 5.0 | GPT-5.6 Sol | GLM-5.3 | Kimi-K3 |
|---|---|---|---|---|---|
| DeepSWE v1.1(修真实仓库 bug) | 74.2 | 74.0 | 73.0 | 66.9 | 67.5 |
| Terminal-Bench 2.1(终端编码) | 90.6 | 89.1 | 88.8 | 88.2 | 88.3 |
| Automation-Bench(SaaS 工作流) | 54.8 | 50.3 | 45.8 | 48.8 | 46.7 |
| Agents’ Last Exam(长程多步) | 31.8 | 28.6 | 26.7 | 28.5 | 27.6 |
| Terminal-Bench 4.0(最难终端集) | 31.2 | 51.8 | 39.9 | 37.9 | 12.6 |
注:数据来源为 DeepSeek 官方发布对比表,对手列数据为收集而非同场重跑,尚无第三方独立复现。
读这张表要分两层。前四行里它全线压过对手,包括把自家 V4 Pro 甩开一截;第五行反过来,最难的终端任务集上它只有 31.2,Claude Opus 5.0 是 51.8。官方对比表还没放 GPT-6 Astra,后者在同一项上报了 57.9,选谁当对手,这本身就是结论的一部分。

同一个模型换个脚手架还能再掉一截,DeepSWE v1.1 在自家 harness 下是 74.2,换到 Claude Code 是 69.8,换到 Codex 只剩 65.6。国内两家竞品的价格是另一个维度,用 Artificial Analysis 的高峰计价口径跑完一个智能指数任务,它花 0.27 美元,GLM-5.3 和 Kimi-K3 都在 1.9 美元上下,量级差距比分数差距更刺眼。
用户反馈
榜单是一回事,真实用过的人怎么骂又是另一回事。
发布周的讨论热度不低,Hacker News 上的主贴收了 934 分和 515 条评论。最高赞的评论不是夸能力,而是夸它的技术报告写得细,对比之下有些对手的系统卡只剩安全套话。一致的反应是快,有人拿它重写内核。吐槽也很集中,除了前面提到的语言跟随和推理档位,本地部署的账更直白:有人算过原生 4-bit 骨干加视觉加推测解码大约需要 310GB,剩下还有 Engram 参数,256GB 内存的机器只能重度量化后勉强跑起来。
最激烈的争论不在模型本身,而在切换方式。官方把 V4 Pro 的请求路由到 Flash,通知到执行只隔几天,没有并行迁移期。反对的一方说模型各有脾气,不打招呼就换会打坏评测基线;支持的一方说云端模型本来就不确定,真要稳定就该自己托管权重。
数据归属也是老话题。有用户指出官方 API 会用调用数据做训练,敏感业务更适合走自托管,尽管零留存承诺在行业内普遍被怀疑。好消息是 MIT 许可把自托管这条路留着了,坏消息是 552B 的体量让大多数团队只能租。
多维评分
把上面的信息收拢成一张表,按八个固定维度打分。
| 维度 | 权重 | 评分 | 一句话解读 |
|---|---|---|---|
| 功能完整性 | 20% | ⭐⭐⭐⭐☆ | 编码、工具调用、视觉、长上下文齐了,缺音频与视频 |
| 易用性 | 15% | ⭐⭐⭐⭐☆ | 换模型名即可迁移,推理档位曲线不直观 |
| 性能表现 | 15% | ⭐⭐⭐⭐☆ | 300 到 500 tokens/s,但输出 token 消耗偏高 |
| AI 能力 | 15% | ⭐⭐⭐⭐☆ | 编码与 agent 追平前沿,HLE 36.8 落后 Opus 56.3 |
| 价格合理性 | 10% | ⭐⭐⭐⭐⭐ | 闲时输出 4 元每百万 token,同档几乎无对手 |
| 生态集成 | 10% | ⭐⭐⭐⭐⭐ | OpenAI、Anthropic、Responses 三协议,GGUF 已跟进 |
| 文档与支持 | 10% | ⭐⭐⭐⭐☆ | 接入指南细致,路由口径一个月变过两次 |
| 更新频率 | 5% | ⭐⭐⭐⭐⭐ | 三天内两次公告调整,迭代节奏极快 |
综合评分:8.6 / 10
分数高在价格和生态,扣分集中在两处。一是最难的前沿推理仍有明显差距,HLE 36.8 对 Opus 5.0 的 56.3 不是小幅落后。二是它话多,单位 token 便宜不等于单位任务便宜,同样一个智能指数任务它花 0.27 美元,上一代只要 0.22 美元,单价优势被话多吃掉了一截。
优缺点
优势
- 读入成本重构:预填只激活 8B,读多写少的智能体循环被精准命中,长会话越多省得越明显
- 缓存体积压到四分之一:每 token 约 890 字节,缓存命中价低到闲时每百万两分钱,高频复用前缀的工作流几乎白送
- 协议兼容不挑客户端:三套 API 格式都支持,Claude Code 和 Codex 改环境变量就能切
- MIT 许可加 1M 上下文:权重可私有化、可二次分发,长上下文加图像理解能落在自有基础设施里
不足
- 最难的前沿推理仍有差距:Terminal-Bench 4.0 只有 31.2,HLE 36.8,硬核推理不能当旗舰用
- token 消耗偏高:单价降了但话说得多,实际单任务成本可能不降反升
- 路由口径变动频繁:V4 Pro 的下线通告发过两版,需要版本锁定的系统得自己加控制
- Web 端语言跟随不稳定:英文提问偶发中文思考链,API 侧复现率更低但仍存在
适用人群
说到底,这东西适不适合你,取决于你的任务长什么样。
- 跑编码 agent 的个人开发者与小团队:原本被 Claude Code 或 Codex 的额度墙卡住,换成按量计费后账单可预测,缓存命中价把重复上下文成本压到几乎可忽略
- 高并发长上下文的 SaaS 团队:2500 的并发上限加 1M 窗口,整仓库审计、多文档抽取第一次能在预算内跑满
- 有数据合规要求的私有化场景:MIT 许可加开放权重,可以把敏感代码留在自己机房,代价是 310GB 级硬件门槛
- 做多模态预处理的团队:图表理解 78.9、文档问答 95.6,把截图和仪表盘丢进去做结构化抽取已经够用
- 不太适合的人:把最难的前沿推理当核心业务、需要严格版本锁定的生产系统、指望单机跑满血权重的人
定价方案
价格是这款模型最锋利的部分,账要算到任务粒度才准。
| 计费项(每百万 token) | 空闲时段 | 高峰时段 |
|---|---|---|
| 输入(缓存命中) | 0.02 元 | 0.04 元 |
| 输入(缓存未命中) | 1 元 | 2 元 |
| 输出 | 4 元 | 8 元 |
注:截至 2026 年 9 月 12 日官网定价页显示,高峰时段为北京时间周一至周五 9:00 至 12:00、14:00 至 18:00,其余时间含周末均按空闲时段计费。对照同页显示的 V4 Pro 报价,输出价约为其三分之一。
换算成美元口径,高峰未命中输入 0.30 美元、输出 1.20 美元,闲时直接砍半,这个价位在 2026 年的前沿档里属于极低的一档。但别只看单价,Artificial Analysis 的智能指数口径显示,它完成一个任务花 0.27 美元,比 V4 Pro 便宜约六成,约为 GLM-5.3 和 Kimi-K3 的七分之一;同一口径下上一代只要 0.22 美元,说明它的输出 token 消耗确实偏多。落实建议只有两句:能延迟的活排到闲时,能固定的前缀全部固定住。
常见问题
把评论区问得最多的几个问题集中答一遍。
Q1:deepseek-flash 和 deepseek-v4-flash 是什么关系?
A1:是同一个新模型,旧名字只是兼容用的壳。 deepseek-flash 指向 V4.1 Flash;旧名 v4-flash 与 vision-exp 对应的模型已下线,请求会被路由过去并按 Flash 价计费。
Q2:V4 Pro 会下线吗?现在还能调用吗?
A2:能调用,且计费方式不变。 官方最初通告 9 月 14 日 12:00 起把 Pro 请求路由到 Flash,后又改口称继续提供服务,最终口径以官方文档为准。
Q3:定价到底便宜到什么程度?
A3:闲时输出每百万 token 四元,缓存命中只要两分钱。 官网显示,空闲时段输入未命中一元、输出四元,高峰翻倍。
Q4:支持中文吗?
A4:支持,中文表现稳定。 它在中文理解和生成上没有明显短板。反过来要留意 Web 端的语言跟随问题:英文提问偶尔拿到中文思考链,API 渠道复现率明显更低。
Q5:需要下载安装吗?
A5:用 API 不需要,本地跑需要不小的硬件。 官方 API 改个模型名就能用,两套协议都支持。社区测算自托管约需 310GB 显存。
Q6:生成的代码和权重能商用吗?
A6:可以,MIT 许可限制很少。 模型权重是 MIT 许可,允许商用、修改和二次分发,也不要求衍生作品继续开源;API 输出归属按平台条款执行。
Q7:能接 Claude Code 或 Codex 吗?
A7:都能,改环境变量即可。 DeepSeek 提供了 Anthropic 格式的兼容端点,Claude Code 只需改基址、密钥和模型名三个变量,Codex 侧也有对应配置。
Q8:它有图像理解,能替代专门的视觉模型吗?
A8:读图表够用,看图做逻辑推理还不行。 图表理解 78.9、文档问答 95.6 说明抽取类任务可用;但 ZeroBench 只有 49 分,复杂逻辑判断仍需人工复核。
Q9:和 GLM-5.3、Kimi-K3 比该怎么选?
A9:编码和 agent 场景优先选它,纯推理要看清差距。 在 DeepSWE、Terminal-Bench 2.1、Automation-Bench 三项上它领先这两家;跑完一个智能指数任务它约 0.27 美元,对手约 1.9 美元。
结论
V4.1 Flash 不是那种靠榜单数字取胜的发布。它真正改变的是单位智能的价格:读入侧激活砍到 8B,缓存压到四分之一,闲时输出四块钱每百万 token,把过去只有闭源旗舰才给得起的长上下文和多模态,变成了可私有化、可二次分发的廉价基础设施。
它适合谁很清楚:跑编码 agent 的开发者、被并发和长上下文卡住预算的团队、有数据归属要求的私有化场景。不适合谁也很清楚:把最难的前沿推理当核心业务的人,HLE 36.8 对 Opus 5.0 的 56.3 是实打实的两倍差距,硬核推理场景不要指望它。
建议的做法是把可延迟的批处理排到闲时,把固定前缀的缓存吃满,然后在真实任务上跑一周账单。如果这一周账单明显低于原来的订阅费,它就值得留在技术栈里;如果不是,说明任务恰好落在它最贵的那个角落。
