Gemini 3.6 Flash 评测:省了 Token,涨了分数,但用户为啥不买账?

Google 昨天一口气发了三款新模型,主菜是 Gemini 3.6 Flash。官方说它更省 Token、编程更强、价格还降了。跑分也确实涨了,编程基准提升超过三成。但 X 上的用户反馈就没这么客气了,智能水平原地踏步,中文选词一塌糊涂,性价比还不如竞品。这事有意思,值得拆开看看。

产品概述

Gemini 3.6 Flash 是 Google DeepMind 于 2026 年 7 月 21 日发布的主力模型,模型 ID 为 gemini-3.6-flash。它的定位很明确:不是一个”考高分”的旗舰,而是一个”能扛活”的生产力工具。用 Google 自己的话说,这是一匹为 Agent 工作流打磨的”主力工作马”。

它和上一代 3.5 Flash 的关系不是颠覆,而是优化,同样是 100 万 token 上下文窗口和 6.5 万 token 输出上限,同样的多模态输入(文本、图片、视频、音频、PDF),但输出 Token 消耗减少了 17%,在复杂 Agent 任务中甚至能砍掉 65% 的 Token。

跟这次一同发布的还有两款:Gemini 3.5 Flash-Lite(主打高吞吐低延迟,每秒 350 token,每百万输入 $0.3)和 Gemini 3.5 Flash Cyber(网络安全专用,仅向政府和特定合作伙伴开放)。但真正的主角,是这个降了价、提了效的 Flash。

官网:https://deepmind.google/technologies/gemini/ | API 文档:https://ai.google.dev/gemini-api/docs/models/gemini-3.6-flash

Gemini 3.6 Flash 评测:省了 Token,涨了分数,但用户为啥不买账?

核心功能实测

前面说了这东西是为 Agent 打工的,那具体有哪些能拿得出手的本事?

编程与 Agent 执行:这次真的进步了

Gemini 3.5 Flash 最大的槽点就是代码生成不如预期。Google 这次显然在这块下了狠手。在 Agent 编程基准 DeepSWE 上,3.6 Flash 从 3.5 Flash 的 37% 提升到 49%,涨幅超过 30%。机器学习的 MLE-Bench 也从 49.7% 涨到 63.9%。

更实际的变化在”少做无用功”。3.6 Flash 在执行代码任务时减少了不必要的推理步骤和工具调用循环。Google 的测试数据显示,在同一任务中,3.6 Flash 比 3.5 Flash 少用了 55.8% 的 Token,任务评分反而从 85 分提升到了 100 分。对需要反复调用模型的 Agent 应用来说,这意味着每次任务的真实成本大幅下降。

Gemini 3.6 Flash 评测:省了 Token,涨了分数,但用户为啥不买账?

多模态与空间推理:看得更懂了

官方着重强调了图表解读、视觉蓝图转换和多元素网页布局生成能力的提升。3.6 Flash 支持文本、图片、视频、音频和 PDF 五种输入格式,覆盖面在同类模型中属于第一梯队。Computer Use(计算机操作)功能也从实验性功能变成了内置工具,在 OSWorld-Verified 测试中得分从 78.4% 提升到 83%。

GDPval-AA v2(知识工作基准)得分从 1349 涨到 1421。法律 AI 公司 Harvey AI 实测后反馈:在资本市场和企业并购等实务场景中,3.6 Flash 的文件起草与审查表现明显优于 3.5 Flash,平均任务完成速度提升 12%。

安全机制加码

3.6 Flash 强化了对 CBRN(化学、生物、放射性、核安全)和网络攻击的防护,抵御越狱攻击的能力显著增强,同时减少了正常请求的误拒绝率。这对企业级部署是个加分项。

基准测试 Gemini 3.6 Flash Gemini 3.5 Flash 提升幅度
DeepSWE v1.1 49% 37% +32.4%
MLE-Bench 63.9% 49.7% +28.6%
OSWorld-Verified 83.0% 78.4% +5.9%
GDPval-AA v2 1421 1349 +5.3%

实际跑一遍

跑分数据看完了,但纸面参数和真实体验之间通常隔着一个”坑”。

打开 Google AI Studio,在模型选择下拉框里已经能看到 gemini-3.6-flash。切换过去后,界面跟 3.5 Flash 几乎一样,学习成本为零。先用一个编程任务试试:让它写一个 Three.js 的交互式 3D 机器人。响应速度比 3.5 Flash 略快,首次 token 大约 2.4 秒,生成速度约 170 token/秒,排在所有模型第四快。

接着试了个多模态任务:上传一张 UI 设计稿截图,让它分析布局并给出改进建议。图像识别很准,从色彩对比度到间距对齐都说到了点子上。还自动生成了一个改进版的 HTML/CSS 代码,可以直接粘贴到浏览器预览。

但槽点也有。让它生成中英文混合的技术文档时,中文选词偶尔很离谱,会把”上下文窗口”写成”情境视窗”,把”推理”翻译成”推论”。问它 2025 年的行业事件,官方标注知识截止 2026 年 3 月,但有些明显该知道的事居然答不上来。这些细节对中文用户来说不太友好。

Gemini 3.6 Flash 评测:省了 Token,涨了分数,但用户为啥不买账?

这样用效率翻倍

基础操作不难,但真正用好它还需要几个技巧。很多人不知道还有这些进阶用法:

  • 思维级别调参:3.6 Flash 默认使用 medium 思考级别,处理简单分类或抽取任务时切换到 minimal 或 low,能在几乎不损失准确率的情况下把延迟和 Token 消耗再压一截。实测文档分类任务中,minimal 模式的 Token 消耗比 medium 少 40%。
  • 上下文缓存的真正威力:API 支持 prompt caching,缓存后的输入 Token 只需 $0.15/百万,是标准输入价的十分之一。对于反复使用同一系统提示词或知识库的场景,设好缓存后每次请求成本能降低 60% 以上。
  • Computer Use 的前置校验:Computer Use 目前是 Preview 状态,直接用它操控生产环境 UI 有风险。推荐先在沙箱环境跑一遍任务流程,确认每一步的截图和操作日志都正常,再切到真实环境。多花 5 分钟校验,能省下几小时的排错时间。
  • Batch 模式的隐性红利:批量处理任务(如夜间跑数据标注、文档分类)直接用 Batch API,输入 $0.75、输出 $3.75,价格是对折。对于日均万次请求的 Agent 系统,一个月能省上千美元。

赛道对比

自己会省 Token 还不够,跟同级别的对手放一起比比才知道。

当前同赛道的效率型模型主要有四个:OpenAI 的 GPT-5.6 Luna(7 月 9 日发布)、Anthropic 的 Claude Sonnet 5(6 月 30 日发布)、月之暗面的开源模型 Kimi K3(7 月 17 日发布)和智谱的 GLM-5.2(6 月 17 日发布)。各有各的打法。

对比维度 Gemini 3.6 Flash GPT-5.6 Luna Claude Sonnet 5 Kimi K3
定位 Agent 主力模型 高效低成本 日常编码/办公 开源旗舰
输入价格($/百万 Token) 1.50 1.00 3.00(标准价) 3.00
输出价格($/百万 Token) 7.50 6.00 15.00(标准价) 15.00
上下文窗口 100 万 Token 未公开 未公开 100 万 Token
多模态输入 图文音视 PDF 图文 图文 图文
开源 是(MIT)
Computer Use 内置(Preview)

价格上 Gemini 3.6 Flash 卡在 GPT-5.6 Luna 和 Claude Sonnet 5 之间。但 Artificial Analysis 的综合评测显示,3.6 Flash 的智能指数和 3.5 Flash 几乎一模一样,而 GPT-5.6 Luna 作为更新一代的模型,在同等甚至更低价格下提供了更强的推理能力。这才是用户吐槽的核心:如果只是为了省钱,有更便宜的选择;如果为了更强的能力,Luna 和 Sonnet 5 都明显更强。

用户反馈

跑到 X 上刷了一圈,用户的评价比参数表精彩得多。

正面声音主要来自企业开发者。Harvey AI 的法务团队说文档审查快了 12%,金融平台 Hebbia 夸它在长文档分析和报告撰写上表现稳定。确实有部分用户认可”更少 Token + 更低价格”这个组合拳,认为在批量处理场景下实打实省了钱。

但差评的比例出乎意料地高。X 用户 Balder 直接开了地图炮,说三个新模型全比 3.5 Flash 差,问题包括基础解码出错、中文选词离谱、图片视频质量下降、工具调用混乱。Artificial Analysis 的评测也证实了用户的感觉:3.6 Flash 的智能水平与 3.5 Flash 持平,在全部 155 个排名模型中排第 15,比 Meta Spark 1.1、GLM-5.2、Grok 4.5 都低。

性价比方面更尴尬。网友 Angel 算了一笔账:3.6 Flash 用起来比 GPT-5.6 Luna 贵,但能力反而更差。对于 Flash 系列以”性价比”立身的定位,这是个没法洗的黑点。Conor Dart 用 Google 自家的 Antigravity 跑 AI 游戏生成测试后直言:木头纹理变差了,大理石没变化,这又是一次翻车。

多维评分

口碑这么两极,那用专业维度给它打个分。

维度 评分 一句话解读
功能完整性 ⭐⭐⭐⭐☆ 多模态全面,Computer Use 内置,缺图/音生成
易用性 ⭐⭐⭐⭐☆ API 迁移简单,AI Studio 无缝切换
性价比 ⭐⭐⭐☆☆ 比 3.5 Flash 便宜,但被 GPT-5.6 Luna 压着打
创新性 ⭐⭐⭐☆☆ 效率优化而非架构突破,无重大新能力
稳定性 ⭐⭐⭐☆☆ 中文和工具调用有随机性问题
推荐度 ⭐⭐⭐☆☆ Agent 场景可试,复杂推理建议看竞品
综合评分:6.7 / 10

好的坏的都说清楚

优势

  • Agent 场景效率显著提升:输出 Token 减少 17%-65%,同样任务成本大幅下降
  • 编程能力实打实进步:DeepSWE 涨 32%,MLE-Bench 涨 29%,代码质量更接近生产标准
  • 降价的真实诚意:输出 $9 降到 $7.5,Batch 模式对折,上下文缓存 $0.15 极具竞争力
  • 多模态覆盖面广:支持五种输入格式,Computer Use 直接内置

不足

  • 智能水平原地踏步:与 3.5 Flash 在 Artificial Analysis 上得分相同,用户感受不到”变聪明”
  • 性价比被竞品反超:GPT-5.6 Luna 更便宜且更聪明,Flash 系列的性价比人设受到挑战
  • 中文支持拉胯:选词错误、翻译生硬、知识库空白,对中文用户不够友好

对号入座指南

优缺点都摆在这了,那到底谁适合用?

  • Agent 应用开发者:如果你在构建需要反复调用模型的 Agent 系统,3.6 Flash 的 Token 效率提升和 Computer Use 内置功能是实打实的价值。同样的任务更少步骤、更低成本,直接反映在账单上。
  • 多模态处理团队:需要同时处理文本、图片、视频、音频和 PDF 的场景,3.6 Flash 的覆盖面在同等价位中是最广的。尤其是图表解读和视觉蓝图转换,比上一代有明显进步。
  • 已有 Gemini 生态的用户:如果你已经在用 3.5 Flash 的 API,迁移到 3.6 Flash 几乎零成本,改个模型 ID 就行。价格更低、效果不降,没有不换的理由。
  • 不太适合的人群:如果你需要的是最强的单次推理能力,做复杂数学证明、科研分析、高难度编码、或者对中文输出质量有极高要求,3.6 Flash 不是你的菜。GPT-5.6 Sol 或 Claude Sonnet 5 会更合适。

定价方案

找到适合你的场景了?来看看钱包撑不撑得住。

Gemini 3.6 Flash 的定价分四个消费模式(截至 2026 年 7 月):

消费模式 输入($/百万 Token) 输出($/百万 Token) 说明
标准(Standard) 1.50 7.50 默认模式,适合实时请求
批量(Batch) 0.75 3.75 对折,适合离线大批量任务
弹性(Flex) 0.75 3.75 同为半价,非实时场景可用
优先(Priority) 2.70 13.50 1.8 倍溢价,保证低延迟
免费版 免费 免费 Google 用你的内容改进产品

上下文缓存价格额外 $0.15/百万 Token,这是多数团队低估的省钱杠杆。如果你在构建一个客服 Agent,每次请求都要带上相同的产品知识库作为上下文,设好缓存后输入成本能从 $1.5 降到 $0.15,月成本能砍掉一个数量级。Pro 提示:Batch 和 Flex 价格一样,区别是 Batch 通常在数小时内完成,Flex 在数分钟内,按紧急程度选。

你可能还想问

分数和价格都在这了,有些细节你可能还拿不准。

Q1:Gemini 3.6 Flash 和 3.5 Flash 比,到底聪明了多少?

A1:跑分涨了,但”聪明程度”基本没变。 Artificial Analysis 评测显示两个版本的智能指数相同。进步主要体现在效率上——同样聪明的模型,用更少的 Token 完成任务。


Q2:跟 GPT-5.6 Luna 比,选哪个?

A2:看场景。如果预算优先,Luna 更便宜($1/$6 vs $1.5/$7.5)且智能水平更高。 但如果你的应用需要多模态输入(视频、音频)或 Computer Use,3.6 Flash 是唯一选择。


Q3:免费版有什么坑?

A3:Google 会用你的输入内容来改进产品。 如果是商业数据或敏感信息,绝对不要用免费版。建议至少走标准付费 API,数据不会被用于训练。


Q4:Computer Use 能直接用吗?

A4:能用,但带着 Preview 标签。 意味着功能还不够稳定,Google 不建议直接用于生产环境 UI 自动化。先在沙箱环境测试验证,再考虑上线。


Q5:中文支持怎么样?

A5:不太好。 从 X 上的中文用户反馈和实测来看,中文选词、翻译和知识覆盖面都存在明显短板。如果主要使用场景是中文内容,建议先实际测试再决定。


Q6:支持图片和视频生成吗?

A6:不支持。 3.6 Flash 只能接收多模态输入,输出只有文本。图片生成和视频生成需要其他专用模型,音频生成和 Live API 也不支持。


Q7:从 3.5 Flash 迁移过来要改多少代码?

A7:基本不用改。 换个模型 ID(gemini-3.5-flash 改成 gemini-3.6-flash),去掉已废弃的采样参数,去掉 prefilled model turns 即可。Google 还提供了自动化迁移工具。


Q8:上下文窗口真的是 100 万 Token 吗?

A8:是,输入 1,048,576 Token,输出上限 65,536 Token。 这个窗口大小在同类模型中属于最大级别,适合一次处理几千页的技术文档或整个代码库。


Q9:批量处理(Batch API)有什么限制?

A9:半价,但不保证实时。 Batch 任务通常在几小时内完成,适合夜间批处理、数据标注、离线分析等非实时场景。不适合需要即时响应的用户交互。


Q10:3.6 Flash 适合生产环境吗?

A10:适合,它是 GA(Generally Available)状态。 Google 明确标注 3.6 Flash 为生产可用,企业级安全机制也到位。但复杂 Agent 场景建议在 staging 环境充分验证后再上线。


所以到底值不值得

Gemini 3.6 Flash 是一台效率机器,但它不是一个让人惊叹的模型。

它的进步是真实且可量化的:Token 少用了,价格降了,编程跑分涨了。对 Google 生态内的开发者来说,这是一次毫无痛感的升级。但如果你指望它像 GPT-5.6 或 Claude Sonnet 5 那样带来”哇,AI 又进化了”的感受,你会失望。

Google 这次的策略其实很清晰:在 3.5 Pro 难产、Gemini 4 还在预训练的窗口期,先用低价高效的 Flash 稳住开发者基本盘,不给 OpenAI 和 Anthropic 留空档。这个策略本身没毛病,但问题在于,对手不是原地等着的,GPT-5.6 Luna 比它便宜还比它聪明,Flash 系列引以为傲的性价比已经不再是独家优势了。

建议很直接:已经在用 Gemini 生态的,直接升,没坏处;纯看性价比选模型的,先试试 GPT-5.6 Luna 或等 3.5 Pro 发布后再做决定;需要中文高质量输出的,暂时不建议上主力。

AI工具

ChatGPT Work 测评:它把打工人的活全包了?

2026-7-21 8:19:27

行业动态

DeepSeek V3.1 Base突袭上线!击败Claude 4编程爆表,全网在蹲R2和V4

2025-8-21 14:04:22

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧