Google 昨天一口气发了三款新模型,主菜是 Gemini 3.6 Flash。官方说它更省 Token、编程更强、价格还降了。跑分也确实涨了,编程基准提升超过三成。但 X 上的用户反馈就没这么客气了,智能水平原地踏步,中文选词一塌糊涂,性价比还不如竞品。这事有意思,值得拆开看看。
产品概述
Gemini 3.6 Flash 是 Google DeepMind 于 2026 年 7 月 21 日发布的主力模型,模型 ID 为 gemini-3.6-flash。它的定位很明确:不是一个”考高分”的旗舰,而是一个”能扛活”的生产力工具。用 Google 自己的话说,这是一匹为 Agent 工作流打磨的”主力工作马”。
它和上一代 3.5 Flash 的关系不是颠覆,而是优化,同样是 100 万 token 上下文窗口和 6.5 万 token 输出上限,同样的多模态输入(文本、图片、视频、音频、PDF),但输出 Token 消耗减少了 17%,在复杂 Agent 任务中甚至能砍掉 65% 的 Token。
跟这次一同发布的还有两款:Gemini 3.5 Flash-Lite(主打高吞吐低延迟,每秒 350 token,每百万输入 $0.3)和 Gemini 3.5 Flash Cyber(网络安全专用,仅向政府和特定合作伙伴开放)。但真正的主角,是这个降了价、提了效的 Flash。
官网:https://deepmind.google/technologies/gemini/ | API 文档:https://ai.google.dev/gemini-api/docs/models/gemini-3.6-flash

核心功能实测
前面说了这东西是为 Agent 打工的,那具体有哪些能拿得出手的本事?
编程与 Agent 执行:这次真的进步了
Gemini 3.5 Flash 最大的槽点就是代码生成不如预期。Google 这次显然在这块下了狠手。在 Agent 编程基准 DeepSWE 上,3.6 Flash 从 3.5 Flash 的 37% 提升到 49%,涨幅超过 30%。机器学习的 MLE-Bench 也从 49.7% 涨到 63.9%。
更实际的变化在”少做无用功”。3.6 Flash 在执行代码任务时减少了不必要的推理步骤和工具调用循环。Google 的测试数据显示,在同一任务中,3.6 Flash 比 3.5 Flash 少用了 55.8% 的 Token,任务评分反而从 85 分提升到了 100 分。对需要反复调用模型的 Agent 应用来说,这意味着每次任务的真实成本大幅下降。

多模态与空间推理:看得更懂了
官方着重强调了图表解读、视觉蓝图转换和多元素网页布局生成能力的提升。3.6 Flash 支持文本、图片、视频、音频和 PDF 五种输入格式,覆盖面在同类模型中属于第一梯队。Computer Use(计算机操作)功能也从实验性功能变成了内置工具,在 OSWorld-Verified 测试中得分从 78.4% 提升到 83%。
GDPval-AA v2(知识工作基准)得分从 1349 涨到 1421。法律 AI 公司 Harvey AI 实测后反馈:在资本市场和企业并购等实务场景中,3.6 Flash 的文件起草与审查表现明显优于 3.5 Flash,平均任务完成速度提升 12%。
安全机制加码
3.6 Flash 强化了对 CBRN(化学、生物、放射性、核安全)和网络攻击的防护,抵御越狱攻击的能力显著增强,同时减少了正常请求的误拒绝率。这对企业级部署是个加分项。
| 基准测试 | Gemini 3.6 Flash | Gemini 3.5 Flash | 提升幅度 |
|---|---|---|---|
| DeepSWE v1.1 | 49% | 37% | +32.4% |
| MLE-Bench | 63.9% | 49.7% | +28.6% |
| OSWorld-Verified | 83.0% | 78.4% | +5.9% |
| GDPval-AA v2 | 1421 | 1349 | +5.3% |
实际跑一遍
跑分数据看完了,但纸面参数和真实体验之间通常隔着一个”坑”。
打开 Google AI Studio,在模型选择下拉框里已经能看到 gemini-3.6-flash。切换过去后,界面跟 3.5 Flash 几乎一样,学习成本为零。先用一个编程任务试试:让它写一个 Three.js 的交互式 3D 机器人。响应速度比 3.5 Flash 略快,首次 token 大约 2.4 秒,生成速度约 170 token/秒,排在所有模型第四快。
接着试了个多模态任务:上传一张 UI 设计稿截图,让它分析布局并给出改进建议。图像识别很准,从色彩对比度到间距对齐都说到了点子上。还自动生成了一个改进版的 HTML/CSS 代码,可以直接粘贴到浏览器预览。
但槽点也有。让它生成中英文混合的技术文档时,中文选词偶尔很离谱,会把”上下文窗口”写成”情境视窗”,把”推理”翻译成”推论”。问它 2025 年的行业事件,官方标注知识截止 2026 年 3 月,但有些明显该知道的事居然答不上来。这些细节对中文用户来说不太友好。

这样用效率翻倍
基础操作不难,但真正用好它还需要几个技巧。很多人不知道还有这些进阶用法:
-
思维级别调参:3.6 Flash 默认使用 medium 思考级别,处理简单分类或抽取任务时切换到 minimal 或 low,能在几乎不损失准确率的情况下把延迟和 Token 消耗再压一截。实测文档分类任务中,minimal 模式的 Token 消耗比 medium 少 40%。 -
上下文缓存的真正威力:API 支持 prompt caching,缓存后的输入 Token 只需 $0.15/百万,是标准输入价的十分之一。对于反复使用同一系统提示词或知识库的场景,设好缓存后每次请求成本能降低 60% 以上。 -
Computer Use 的前置校验:Computer Use 目前是 Preview 状态,直接用它操控生产环境 UI 有风险。推荐先在沙箱环境跑一遍任务流程,确认每一步的截图和操作日志都正常,再切到真实环境。多花 5 分钟校验,能省下几小时的排错时间。 -
Batch 模式的隐性红利:批量处理任务(如夜间跑数据标注、文档分类)直接用 Batch API,输入 $0.75、输出 $3.75,价格是对折。对于日均万次请求的 Agent 系统,一个月能省上千美元。
赛道对比
自己会省 Token 还不够,跟同级别的对手放一起比比才知道。
当前同赛道的效率型模型主要有四个:OpenAI 的 GPT-5.6 Luna(7 月 9 日发布)、Anthropic 的 Claude Sonnet 5(6 月 30 日发布)、月之暗面的开源模型 Kimi K3(7 月 17 日发布)和智谱的 GLM-5.2(6 月 17 日发布)。各有各的打法。
| 对比维度 | Gemini 3.6 Flash | GPT-5.6 Luna | Claude Sonnet 5 | Kimi K3 |
|---|---|---|---|---|
| 定位 | Agent 主力模型 | 高效低成本 | 日常编码/办公 | 开源旗舰 |
| 输入价格($/百万 Token) | 1.50 | 1.00 | 3.00(标准价) | 3.00 |
| 输出价格($/百万 Token) | 7.50 | 6.00 | 15.00(标准价) | 15.00 |
| 上下文窗口 | 100 万 Token | 未公开 | 未公开 | 100 万 Token |
| 多模态输入 | 图文音视 PDF | 图文 | 图文 | 图文 |
| 开源 | 否 | 否 | 否 | 是(MIT) |
| Computer Use | 内置(Preview) | 无 | 无 | 无 |
价格上 Gemini 3.6 Flash 卡在 GPT-5.6 Luna 和 Claude Sonnet 5 之间。但 Artificial Analysis 的综合评测显示,3.6 Flash 的智能指数和 3.5 Flash 几乎一模一样,而 GPT-5.6 Luna 作为更新一代的模型,在同等甚至更低价格下提供了更强的推理能力。这才是用户吐槽的核心:如果只是为了省钱,有更便宜的选择;如果为了更强的能力,Luna 和 Sonnet 5 都明显更强。
用户反馈
跑到 X 上刷了一圈,用户的评价比参数表精彩得多。
正面声音主要来自企业开发者。Harvey AI 的法务团队说文档审查快了 12%,金融平台 Hebbia 夸它在长文档分析和报告撰写上表现稳定。确实有部分用户认可”更少 Token + 更低价格”这个组合拳,认为在批量处理场景下实打实省了钱。
但差评的比例出乎意料地高。X 用户 Balder 直接开了地图炮,说三个新模型全比 3.5 Flash 差,问题包括基础解码出错、中文选词离谱、图片视频质量下降、工具调用混乱。Artificial Analysis 的评测也证实了用户的感觉:3.6 Flash 的智能水平与 3.5 Flash 持平,在全部 155 个排名模型中排第 15,比 Meta Spark 1.1、GLM-5.2、Grok 4.5 都低。
性价比方面更尴尬。网友 Angel 算了一笔账:3.6 Flash 用起来比 GPT-5.6 Luna 贵,但能力反而更差。对于 Flash 系列以”性价比”立身的定位,这是个没法洗的黑点。Conor Dart 用 Google 自家的 Antigravity 跑 AI 游戏生成测试后直言:木头纹理变差了,大理石没变化,这又是一次翻车。
多维评分
口碑这么两极,那用专业维度给它打个分。
| 维度 | 评分 | 一句话解读 |
|---|---|---|
| 功能完整性 | ⭐⭐⭐⭐☆ | 多模态全面,Computer Use 内置,缺图/音生成 |
| 易用性 | ⭐⭐⭐⭐☆ | API 迁移简单,AI Studio 无缝切换 |
| 性价比 | ⭐⭐⭐☆☆ | 比 3.5 Flash 便宜,但被 GPT-5.6 Luna 压着打 |
| 创新性 | ⭐⭐⭐☆☆ | 效率优化而非架构突破,无重大新能力 |
| 稳定性 | ⭐⭐⭐☆☆ | 中文和工具调用有随机性问题 |
| 推荐度 | ⭐⭐⭐☆☆ | Agent 场景可试,复杂推理建议看竞品 |
| 综合评分:6.7 / 10 |
好的坏的都说清楚
优势
-
Agent 场景效率显著提升:输出 Token 减少 17%-65%,同样任务成本大幅下降 -
编程能力实打实进步:DeepSWE 涨 32%,MLE-Bench 涨 29%,代码质量更接近生产标准 -
降价的真实诚意:输出 $9 降到 $7.5,Batch 模式对折,上下文缓存 $0.15 极具竞争力 -
多模态覆盖面广:支持五种输入格式,Computer Use 直接内置
不足
-
智能水平原地踏步:与 3.5 Flash 在 Artificial Analysis 上得分相同,用户感受不到”变聪明” -
性价比被竞品反超:GPT-5.6 Luna 更便宜且更聪明,Flash 系列的性价比人设受到挑战 -
中文支持拉胯:选词错误、翻译生硬、知识库空白,对中文用户不够友好
对号入座指南
优缺点都摆在这了,那到底谁适合用?
-
Agent 应用开发者:如果你在构建需要反复调用模型的 Agent 系统,3.6 Flash 的 Token 效率提升和 Computer Use 内置功能是实打实的价值。同样的任务更少步骤、更低成本,直接反映在账单上。 -
多模态处理团队:需要同时处理文本、图片、视频、音频和 PDF 的场景,3.6 Flash 的覆盖面在同等价位中是最广的。尤其是图表解读和视觉蓝图转换,比上一代有明显进步。 -
已有 Gemini 生态的用户:如果你已经在用 3.5 Flash 的 API,迁移到 3.6 Flash 几乎零成本,改个模型 ID 就行。价格更低、效果不降,没有不换的理由。 -
不太适合的人群:如果你需要的是最强的单次推理能力,做复杂数学证明、科研分析、高难度编码、或者对中文输出质量有极高要求,3.6 Flash 不是你的菜。GPT-5.6 Sol 或 Claude Sonnet 5 会更合适。
定价方案
找到适合你的场景了?来看看钱包撑不撑得住。
Gemini 3.6 Flash 的定价分四个消费模式(截至 2026 年 7 月):
| 消费模式 | 输入($/百万 Token) | 输出($/百万 Token) | 说明 |
|---|---|---|---|
| 标准(Standard) | 1.50 | 7.50 | 默认模式,适合实时请求 |
| 批量(Batch) | 0.75 | 3.75 | 对折,适合离线大批量任务 |
| 弹性(Flex) | 0.75 | 3.75 | 同为半价,非实时场景可用 |
| 优先(Priority) | 2.70 | 13.50 | 1.8 倍溢价,保证低延迟 |
| 免费版 | 免费 | 免费 | Google 用你的内容改进产品 |
上下文缓存价格额外 $0.15/百万 Token,这是多数团队低估的省钱杠杆。如果你在构建一个客服 Agent,每次请求都要带上相同的产品知识库作为上下文,设好缓存后输入成本能从 $1.5 降到 $0.15,月成本能砍掉一个数量级。Pro 提示:Batch 和 Flex 价格一样,区别是 Batch 通常在数小时内完成,Flex 在数分钟内,按紧急程度选。
你可能还想问
分数和价格都在这了,有些细节你可能还拿不准。
Q1:Gemini 3.6 Flash 和 3.5 Flash 比,到底聪明了多少?
A1:跑分涨了,但”聪明程度”基本没变。 Artificial Analysis 评测显示两个版本的智能指数相同。进步主要体现在效率上——同样聪明的模型,用更少的 Token 完成任务。
Q2:跟 GPT-5.6 Luna 比,选哪个?
A2:看场景。如果预算优先,Luna 更便宜($1/$6 vs $1.5/$7.5)且智能水平更高。 但如果你的应用需要多模态输入(视频、音频)或 Computer Use,3.6 Flash 是唯一选择。
Q3:免费版有什么坑?
A3:Google 会用你的输入内容来改进产品。 如果是商业数据或敏感信息,绝对不要用免费版。建议至少走标准付费 API,数据不会被用于训练。
Q4:Computer Use 能直接用吗?
A4:能用,但带着 Preview 标签。 意味着功能还不够稳定,Google 不建议直接用于生产环境 UI 自动化。先在沙箱环境测试验证,再考虑上线。
Q5:中文支持怎么样?
A5:不太好。 从 X 上的中文用户反馈和实测来看,中文选词、翻译和知识覆盖面都存在明显短板。如果主要使用场景是中文内容,建议先实际测试再决定。
Q6:支持图片和视频生成吗?
A6:不支持。 3.6 Flash 只能接收多模态输入,输出只有文本。图片生成和视频生成需要其他专用模型,音频生成和 Live API 也不支持。
Q7:从 3.5 Flash 迁移过来要改多少代码?
A7:基本不用改。 换个模型 ID(gemini-3.5-flash 改成 gemini-3.6-flash),去掉已废弃的采样参数,去掉 prefilled model turns 即可。Google 还提供了自动化迁移工具。
Q8:上下文窗口真的是 100 万 Token 吗?
A8:是,输入 1,048,576 Token,输出上限 65,536 Token。 这个窗口大小在同类模型中属于最大级别,适合一次处理几千页的技术文档或整个代码库。
Q9:批量处理(Batch API)有什么限制?
A9:半价,但不保证实时。 Batch 任务通常在几小时内完成,适合夜间批处理、数据标注、离线分析等非实时场景。不适合需要即时响应的用户交互。
Q10:3.6 Flash 适合生产环境吗?
A10:适合,它是 GA(Generally Available)状态。 Google 明确标注 3.6 Flash 为生产可用,企业级安全机制也到位。但复杂 Agent 场景建议在 staging 环境充分验证后再上线。
所以到底值不值得
Gemini 3.6 Flash 是一台效率机器,但它不是一个让人惊叹的模型。
它的进步是真实且可量化的:Token 少用了,价格降了,编程跑分涨了。对 Google 生态内的开发者来说,这是一次毫无痛感的升级。但如果你指望它像 GPT-5.6 或 Claude Sonnet 5 那样带来”哇,AI 又进化了”的感受,你会失望。
Google 这次的策略其实很清晰:在 3.5 Pro 难产、Gemini 4 还在预训练的窗口期,先用低价高效的 Flash 稳住开发者基本盘,不给 OpenAI 和 Anthropic 留空档。这个策略本身没毛病,但问题在于,对手不是原地等着的,GPT-5.6 Luna 比它便宜还比它聪明,Flash 系列引以为傲的性价比已经不再是独家优势了。
建议很直接:已经在用 Gemini 生态的,直接升,没坏处;纯看性价比选模型的,先试试 GPT-5.6 Luna 或等 3.5 Pro 发布后再做决定;需要中文高质量输出的,暂时不建议上主力。

