Gemini 3.7 Flash 测评:三周迭代,编码 Agent 的性价比天花板

让 AI 写完代码还要改五遍?给 Agent 挂上工具跑多步任务,半天卡在一个报错上?Gemini 3.7 Flash 就是奔着这两个痛点来的。谷歌三周内又发一版,DeepSWE 得分创下新高,速度冲上全网第一,价格还砍到竞品的三分之一。到底是不是编码 Agent 的新答案,我上手测了一遍。

Gemini 3.7 Flash 是谷歌 2026 年 8 月 13 日发布的 Flash 系列主力模型,官方定位直白:编码和智能体领域最强的 Flash 主力。它和前代 3.6 Flash 只隔了 23 天,谷歌这次没有重训底座,而是在 3.6 的推理层上做算法优化,把力气全砸在软件工程、网页开发和多步执行上。

官网:https://ai.google.dev/gemini-api

Gemini 3.7 Flash 测评:三周迭代,编码 Agent 的性价比天花板

它和上一代的区别很具体:3.6 Flash 已经能写代码,3.7 Flash 更强调”少改几遍”。官方公布的 DeepSWE v1.1 分数从 48.6% 跳到 65.3%,AutomationBench 几乎翻倍,从 17.0% 涨到 30.4%。翻译成人话,写出来的代码更接近能直接上生产,Agent 跑多步任务时更少卡壳。这轮更新也顺手把安全护栏加固了,CBRN 和网络攻击方向的滥用防护做了更新。

到底强在哪

定位清楚了,下面把它的硬实力一项项摊开来看。这版最大的变化不是参数,而是”少改几遍”被做成了核心卖点。

编码一次性成功率。官方最拿得出手的是 DeepSWE v1.1,从 48.6% 干到 65.3%。这个分数衡量的是模型在真实代码库里解决长链路软件工程问题的能力,不是刷题分数。FrontierCode 1.1 Main 也从 34.4% 涨到 43.6%。说白了,同样一个 bug,3.7 Flash 一次改对的概率明显更高,改完还能自己验证。

Agent 多步执行。这才是 3.7 Flash 真正的重心。官方强调它会更勤快地规划、更老实地调用工具,卡住时先澄清意图再换方案,而不是硬着头皮乱试。下面这张图是它跑一个编码 Agent 任务的完整链路:

Gemini 3.7 Flash 测评:三周迭代,编码 Agent 的性价比天花板

性能基准全线上涨。除了 DeepSWE,AutomationBench 从 17.0% 翻到 30.4%,GDP.pdf 文档处理从 22.0% 涨到 34.0%,WebDev Arena 的 Elo 也从 1538 爬到 1588。把四组关键分数摊开看,代际跃升一目了然:

Gemini 3.7 Flash 测评:三周迭代,编码 Agent 的性价比天花板

多模态与长上下文。输入支持文本、图像、音频、视频和 PDF,上下文窗口 1M tokens,输出上限 65K。三档思考层级(低、中、高,默认中档)让你在成本和深度之间自己调。因为输出 token 里含思考 token,这一档其实是控成本的关键旋钮。

上手流程

功能看着猛,上手才知道是真是假。谷歌给 3.7 Flash 铺了好几条入口,最轻的一条是 Google AI Studio。

打开 AI Studio,Google 账号直接登录,不用填表单。模型下拉里选 Gemini 3.7 Flash,就能对话、跑代码、传图传 PDF。我第一件事是丢给它一个真实场景:一段有 bug 的 Python 脚本,让它找出来改掉。它没有直接甩代码,先说了句问题可能出在哪个函数,然后给出修改,还自己补了一句验证方法。第一印象是稳,比 3.6 Flash 明显更少”自信地胡说”。

想走 API 的话,一条 curl 就能调通,终端里长这样:

Gemini 3.7 Flash 测评:三周迭代,编码 Agent 的性价比天花板

Antigravity 里可以把它挂成编码 Agent,Android Studio 里做移动开发也直接可选。消费者端只能通过 Gemini Spark 用上它,前提是 AI Pro 或 Ultra 订阅。

使用技巧

基础操作都会了?真正拉开差距的其实是这几个开关。很多人不知道还有这些进阶用法:

  • 用思考层级控成本:简单抽取、分类、格式转换一律切 low 档,复杂调试和长链路任务再上 high 档。输出 token 里混着思考 token,low 档能省下一大截调用费用
  • 批量任务走 batch 模式:不赶时间的离线任务用 batch 接口,输入价直接从 $0.75 降到 $0.19 每百万 token,约省 75%
  • 长文档直接整本丢:1M 上下文够塞下一整份财报或一个中型代码库,让它做跨文件分析,不用自己切块
  • 设计还原喂截图:给它一张网页截图或设计稿,它复刻出来的布局和功能完成度比上一代高一个档,前端原型能少改两轮
  • 锁定输出格式:系统提示词里写明”只输出 JSON”,配合它更忠实的指令跟随,做数据管线时省掉一堆解析兼容代码

竞品对比

光说它好不行,放一起比才知道值不值。同类产品里,GPT-5.6 Terra 和 Claude Sonnet 5 是绕不开的两个对手,前者押注更强的 agentic 能力,后者主打编码扎实。

维度 Gemini 3.7 Flash Gemini 3.6 Flash GPT-5.6 Terra Claude Sonnet 5
核心定位 编码+Agent 主力 前代主力 OpenAI 旗舰 Anthropic 主力
DeepSWE v1.1 65.3% 48.6% 69.6% 未公布
Terminal-bench 2.1 85.8% 78.0% 87.4% 未公布
AutomationBench 30.4% 17.0% 23.6% 10.7%
上下文窗口 1M 1M 未公布 未公布
混合成本(每 1M token) 约 $1.35 未公布 约 $4.00 约 $3.60

核心差异在定位。3.7 Flash 不是全面碾压,DeepSWE 和 Terminal-bench 还落后 Terra 两三个点,但 AutomationBench 这个更贴近企业真实工作流的测试反超了。真正拉开差距的是价格:混合成本约 Terra 的三分之一,Sonnet 5 的三分之一出头。同样的编码 Agent 跑一天,账单差距是实打实的。

真实用户怎么说

官方说得再好,不如看看开发者社区的真实声音。这版发布才两天,讨论已经挺热闹。

正面声音集中在两点。做编码 Agent 的开发者说,3.7 Flash 在终端自动化上的表现比上一代进步明显,Terminal-bench 2.1 从 78% 拉到 85.8%,跑起来更少中途断链。另一波人夸的是速度,Artificial Analysis 测出它输出 340.1 tokens/s,在 186 个模型里排第一,聊天和补全的手感都很跟手。

吐槽的也有。最集中的一条是图表分析倒退,CharXiv Reasoning 分数从 85.2% 掉到 84.5%,处理带图表的文档时不如上一代稳。还有人提醒别被”65.3%”冲昏头,换到更难的 Terminal-bench 3.0,它只有 14.9%,说明真正难啃的 agentic 任务,大家离解决还差得远。

多维评分

口碑有好有坏,拆开维度逐项打分更有参考价值。下面是八维加权评分,每项都对应上文的具体数据。

维度 权重 星级 一句话解读
功能完整性 20% ⭐⭐⭐⭐☆ 编码/Agent/多模态全,图表分析有倒退
易用性 15% ⭐⭐⭐⭐☆ AI Studio 免配置,三档思考可调
性能表现 15% ⭐⭐⭐⭐⭐ 输出速度全网第一,基准全线跃升
AI 能力 15% ⭐⭐⭐⭐☆ 编码强,难级 agentic 仍未破局
价格合理性 10% ⭐⭐⭐⭐⭐ 混合成本约竞品三分之一
生态集成 10% ⭐⭐⭐⭐⭐ AI Studio/Android/Antigravity 全家桶
文档与支持 10% ⭐⭐⭐⭐☆ 模型卡完善,架构沿用前代文档
更新频率 5% ⭐⭐⭐⭐⭐ 三周一迭代,节奏极快

综合评分:8.6 / 10

优缺点

优势

  • 性价比断层领先:$0.75 输入 / $3.75 输出的推广价,混合成本约为 Terra 和 Sonnet 5 的三分之一
  • 编码进步扎实:DeepSWE 65.3%、FrontierCode 43.6%,一次写对的概率比上代明显提高
  • 速度全网第一:340.1 tokens/s,交互响应几乎无感
  • 生态齐全:API、AI Studio、Antigravity、Android Studio、Spark 五条入口打通

不足

  • 图表分析倒退:CharXiv Reasoning 不升反降,处理带图文档是短板
  • 难级 agentic 未破局:Terminal-bench 3.0 仅 14.9%,离”自主完成复杂任务”还远
  • 无开源权重:闭源、无自托管,数据敏感场景只能走企业版或云上

适合谁用

了解了优缺点,来看看它到底适合哪些人。按优先级排个序。

  • 编码 Agent 开发者:跑多步工具调用、终端自动化,AutomationBench 反超旗舰,成本还低,是最划算的选择
  • 高频 API 用户:token 消耗大、对价格敏感的项目,混合成本只有竞品三分之一,账单压力小
  • 前端与原型开发:喂截图复刻网页的还原度更高,MVP 原型能少改几轮
  • 长文档分析:1M 上下文整本吞财报、合同、代码库,跨文件提取和总结省事
  • 不太适合的人群:如果你需要最强的复杂 agentic 能力,或者对带图表的专业文档精度有硬要求,GPT-5.6 Terra 或 Claude Sonnet 5 更稳,多花的钱买的是这块短板。

多少钱

功能心动了?先看看钱包答不答应。价格是这版最大的钩子,但有个时间窗口要盯紧。

计费项 推广价(至 2026-12-31) 2027-01-01 起
输入(每 1M token) $0.75 $1.50
输出(每 1M token) $3.75 $7.50
batch 输入(每 1M token) $0.19 待公布
batch 输出(每 1M token) $0.94 待公布

截至 2026 年 8 月官网显示,推广价是 3.6 Flash 发布价的一半,也是同档模型里最便宜的一档。按 80/20 的输入输出比算,混合成本约 $1.35 每百万 token,跑一个持续在线的编码 Agent,月账单能比用 Terra 省下六成。明年 1 月起价格翻倍,但即便如此,它大概率还是同档里最便宜的那个。

常见问题

看完评测,你可能还有这几个纠结的点,逐个说清楚。

Q1:Gemini 3.7 Flash 有免费额度吗?

A1:有,AI Studio 里免费试。 Google AI Studio 里选 3.7 Flash 可以直接用,有免费额度,够开发阶段调试和验证。正式接入 API 才按 token 计费。

Q2:支持中文吗?

A2:支持,中英文都流畅。 多模态输入对中文文档、中文代码注释的处理没有障碍,生成中文内容也自然,日常开发交流无压力。

Q3:需要下载安装吗?

A3:不用,纯云端调用。 API 和 AI Studio 都是网页或接口直连,无本地部署要求。唯一例外是 Android Studio 里作为内置模型,随 IDE 更新即可。

Q4:生成的内容能商用吗?

A4:能,但看走哪条入口。 API 和企业版产出可直接商用。消费者端的 Gemini Spark 生成内容商用条款略有不同,建议按实际入口查官方服务条款。

Q5:和 GPT-5.6 Terra 比该选谁?

A5:看你要极限能力还是性价比。 追求最强 agentic 和终端任务选 Terra;跑量大、重成本的编码 Agent,3.7 Flash 的性价比明显更高。

Q6:三档思考层级怎么选?

A6:默认中档,按任务深度调。 简单抽取和分类切 low 省钱,复杂调试和长链路规划切 high。输出含思考 token,层级直接决定单次成本。

Q7:上下文 1M 能放下什么?

A7:一整份财报或中型代码库。 1M tokens 足够塞下几百页文档或几万行代码,适合跨文件分析,不用自己切块再拼。

Q8:batch 模式有什么用?

A8:离线任务再省约 75%。 不赶时间的批量分类、抽取、翻译走 batch 接口,输入价从 $0.75 降到 $0.19,是控成本的关键手段。

Q9:开源吗,能自托管吗?

A9:不能,闭源纯云端。 无开源权重,也不支持本地或隔离环境部署。数据敏感场景只能走 Google 企业版或信任其数据保留政策。

结论

Gemini 3.7 Flash 是一次目的明确的迭代:它不争”最强模型”的头衔,而是把编码和 Agent 的性价比做到极致。DeepSWE 拉到 65.3%、速度全网第一、价格砍到竞品三分之一,这三件事放在一起,对天天跑 agent 的开发者是实打实的诱惑。

它不是没有短板,图表分析倒退、难级 agentic 未破局、闭源无自托管,这几条决定了它当不了万能工具。但如果你要的是便宜、快、够用的编码 Agent 底座,这版几乎找不到更划算的选项。

建议很直接:先去 AI Studio 用免费额度跑几个真实任务,感受一下”少改几遍”是不是真的。顺手的话,赶在年底推广价到期前切到 API 或 batch,是这轮迭代里最值得做的动作。

AI工具

库库AI 评测:百度把 GenFlow 更名后,金融办公的"自动挡"到底灵不灵

2026-8-14 18:00:33

行业动态

别再追着AI跑了:把它放进这3个每天必经的工作场景,效率至少提升80%

2026-7-28 11:13:00

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧