Gemini 3.8 Flash 评测:六分之一价格逼近 Opus 5,通用 Agent 仍是硬伤

跑一晚上 Agent,账单比模型本身还贵?Gemini 3.8 Flash 的答案是:用大约六分之一的价格,在终端编程和法律 Agent 上反超 Anthropic 旗舰。百万上下文、可调思考力度、Flash 级速度,一个不少。代价同样直接:输出只给 64K,通用 Agent 能力仍被甩开一大截。值不值得换,往下看。

先搞懂它是什么

Gemini 3.8 Flash 是 Google DeepMind 在 2026 年 9 月 2 日放出的最新一代轻量主力,官方定位是”迄今最聪明的 Flash 模型”,主攻长周期软件工程、自主 Agent 和复杂的企业工作流。它不是一次全新预训练,而是在 3.7 Flash 基础上的迭代,模型卡里写得明明白白。背景值得补一句:3.6 Flash 上线是 7 月 31 日,3.7 Flash 是 8 月 13 日,3.8 Flash 是 9 月 2 日,六周内连推三代,不到四个月里已经换了四个 Flash 型号,节奏压到接近月度。

跟 Pro 线不同,Flash 的核心从来不是把天花板顶到最高,而是在单位成本上把可用性做到极致。3.8 这一代把这个逻辑又往前推了一格:碰到复杂任务,它会主动多走几步推理、反复调用工具、回头校验中间结果,而不是一次性把答案吐完。

官网:https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash

Gemini 3.8 Flash 评测:六分之一价格逼近 Opus 5,通用 Agent 仍是硬伤

到底强在哪

定位说清楚了,接下来看看它手里到底握着哪些牌。

能力项 规格 关键说明
上下文窗口 输入 1,048,576 / 输出 65,536 输入百万级,输出卡在 64K
输入模态 文本、图像、视频、音频、PDF 支持 Agentic 视频理解(预览)
输出模态 仅文本 不支持图像生成、音频生成、Live API
思考档位 low / medium / high(默认 medium) minimal 不支持,传了直接报错
Agent 工具链 Function Calling、代码执行、搜索接地、Maps 接地、URL 上下文、文件搜索、Computer Use(预览) Computer Use 仍在预览阶段
服务档位 Standard / Flex / Batch / Priority Flex 与 Batch 均为标准价五折
上下文缓存 隐式 + 显式,缓存读取 $0.075/百万 token 约为标准输入价的十分之一

Gemini 3.8 Flash 评测:六分之一价格逼近 Opus 5,通用 Agent 仍是硬伤

这张架构图里最值得看的是中间那圈。3.8 Flash 的”更努力”不是空话:思考层按档位决定推理深度,工具循环把执行结果回填给思考层再校验一轮,整个环是闭合的。这也是它跟前代最大的结构性差别。

触达渠道这一层同样值得注意。它现在是 Google Antigravity 托管 Agent 和 Antigravity SDK 的默认模型,同时在 Gemini App(Pro / Ultra 订阅用户)、AI Studio、AI Mode、Gemini Enterprise Agent Platform 以及 Gemini API 全量开放,没有预览门槛。一家公司的模型能同时压在自己的 Agent 平台、搜索入口和企业运行时上,这是别家给不了的组合拳。

实操流程

规格看完还是纸上谈兵,真跑一遍才知道顺不顺手。

上手这件事对开发者几乎零门槛。有 Google 账号就行,进 AI Studio 点一下创建密钥,直接生成,不用绑卡,免费层也有可用额度。不想碰控制台的话,本地装个 SDK 一样能开跑,代码侧几乎不用改:装好 SDK,把 model 字符串从 gemini-3.7-flash 换成 gemini-3.8-flash,其余参数原样保留,两代输出就能直接对拍,做 A/B 测试的成本基本为零,这是同价位迭代最大的好处。

真正需要动的只有一个 thinking_level 参数。默认 medium 就能跑通大多数场景,想要更深推理就设 high,官方也明说高档位会烧掉更多 token;想省钱压到 low 即可,分类抽取这类轻活完全够用。注意 minimal 在 3.8 Flash 上不支持,传进去会直接返回错误,写代码时把这条注释掉最稳妥。

from google import genai
from google.genai import types

client = genai.Client()  # 读取 GEMINI_API_KEY 环境变量

resp = client.models.generate_content(
    model="gemini-3.8-flash",
    contents="重构 src/pipeline 下的异步任务调度,补齐单元测试并列出改动点",
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(thinking_level="high"),
    ),
)

print(resp.text)
print(resp.usage_metadata)  # 重点看 thoughts_token_count 烧了多少

Gemini 3.8 Flash 评测:六分之一价格逼近 Opus 5,通用 Agent 仍是硬伤

体感上最扎眼的一点:它是真的想得很多。AI Studio 里能直接看到 thoughts_token_count,high 档下想法 token 经常比最终输出还多,官方也明说高档位会烧更多 token。按量计费又没设上限的话,账单会比直觉高出一截,这条务必写进预算模型。

进阶玩法

会用只是及格线,下面这几条才是真正拉开效率差距的地方。

很多人不知道还有这些进阶用法:

  • 档位不是越高越好:独立评测里 high 档智能指数 59、medium 57,只差 2 分,每任务成本却从 $0.41 涨到 $0.58,贵四成多。分类、抽取、批量改写这类活压到 low,成本直接落到 $0.24
  • Batch API 直接砍半:离线批处理走 Batch API,输入 $0.375、输出 $1.875,都是标准价五折。夜间评测、大批量数据清洗走这条路,等于白捡一倍吞吐
  • 上下文缓存是 Agent 的命根子:缓存读取 $0.075/百万 token,比标准输入便宜约 90%。系统提示词稳定的 Agent 循环,务必把长提示挂到缓存上,跑一百轮能省下九成输入费
  • 输出 64K 是硬墙:一次让它吐出整个大文件的重构方案必然截断。拆成分批调用、让它先给改动清单再逐文件落地,成功率明显更高
  • 3.7 Flash 还在服役:官方继续支持前代。成本敏感、又不需要最新推理深度的场景,完全没必要急着迁移,等优惠价到期前再评估也不迟

谁更值得买

数据摆完,绕不开的问题还是放到整个赛道里它算老几。

截至 2026 年 9 月,Agent 任务的主力对手是 Anthropic 的 Claude Opus 5、OpenAI 的 GPT-5.6 Sol 与 Terra,再加上自家上一代 3.7 Flash,先看这张对比表。

指标 Gemini 3.8 Flash Gemini 3.7 Flash Claude Opus 5 GPT-5.6 Sol GPT-5.6 Terra
输入/输出价($/1M) 0.75 / 3.75(优惠) 0.75 / 3.75(优惠) 5.00 / 25.00 4.00 / 20.00 2.00 / 12.00
AA 智能指数 59(high) 56 未公布 59(xhigh) 57(max)
DeepSWE v1.1 73.7% 65.3% 74.0% 72.7% 69.6%
Terminal-bench 4.0 19.1% 11.2% 51.8% 37.3% 23.6%
单任务成本(AA) $0.58 $0.40 未公布 未公布 $0.53
一句话定位 长程编程 + 专业 Agent 的性价比王 同价前代,轻任务备用 通用 Agent 标杆 OpenAI 旗舰 OpenAI 中端

Gemini 3.8 Flash 评测:六分之一价格逼近 Opus 5,通用 Agent 仍是硬伤

把这张表读透,结论其实很清爽。智能指数 59 分跟 GPT-5.6 Sol 的最高档打平,单任务成本 $0.58 却不到对方的零头;跟自家 3.7 Flash 比,多花的 $0.18 换来了 3 分智能,以及长周期软件工程上约 8 个百分点的提升,这笔账算得过来。

反过来看,它输的地方同样不含糊。GDPVal-AA v2 的知识工作 Elo 只有 1545,Opus 5 是 1824,差了接近 280 分;Terminal-bench 4.0 只有 19.1%,Opus 5 是 51.8%,差了 2.7 倍。翻译成人话:在需要长时间自主规划、中途频繁纠偏的通用 Agent 任务上,它还不够格当主力。

真实用户怎么说

厂商的分数总归是自己跑的,外面的声音更值得听。

Google 内部的声音偏正面但也带保留。有媒体报道称,在内部编程工具 Jetski 上的并排测试中,部分工程师更偏好它而非 Anthropic 的 Opus 模型。这条结论的评测环境、样本量、对照版本全部未公开,只能当方向性信号看,不能当证据用。

第三方机构给的数据更硬一些。Artificial Analysis 的智能指数给到 59 分,比 3.7 Flash 的 56 分涨了 3 分;高思考档下输出速度仍有约 300 token/秒,在同类模型里属于第一梯队。同一份评测也点名了它的毛病:输出偏啰嗦,平均每个任务要吐 4.8 万输出 token,比 3.7 Flash 多出约三成。

独立编码榜单上的反馈最能说明问题。DeepSWE 长周期软件工程它做到 73.7%,跟 Opus 5 的 74.0% 只差 0.3 个百分点,单价却只有对方的六分之一左右,有人形容这是用买自行车的钱买到了摩托车的速度。

吐槽的声音集中在两点。一是输出 64K 的上限被普遍认为”太小气”,一次跑不完大型重构;二是模型卡自己承认存在幻觉、偶发变慢或超时,而且高思考档位会显著推高 token 消耗。另外官方也提示,非英语场景的安全表现相比 3.7 Flash 有轻微回退,涉及多语言合规的团队得自己跑回归。

综合打分

听得差不多了,按固定的八个维度给它算一笔总账。

维度 权重 评分 一句话解读
功能完整性 20% ⭐⭐⭐⭐☆ 工具链齐全,缺图像音频输出与微调
易用性 15% ⭐⭐⭐⭐⭐ 换一行模型 id 即可,AI Studio 零配置
性能表现 15% ⭐⭐⭐⭐⭐ 约 300 tok/s 第一梯队,高思考档偶发超时
AI 能力 15% ⭐⭐⭐⭐☆ 编码与专业 Agent 强,通用 Agent 偏弱
价格合理性 10% ⭐⭐⭐⭐⭐ 单任务 $0.58 同档最低,2027 年翻倍
生态集成 10% ⭐⭐⭐⭐⭐ Antigravity 默认模型,Google 全栈打通
文档与支持 10% ⭐⭐⭐⭐☆ 模型卡大量指向 3.7,3.8 细节偏薄
更新频率 5% ⭐⭐⭐⭐⭐ 六周三连发,代价是跟进成本

综合评分:8.4 / 10

优点和槽点

优势

  • 性价比断层领先:智能指数 59 分,单任务成本 $0.58,同档位里找不到第二个能同时做到这两条的模型
  • 速度是真快:305 tokens/秒的输出速度是榜单第二名的两倍以上,交互式 Agent 的等待感明显更轻
  • 专业领域 Agent 反超旗舰:金融 Agent 61.4%、法律 Agent 10.0%、终端编程 89.4%,三项都是全场第一
  • 迁移成本几乎为零:价格与前代持平,模型字符串改一行就能切,不用重新评估预算
  • 生态铺得够满:从消费端 Gemini App 到开发者端 Antigravity 再到企业端 Gemini Enterprise,一套权重打通

不足

  • 通用 Agent 能力差得远:Terminal-bench 4.0 只有 19.1%,Opus 5 是 51.8%;OSWorld-2.0 是 59.0% 对 75.4%
  • 输出上限只有 64K:百万输入配 64K 输出,比例严重失衡,大型重构必须拆分调用
  • 输出偏啰嗦:平均每个任务吐 4.8 万输出 token,比前代多约三成,按 token 计费时是笔隐性开销
  • 知识截止日期分裂:部分领域到 2026 年 3 月,另一些领域仍停在 2025 年 1 月,时效敏感场景要额外接地
  • 优惠价有保质期:2027 年 1 月 1 日起单价翻倍,长期预算不能按现在的数字算

适合谁用

分数是分数,落到具体的人头上才算数。

  • 跑量型 Agent 团队:每天几千上万次工具调用、单次任务难度中等的场景,六分之一的价格差足以改变单位经济模型,这是它的主战场
  • 长周期编码流水线:多文件重构、测试补齐、代码库迁移这类需要反复调用工具的任务,DeepSWE 74% 的表现已经够用
  • 专业文档处理场景:金融研报、法律文书、PDF 批量抽取,它在金融和法律两个 Agent 榜单上都是第一,专业度经得起验证
  • 已经绑在 Google 技术栈上的团队:用 Antigravity 做 Agent、用 Vertex 做部署、用 AI Mode 做分发的,切过去几乎没有摩擦成本
  • 需要自主规划的超长任务、桌面操作自动化、多语言安全合规的团队:这三类场景建议继续用 Opus 5 或其他旗舰,3.8 Flash 目前顶不上来

算笔账

聊到钱,这部分可能是它最有杀伤力的地方。

档位 输入($/1M) 输出($/1M) 说明
标准(优惠价,2026-12-31 前) $0.75 $3.75 在线业务、Agent 主流量
标准(常规价,2027-01-01 起) $1.50 $7.50 长期预算按此重算
Batch API $0.375 $1.875 离线批处理、夜间评测,五折
Priority 推理 $1.35 $6.75 客服、实时风控,不可抢占(优惠期价)
上下文缓存读取 $0.075 输出按标准计 命中缓存约省九成输入费

截至 2026 年 9 月官网定价,这个价位大概是 Opus 5($5 / $25)的六到七分之一,也明显低于 GPT-5.6 Sol($4 / $20)。促销价是发布期拉新的手段,2027 年 1 月起标准价翻倍,真要长期重度调用,现在就该把预算模型按 $1.50 / $7.50 来搭。

要说值不值,得看你跑什么。中等难度的 Agent 任务,它的单任务成本压到 $0.58,同样的预算能跑的任务量是 Opus 5 的好几倍;但如果你的任务需要长时间自主纠错,它多走的推理步和多调的工具会吃掉这部分差价,甚至倒挂。

提前帮你问好了

还剩几个被问得最多的问题,一次性答清楚。

Q1:3.8 Flash 和 3.7 Flash 该选哪个?

A1:绝大多数场景直接上 3.8。 两者定价完全相同,3.8 在所有公开基准上都持平或超过前代,长周期软件工程从 65.3% 提到 73.7%。只有一种情况值得留在 3.7:你的任务极度成本敏感且完全不需要深度推理。

Q2:有免费额度吗?

A2:有。 AI Studio 提供免费层额度,注册 Google 账号即可使用,具体限额随模型与地区浮动。Gemini App 的免费用户暂不开放该模型,Pro 和 Ultra 订阅用户可用。API 侧按量计费,没有强制绑卡门槛。

Q3:上下文 100 万,输出 64K 会不会不够用?

A3:够用于对话,不够用于大批量生成。 输入侧百万 token 能塞下整个中型仓库,但输出 64K 大约对应两三百行代码或一份中等长度文档。生成长文件时务必拆批,或者让它先输出改动清单再逐段落地。

Q4:thinking_level 该怎么设?

A4:默认 medium 就够,别无脑拉满。 独立评测里 high 档智能指数 59,只比 medium 的 57 高 2 分,每任务成本却从 $0.41 涨到 $0.58。分类、抽取、格式转换这类任务压到 low,长周期重构、多步推理才值得开 high。

Q5:跟 Claude Opus 5 比谁更强?

A5:分场景,不能一概而论。 终端编程、金融 Agent、法律 Agent、长视频理解这几项 3.8 Flash 领先;知识工作 Elo、通用 Agent、桌面操作这三项 Opus 5 大幅领先。价格差六到七倍,本质是”够用就好”和”不计成本要最好”的选择。

Q6:支持生成图片或语音吗?

A6:都不支持。 3.8 Flash 的输出只有文本,图像生成、音频生成、Live 实时语音 API 全部不支持,微调也不在支持列表内。需要这些能力得走 Gemini 其他专用模型。

Q7:知识截止到什么时候?

A7:分裂的,这点要留意。 官方模型卡写明部分领域更新到 2026 年 3 月,另一些领域仍停留在 2025 年 1 月。做时效性强的查询时,记得打开搜索接地补上这一课。

Q8:Gemini 3.8 Flash Cyber 是什么?普通人能用吗?

A8:是同日发布的网络安全专用变体,普通人用不了。 它主打漏洞发现与自动打补丁,Chrome 安全团队实测它产出的正确补丁是其他商业模型的 2.6 倍,在 Wiz 内部渗透基准上召回率高出 7.5 到 9.7 个百分点。目前仅通过 Fairwind 计划向政府与关键基础设施机构开放。

Q9:企业数据隐私和合规怎么算?

A9:取决于入口。 走 Gemini API 与 AI Studio 适用 Gemini API 附加条款,走 Gemini Enterprise Agent Platform 适用 Google Cloud 服务条款。涉敏数据建议走 Vertex AI 上的企业版通道,并确认数据不被用于训练。

Q10:2027 年涨价之后还划算吗?

A10:仍然划算,但优势会收窄。 常规价 $1.50/$7.50 依旧只有 Opus 5 的三分之一左右,Batch 五折后是 $0.75/$3.75,等于现在的优惠水平。真正要防的是高思考档位带来的 token 膨胀,那部分不受单价控制。

结论

Gemini 3.8 Flash 是这几年少见的”加量不加价”样本。同样的钱,拿到的长周期编码能力和专业领域 Agent 能力直接跳了一档,终端编程 89.4%、法律 Agent 10.0%、金融 Agent 61.4%,三项全场第一,这些不是营销话术,是写进模型卡可以对着查的数字。

该劝退的地方也得说清楚。它在通用 Agent 和桌面操作上跟 Opus 5 差着两倍以上,输出只有 64K,跑标准评测烧掉 1.2 亿输出 token 的毛病会实打实反映到账单上。还有一条容易被忽略:优惠价 2026 年 12 月 31 日到期,明年单价翻倍,长期预算别按今天的数字排。

一句话建议:如果你在跑中等难度、大批量的 Agent 或编码流水线,现在就切,A/B 测试的成本只有一行代码;如果你要的是长时间自主规划、桌面自动化这类硬骨头,继续用 Opus 5,别为了省钱把主力换掉。至于观望的人,三个月后看它涨不涨价、Gemini 4 什么时候落地,再做决定也不迟。

AI工具

Claude Mythos 5.1 评测:被锁在玻璃箱里的"地表最强"孪生模型

2026-9-2 13:15:16

行业动态

专为 Managed Agents 而生的 Harness 底座:AgentScope 2.0

2026-7-28 10:55:00

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧