今天翻了一圈 Gemini 3.5 Flash 的资料,最直接的感受是:Google 这次把 “Flash” 这个名字用得有点容易误导。它不太像传统意义上的便宜小快灵模型,更像一个面向智能体和编码任务的高端 Flash。
它确实很快,也确实强了不少;但如果你是冲着“Flash = 便宜”去的,这次可能会失望。
先把硬参数放这里
Google 这次先发布的是 Gemini 3.5 Flash,3.5 Pro 还没公开。官方说 3.5 Pro 已经在内部使用,计划下个月推出。
目前公开信息里,Gemini 3.5 Flash 的核心规格大概是这样:
- 模型 ID:
gemini-3.5-flash - 发布状态:GA,正式版
- 发布时间:2026 年 5 月 19 日
- 输入:文本、代码、图片、音频、视频、PDF
- 输出:文本
- 上下文窗口:1,048,576 tokens,也就是 1M 级别
- 最大输出:65,535 tokens,DeepMind model card 里写的是 64K token output
- 知识截止:2025 年 1 月
- 支持工具:Google Search grounding、代码执行、系统指令、函数调用、结构化输出、token 统计、显式/隐式上下文缓存、聊天补全
- 不支持:Gemini Live API、C2PA;AI Studio 文档里还提到 Computer Use 当前不支持
- thinking level:
minimal、low、medium、high,默认从 Gemini 3 的 high 改成了 medium
API 迁移上也有变化。Google 现在不推荐在 Gemini 3.x 里继续手动调 temperature、top_p、top_k,也不推荐再用裸数字形式的 thinking_budget,建议改用 thinking_level。这点很值得注意,尤其是已经把 Gemini 接进业务系统或 Agent 框架的人。
Google 自己怎么说
Google 的定位很明确:Gemini 3.5 Flash 是面向智能体、编码、长周期任务的模型。
官方给了几个重点数字:
- Terminal-Bench 2.1:76.2%
- GDPval-AA:1656 Elo
- MCP Atlas:83.6%
- CharXiv Reasoning:84.2%
- 输出速度:比其他前沿模型快 4 倍
DeepMind 的 model card 里还有更完整的对比:
- SWE-Bench Pro:55.1%,高于 Gemini 3 Flash 的 49.6%,也略高于 Gemini 3.1 Pro 的 54.2%
- MCP Atlas:83.6%,明显高于 Gemini 3 Flash 的 62.0%,也高于 Gemini 3.1 Pro 的 78.2%
- OSWorld-Verified:78.4%,接近 GPT-5.5 的 78.7%
- Finance Agent v2:57.9%,比 Gemini 3 Flash 和 Gemini 3.1 Pro 都高不少
- MMMU-Pro:83.6%
- ARC-AGI-2:72.1%,但低于 Gemini 3.1 Pro 的 77.1%,也低于 GPT-5.5 的 84.6%
- MRCR v2 长上下文 128k:77.3%,低于 Gemini 3.1 Pro 和 GPT-5.5
- MRCR v2 1M pointwise:26.6%,只比 Gemini 3 Flash 的 22.1% 和 Gemini 3.1 Pro 的 26.3% 高一点
这组数据看下来,3.5 Flash 最突出的不是“全面碾压”,而是智能体、工具调用、编码和多模态理解这几块涨得很明显。长上下文有 1M,但满上下文下的有效表现不要想当然当成“1M 都稳”。
第三方评测:快是真的,贵也是真的
Artificial Analysis 给 Gemini 3.5 Flash 的评价很有参考价值。他们认为它站到了“智能程度 vs 速度”的前沿位置,但成本已经不像传统 Flash 那么友好了。
几个关键点:
- Artificial Analysis Intelligence Index:55 分,比 Gemini 3 Flash 高 9 分
- 输出速度:超过 280 tokens/s
- 价格:每 100 万输入 tokens 1.50 美元,每 100 万输出 tokens 9.00 美元
- 对比 Gemini 3 Flash:原来是 0.50 / 3.00 美元,现在价格直接 3 倍
- 跑他们的 Intelligence Index 成本:约为 Gemini 3 Flash 的 5.5 倍,比 Gemini 3.1 Pro 还高 75%
- 缓存输入 tokens 有 90% 折扣
也就是说,它不是“更便宜的 Flash”,而是“更快的高端 Flash”。如果任务本身会产生很多轮对话、很多工具调用、很多输入 token,真实账单可能比名字看起来重得多。
社区实测的声音更分裂
社区反馈目前比较分裂。
一类人很兴奋,尤其看重它的速度、编码推理和多模态能力。HN 上有人甚至根据 TPU 8i、速度和显存约束猜它可能是 250B-300B 总参数、10B-16B active 参数级别。当然这只是“餐巾纸估算”,Google 没公开参数,不能当事实。
另一类人就没那么买账。有人在 Google AI Developers Forum 里吐槽 Antigravity 2.0 和 3.5 Flash 在长上下文、长周期任务里会出现压缩后遗忘细节的问题。也有人直接说它“just fine”:基准很好看,速度很好看,但成本和真实长任务稳定性还要再观察。
这其实不矛盾。Flash 系列本来就容易让人默认它是便宜、快、适合高频调用。但 3.5 Flash 已经明显往“能干复杂事”的方向推了。复杂事会吃更多 token,也会更依赖工具链、上下文管理、Agent harness。模型本身强了,不代表整套体验就必然稳。
几个更接近实际使用的问题
第一,Agent 场景会更依赖“任务拆分”和“上下文纪律”。
Google 一直强调 Antigravity、subagents、并行智能体。3.5 Flash 在 MCP Atlas、Terminal-Bench、GDPval-AA 这些指标上确实好看。但如果真实任务里随便塞大上下文、反复回读、工具链没有边界,还是可能出问题。论坛里关于 compaction amnesia 的吐槽就是这类问题。
第二,价格判断要换口径。
不能只看每 100 万 token 单价。Agent 任务经常会多轮循环、工具调用、读文件、写文件、再验证。Artificial Analysis 提到 3.5 Flash 跑评测时输入 token 用量显著增加,主要来自 agentic evaluations 的轮次增加。这个对实际使用很关键。
第三,3.5 Flash 对多模态输入仍然是 Google 的强项。
图片、视频、音频、PDF 都能进,输出文本。MMMU-Pro 和 CharXiv Reasoning 的成绩也不错。拿来做 OCR、票据理解、图表推理、文档审阅,应该会比单纯聊天更能体现优势。
第四,开发者迁移要注意参数习惯。
Gemini 3.x 的推荐用法正在往默认采样 + thinking_level 迁移。以前那套 temperature/top_p/top_k 精调,不是完全不能用,但官方已经不推荐。做应用的人最好早点改,不然之后排查效果波动会更麻烦。
值不值得用
目前可以先按这个口径判断:
如果你要做编码 Agent、工具调用、多模态文档处理、需要低延迟但又不想降太多能力,Gemini 3.5 Flash 很值得试。
如果你只是普通聊天、摘要、轻量分类、批量低成本任务,它未必划算。Gemini 3 Flash、3.1 Flash-Lite,甚至其他便宜模型可能更合适。
如果你期待它像顶级 Pro/Opus/GPT 那样稳定处理很长、很乱、跨很多文件的工程任务,最好别只看发布会数字。要自己拿真实项目测。尤其要测长任务中途是否丢细节、工具调用是否稳定、失败后能不能自我修正。
这次 3.5 Flash 最有意思的地方不在“Flash 又快了”,而在 Google 正在把 Flash 这个系列从轻量模型,推成主力 Agent 模型。它可能会很好用,但名字里的 Flash 已经不能简单理解成便宜模型了。
资料来源:Google Blog、Google Cloud / AI Studio 文档、Google DeepMind Model Card、Artificial Analysis、Hacker News 与 Google AI Developers Forum 的早期讨论。