Gemini 3.6 Flash三款模型正式发布!2026最新使用全攻略(国内直连+API教程)

7 月 22 日,Google DeepMind 于昨晚一口气连发三款 Gemini 新模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 和 Gemini 3.5 Flash Cyber。
其中,主力模型 Gemini 3.6 Flash 在编码、多模态和知识工作方面全面提升,输出 Token 消耗比前代减少 17%,在 DeepSWE 等长周期任务中可节省 65% 的 Token 用量。定价也进一步下调,输入 $1.5/百万 Token、输出 $7.5/百万 Token,较 3.5 Flash 的 $9/百万输出 Token 有明显降幅。
与此同时,外界期待已久的旗舰模型 Gemini 3.5 Pro 再次缺席,谷歌表示它仍在与合作伙伴测试中。


新模型对比
模型 | 定位 | 输入价格 ($/1M) | 输出价格 ($/1M) | 上下文 | 最大输出 | 知识截止日期 |
gemini-3.6-flash | 主力工作马 | $1.50 | $7.50 | 1M | 64k | 2026年3月 |
gemini-3.5-flash-lite | 高速度/低成本 | $0.30 | $2.50 | 1M | 64k | — |
gemini-3.5-flash-cyber | 安全专精 | — | — | — | — | — |
Gemini 3.6 Flash
3.6 Flash 被谷歌定位为“面向真实生产环境的高效模型”。它的设计目标是用更少的 Token,完成同样的任务。根据 Artificial Analysis Index 的实测,输出 Token 使用量较前代降低 17%;在 DeepSWE 等需要多步骤推理和工具调用的复杂工程任务中,Token 消耗甚至减少了 65%。

和上一代模型相比,速度更快、Token 消耗更低
性能数据一览:
基准测试 | Gemini 3.6 Flash | Gemini 3.5 Flash | 提升幅度 |
DeepSWE(代码工程) | 49% | 37% | +12% |
MLE-Bench(机器学习工程) | 63.9% | 49.7% | +14.2% |
OSWorld-Verified(计算机使用) | 83.0% | 78.4% | +4.6% |
GDPval-AA v2(知识工作) | 1421 Elo | 1349 Elo | +72 Elo |
在金融领域,使用 AI Studio 的 Managed Agents 解析财务数据比 3.5 Flash 更高效准确;在代码迁移任务中,Antigravity 平台上延迟更低、质量更高;Figma、Harvey、Hebbia 和 JetBrains 等客户均表示 3.6 Flash 在 Token 效率、准确性和速度之间取得了更好平衡
Gemini 3.5 Flash-Lite
Flash-Lite 被定义为 3.5 系列中最快、最具性价比的模型。根据 Artificial Analysis 实测,生成速度达到 每秒 350 个输出 Token,约为上一代 3.1 Flash-Lite 的两倍。
同时输入 $0.30/百万 Token、输出 $2.50/百万 Token。低成本配合高速度,非常适合智能体搜索、大规模文档处理、批量分类。相比 3.1 Flash-Lite,新模型在 Terminal-Bench 2.1(54% vs 31%)、长上下文 GDM-MRCR v2(72.2% vs 60.1%)和 GDPval-AA v2(1140 vs 642)上均有显著提升。
Gemini 3.5 Flash Cyber

Flash Cyber 是一款专门针对网络安全漏洞检测与修复的模型。它基于 Gemini 3.5 Flash 构建,通过 CodeMender 安全智能体多次调用,让子智能体并行分析代码路径,最终汇总成一份漏洞报告。
在测试中,该模型对知名开源项目 V8 JavaScript Engine 进行分析,共发现 55 个问题,其中包括 10 个此前从未发现过的安全漏洞。
初期仅向政府机构和可信合作伙伴开放,作为试点项目的一部分。谷歌表示,这将帮助一线防御人员抢先发现并修复漏洞,同时尽可能降低模型滥用风险。

三种模型怎么选?
需要处理复杂 Agent、编码、多模态任务? → Gemini 3.6 Flash(能力均衡,Token 效率最高)
预算有限、吞吐量高、速度优先? → Gemini 3.5 Flash-Lite(最便宜、最快,适合批量处理)
API 中模型切换:
# 使用 3.6 Flash
model="gemini-3.6-flash"
# 使用 Flash-Lite
model="gemini-3.5-flash-lite"
国内用户怎么用?
方式一:官网直连

访问 gemini.google.com 或 Google AI Studio,需稳定代理,推荐美国或韩国干净 IP。AI Studio 中可获取 API Key:登录 → 点击“Get API Key” → 创建新项目。
方式二:国内中转 API
通过国内第三方 API 中转平台获取 Key,直接调用 Gemini API。这类平台通常兼容 OpenAI 接口规范,只需更换 base_url 和 API Key 即可完成接入。推荐非线智能API、星链4SAPI和硅基流动。
方式三:镜像站

这个更适合普通用户,如kula(yingcaiai.com)、ChatMax,合规的镜像站,能提供零配置直连服务。
方式四:Cloudflare Workers 反向代理
这是目前开发者社区最流行的方案。Cloudflare Workers 提供全球边缘计算节点,在国内大部分地区拥有较好的直连延迟。推荐AI-Worker-Proxy、llm-proxy-on-cloudflare-workers和gemini-playground。

API 调用教程
Python SDK 快速上手
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.6-flash",
input="Write a Python script that fetches data from an API and saves it to CSV."
)
print(interaction.output_text)
Thinking Level 控制
Gemini 3.6 Flash 支持 thinking_level 参数(minimal / low / medium / high),用于控制推理深度 vs 速度/成本的权衡。注意:API 已废弃 temperature、top_p、top_k 等参数。
高级功能
Function Calling:让模型调用外部工具
Computer Use:模型直接操作电脑界面(OSWorld-Verified 得分 83%)
上下文缓存:降低重复输入成本
多模态:支持文本、图像、视频、音频、PDF
实战案例:文档总结
from google import genai
client = genai.Client()
response = client.interactions.create(
model="gemini-3.6-flash",
input="Summarize this 100-page PDF report in 3 bullet points.",
# 附件通过 AI Studio 上传
)
print(response.output_text)成本优化
- 用 Flash-Lite 处理简单任务(输入仅 $0.30/百万 Token)
- 启用上下文缓存(缓存输入仅 $0.374/百万 Token)
- 降低 thinking_level(minimal 或 low 可大幅减少延迟和成本)

常见问题
Q:如何免费使用?限额多少?
A:AI Studio 提供免费额度。Gemini 3.1 Flash 每天免费调用 1500 次,3.1 Pro 每天 50 次。新模型的具体免费额度以 Google 官方公布为准。
Q:国内访问延迟高怎么办?
A:推荐使用国内中转 API 或 Cloudflare Workers 反向代理方案。避免使用公共代理,注意数据安全。
Q:Gemini 3.6 Flash 与 Claude/GPT 相比如何?
A:谷歌表示 3.6 Flash 在单位任务成本上低于 GPT-5.6 Terra Max、Kimi K3 和 Qwen 3.7 Max。在 DeepSWE(49%)和 MLE-Bench(63.9%)等编码基准上表现强劲。具体对比建议根据实际使用场景测试。
Q:3.5 Pro 什么时候发布?
A:谷歌表示 Gemini 3.5 Pro 目前正在与合作伙伴测试中,将在准备好后向广大用户开放。与此同时,更庞大的 Gemini 4 预训练工作已经启动。
Gemini 3.6 Flash 和 3.5 Flash-Lite 今日起已在 Gemini App、Google AI Studio、Android Studio 和 Google Antigravity 中可用。立即前往 Google AI Studio 或 Gemini API 文档 体验新一代高效 AI 模型!
相关链接:


