Google: Gemini 3.5 Flash
Gemini 3.5 Flash 是 Google Gemini 3.5 系列的首个模型,于 2026 年 5 月 19 日在 Google I/O 大会上发布。Google 将这次发布概括为「前沿智能 + 行动力」:它首先为智能体(Agent)和编码而设计,而非聊天。据 DeepMind 介绍,3.5 Flash 在几乎所有基准上都超越了此前的旗舰模型 Gemini 3.1 Pro,同时保持了 Flash 系列的低延迟与低成本特性。
核心功能
- 智能体优先架构:擅长复杂的长程任务,支持子智能体部署、快速智能体循环和大规模多步骤工具调用,且能持续保持前沿性能。
- 100 万 token 上下文:支持 100 万 token 输入上下文窗口与最高 65k 输出 token,足以容纳整个代码库或完整的研究管线。
- 思考层级控制:默认思考强度从 high 调整为 medium,同时显著改进了 low 档,使其在步骤较少的编码与智能体任务上更快、更便宜。
- 思维保留(Thought Preservation):在多轮对话中自动保留中间推理过程,无需任何 API 改动。
- 多模态基础:继承 Gemini 3 强大的多模态理解能力,在 CharXiv(84.2%)等视觉语言基准上领先。
性能亮点
- Terminal-Bench 2.1:76.2%,智能体编码评测成绩
- GDPval-AA:1656 Elo,经济价值知识工作任务评测
- MCP Atlas:83.6%,在评测模型中领先
- CharXiv:84.2%,多模态理解
- 长程智能体工作负载的成本不到同类模型的一半
可用性与定价
Gemini 3.5 Flash 已通过 Gemini API、Google AI Studio、Android Studio、Google Antigravity 和 Gemini Enterprise 全面开放,并已成为全球 Gemini 应用与搜索 AI 模式的默认模型。定价为每百万输入 token 1.50 美元、每百万输出 token(含思考 token)9.00 美元,缓存输入每百万 0.15 美元;AI Studio 提供限速的免费额度。
发布时 Gemini 3.5 Pro 已进入内部测试,计划次月向公众开放。
适用场景
- 自主编码智能体:可执行多步骤编码管线、探索多种方案并快速原型化,Google 在 I/O 上演示了它从零构建一个可用操作系统的能力。
- 大规模智能体编排:配合 Antigravity,3.5 Flash 可协调子智能体团队完成苛刻的生产任务。
- 长程研究:100 万上下文与思维保留能力使其非常适合跨多步骤、处理大量素材的研究项目。
- 成本敏感的生产环境:Flash 定价与改进后的 low 档思考模式,使其成为高并发智能体 API 的实用默认选择。
快速开始
- 打开 Google AI Studio,在模型列表中选择
gemini-3-5-flash。 - 在 Google Cloud Console 生成 API 密钥。
- 以模型 ID
gemini-3-5-flash调用 Gemini API,输入支持文本、图片、音频、视频。 - 按请求调整思考强度(low/medium/high),在质量、成本与延迟之间取得平衡。
优势对比
与它取代的 Gemini 3 Flash 相比,3.5 Flash 提供的是前沿级别的智能体与编码能力而非中端能力,价格只有小幅上调(从 gemini-3-flash-preview 迁移成本更高,但换来 GA 稳定性与显著更强的推理)。与其他前沿模型相比,它以 Flash 级别的速度与价格提供了接近旗舰的智能,这在市场上并不多见。
常见问题
知识截止时间是什么时候?
Gemini 3.5 Flash 的知识截止时间为 2025 年 1 月。需要最新信息时请使用搜索接地(Search Grounding)工具。
3.5 Flash 开源吗?
不开源。与 Gemini 家族其他模型一样,仅通过 Google 产品与 API 提供。
Gemini 3.5 Pro 何时发布?
发布时 Google 已在内部使用 3.5 Pro,计划在 I/O 发布会约一个月后向公众开放。
替代方案
- Claude Opus 5:Anthropic 的前沿模型,智能体编码能力强,支持 100 万上下文:/zh/items/models/claude-opus-5
- GPT-5.6:OpenAI 的旗舰推理系列:/zh/items/models/gpt-5.6
- GLM-5.3:智谱的开源权重编码与智能体旗舰模型:/zh/items/models/glm-5-3
总结
Gemini 3.5 Flash 是 Google 对「AI 下一波浪潮属于智能体而非聊天」这一判断的坚定押注。它以 Flash 级别的速度与成本提供接近前沿的智能,让长程智能体任务可以大规模落地。正在构建自主智能体、编码管线或研究自动化的开发者,应把它作为默认候选。
使用条款
使用须遵守 Google 的 Gemini API 服务条款。注意:免费额度发送的数据可能被用于改进 Google 产品。
评论
还没有评论。成为第一个评论的人!
相关工具
Google: Gemini 3 Flash
gemini.google.com
Google 最新前沿模型,以前所未有的速度和成本效益提供突破性智能。
Google: Gemini 2.0 Flash
gemini.google.com
Google 下一代多模态 AI 模型,拥有 2 倍速度提升、原生工具使用和多模态输出能力。
Google: Gemini 3 Pro
gemini.google.com
Google最新旗舰多模态大模型Gemini 3 Pro,在视觉理解、跨模态推理和复杂任务处理上达到业界巅峰水平,支持百万级令牌长上下文,适合企业级关键任务应用和前沿AI研究。
相关洞察

Anthropic Subagent:多智能体时代的架构革命
深入解析 Anthropic 的多智能体架构设计。了解如何通过 Subagent 突破上下文窗口限制,实现性能提升 90%,以及多智能体系统在 Claude Code 中的实际应用。
别再把 AI 助手塞进聊天框了:Clawdbot 选错了战场
Clawdbot 很方便,但将它放在 Slack 或 Discord 里操控,是从一开始就错的设计选择。聊天工具不是用来操作任务的,AI 也不是用来聊天的。
我把 Obsidian 接入 OpenClaw 后,它开始帮我做决策
当 Obsidian 不再只是记笔记,而是接入 OpenClaw 之后,它开始帮我整理信息、连接上下文、推动判断,甚至参与真实决策。