Google于2026年7月21日发布Gemini 3.6 Flash、3.5 Flash-Lite和面向安全防御的3.5 Flash Cyber。三者不是简单的大小关系:3.6 Flash面向复杂Agent、编码和知识工作,Flash-Lite面向高吞吐低成本任务,Flash Cyber则与CodeMender结合并采用有限访问。开发者应按任务风险、延迟、质量和总成本选择。
3.6 Flash适合做什么
3.6 Flash提升了编码、知识工作、多模态理解和计算机操作能力,并减少不必要的输出Token和工具循环。它更适合作为主Agent,负责规划、复杂文档分析、代码迁移和需要多步判断的任务。
官方价格为每百万输入Token 1.50美元、输出Token 7.50美元。实际成本不能只按单价计算,还要统计每个任务调用次数、工具重试、上下文长度和失败率。更强模型如果少走弯路,单任务成本可能反而更低。
3.5 Flash-Lite适合高并发
Flash-Lite强调速度和价格,适合搜索、分类、抽取、翻译、收据处理和批量子任务。官方公布的价格更低,并提供不同思考等级,开发者可在低延迟与多步能力之间调整。
它适合作为子Agent或前置过滤器,但关键决策仍可交给3.6 Flash。常见架构是Lite处理大量简单样本,置信度低或规则复杂时升级到主模型,从而控制整体成本。
Flash Cyber不是通用聊天模型
3.5 Flash Cyber针对发现、验证和修复软件漏洞,并与多个Agent组成的CodeMender系统配合。由于网络安全能力具有双重用途,Google计划仅向政府和可信合作伙伴提供有限试点。
企业不能把安全模型当作自动攻击工具。合法使用需要明确授权范围、隔离环境、漏洞披露流程和人工复核。自动生成补丁后仍要运行回归测试,避免安全修复破坏业务。
建立自己的模型路由
先把请求分成简单抽取、复杂推理、代码、高风险执行和安全分析,再用真实数据测试准确率、延迟、Token、工具调用和失败恢复。不要只看公开排行榜。
生产环境应记录模型版本,因为同一名称更新后行为可能变化。设置质量阈值和回退策略,关键结果可由第二模型或规则检查。模型选择是一套持续运营机制,不是一次配置。
可直接执行的操作清单
- 按复杂度、风险和吞吐把任务分成不同队列。
- 用真实样本比较3.6 Flash与Flash-Lite的单任务总成本。
- 简单批量任务优先Lite,复杂规划和低置信度任务升级。
- 安全模型只在授权隔离环境使用并人工复核补丁。
- 记录版本、质量、延迟和成本,持续调整路由规则。
总结
Gemini新Flash系列强调按工作负载分工。主模型负责复杂与关键任务,轻量模型承担规模化处理,安全模型受控使用。建立可观测的模型路由,比所有请求固定调用一个模型更经济可靠。
参考资料:官方发布与产品说明。本文依据公开资料重新整理并加入应用方法、风险提示和落地建议。