谷歌发布Gemini 3.6 Flash等三款新模型,聚焦企业AI智能体成本与延迟优化
谷歌推出Gemini 3.6 Flash、3.5 Flash-Lite及受限版3.5 Flash Cyber三款新模型,专为降低企业级AI智能体的token消耗与推理延迟。其中3.6 Flash在多项基准测试中输出token减少17%–65%,推理成功率显著提升;Flash-Lite主打高吞吐文档处理;Flash Cyber则面向安全团队提供代码漏洞修复能力,仅限政府及认证合作伙伴试用。
三款新模型分层定位企业AI智能体需求
谷歌本周正式发布Gemini 3.6 Flash、Gemini 3.5 Flash-Lite及Gemini 3.5 Flash Cyber三款模型,旨在系统性优化企业环境中自主AI智能体(AI agents)的运行经济性——核心指标是降低token消耗与端到端延迟。与面向对话交互的模型不同,后台运行的智能体需在高频次(每小时数千次)、多步骤任务中保持稳定吞吐,对推理速度与单位token成本更为敏感。新系列据此划分职责:3.6 Flash主攻编码与多模态复杂推理;3.5 Flash-Lite专注高并发、低延迟的批量文档处理与检索;3.5 Flash Cyber则是面向网络安全场景的受限模型,专用于漏洞验证与修复。
Gemini 3.6 Flash:更少token,更高成功率
据谷歌开发者文档,Gemini 3.6 Flash相较前代3.5 Flash,在Artificial Analysis Index测试中输出token减少17%;在Datacurve DeepSWE合成基准中降幅高达65%。其定价为150万美元输入token收费1.50美元、输出token收费7.50美元,适合持续运行的推理循环。性能方面:DeepSWE任务成功率从37%升至49%;MLE Bench从49.7%提升至63.9%;在更贴近真实知识工作的GDPval-AA v2测试中,得分由1349升至1421。此外,谷歌将客户端计算机使用工具(computer-use tool)直接集成进Gemini API与Gemini Enterprise平台,省去工程师此前需自建的中间件;OSWorld-Verified操作准确率从78.4%提升至83.0%,同时强化了针对核生化(CBRN)滥用的防护机制,在不增加正常请求拒答率的前提下提升了抗越狱能力。
Gemini 3.5 Flash-Lite:高吞吐低成本的轻量级选择
3.5 Flash-Lite定位明确:牺牲部分推理深度,换取极致吞吐与成本优势。其输出速度达350 token/秒,为3.5系列最快。定价大幅下调至0.30美元/100万输入token、2.50美元/100万输出token,使工程团队可将简单高频子任务(如文档摘要、字段抽取)交由该模型处理,而将复杂多步任务留给更高阶模型。在GDM-MRCR v2长上下文理解测试中,成功率从60.1%跃升至72.2%;GDPval-AA v2得分近乎翻倍,由642升至1140。该模型同样内置原生计算机使用能力。
Gemini 3.5 Flash Cyber:安全场景专用的受限模型
面对自动化漏洞扫描器发现漏洞的速度远超人工修复的现实缺口,谷歌推出3.5 Flash Cyber。该模型经专门调优,用于验证漏洞并生成修复补丁,在CyberGym基准上表现与前沿模型相当(具体数据未公开)。为防范被用于生成攻击代码,其分发严格限制于政府机构及经审核的合作伙伴,通过试点计划实施。在内部安全工具CodeMender中,多个3.5 Flash Cyber实例并行运行,交叉验证彼此结果,最终生成一份供人工审核确认的统一修复报告。
接入方式与后续进展
三款模型均已上线:企业用户可通过Gemini API、Google AI Studio、Android Studio或Gemini Enterprise Agent Platform调用;普通用户可在Gemini App中使用,3.5 Flash-Lite亦正逐步集成至Google Search。谷歌同时透露,Gemini 3.5 Pro仍在合作伙伴测试阶段,而下一代Gemini 4架构的预训练工作已启动。
> 编者观点:对于正加速部署AI智能体的中国企业而言,谷歌此次以“token经济性”为核心的产品分层策略具有强参考价值——在实际业务中,未必需要单一“最强”模型,而应按任务粒度匹配不同能力与成本档位的模型,构建梯度化智能体基础设施。
本文为企业智脑(优秘智能)编译整理自公开资讯,信息与观点以原文为准,仅供参考。阅读原文(AI News) →