谷歌发布Gemini 3.6 Flash等三款新模型,专为AI智能体工作负载优化
谷歌正式推出Gemini 3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber三款新型号,全部归属‘Flash’系列,聚焦速度、成本与高并发智能体任务,而非深度推理。新模型在多项基准测试中显著提升token效率、降低延迟与价格,并强化安全防护。其中Flash Cyber专用于代码漏洞识别与修复,已在内部安全评估中超越主流大模型。
专为智能体工作负载设计的Flash新梯队
开发者构建生产级AI智能体时,亟需更高的token效率、更低延迟与更稳定性能。为此,谷歌今日发布三款全新Gemini模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite与Gemini 3.5 Flash Cyber。三者同属‘Flash’层级——该层级经专门调优,优先保障执行速度、单位成本与高吞吐量智能体任务,而非追求最大推理深度。
Gemini 3.6 Flash:新默认主力,兼顾质量、效率与成本
Gemini 3.6 Flash定位为新一代通用工作主力模型,基于3.5 Flash迭代而来,面向编程、知识型工作与多模态任务。核心突破在于效率:在Artificial Analysis Index上,其输出token用量比3.5 Flash减少17%;在Datacurve发布的DeepSWE基准测试中,降幅高达65%。同时,它在多步工作流中所需的推理步骤与工具调用次数也更少。伴随效率提升,定价同步下调:输入token单价为1.50美元/百万,输出token单价降至7.50美元/百万(此前3.5 Flash为9.00美元)。更低的冗余输出与价格直接压降单个智能体任务总成本。
质量亦同步跃升:DeepSWE得分达49%(3.5 Flash为37%);MLE Bench达63.9%(49.7%);OSWorld-Verified达83.0%(78.4%);知识工作基准GDPval-AA v2得分为1421(1349)。计算机使用能力已作为内置客户端工具集成至Gemini API与Gemini Enterprise。早期客户Hebbia与Harvey反馈,在文档解析、图表与数据分析、报告生成等场景中效果提升明显。该模型还搭载增强版Frontier Safety防护机制,覆盖化学、生物、放射性及核(CBRN)威胁与网络攻击滥用风险,详细说明见其官方模型卡片。
Gemini 3.5 Flash-Lite:3.5系列最快型号,支持动态思维层级
Gemini 3.5 Flash-Lite主打超低延迟与高吞吐,适用于智能体搜索与文档处理等场景。据Artificial Analysis实测,其输出速度达350 tokens/秒。定价为0.30美元/百万输入token、2.50美元/百万输出token,大幅优于前代3.1 Flash-Lite。在Terminal-Bench 2.1中得分54%(31%);长上下文基准GDM-MRCR v2达72.2%(60.1%);GDPval-AA v2得分为1140(642)。值得注意的是,它在部分评测中甚至反超更早的3 Flash版本:SWE-Bench Pro达54.2%(49.6%),OSWorld-Verified达74.0%(65.1%)。该模型支持可配置思维层级(minimal/low/high),开发者可根据任务规模灵活平衡成本、延迟与子智能体协同需求。计算机使用同样作为内置工具提供。
Gemini 3.5 Flash Cyber:面向代码安全的专用智能体引擎
Gemini 3.5 Flash Cyber是本次发布中最专精的型号,基于3.5 Flash微调而成,专用于软件漏洞的发现、验证与修复。其设计逻辑源于“搜索空间难题”:深层缺陷挖掘需遍历海量执行路径,单次调用巨型模型易成瓶颈。解决方案是部署轻量、低成本模型并高频调用。在谷歌自研代码安全智能体CodeMender中,多个3.5 Flash Cyber实例并行运行,单次任务最多调用5次,再聚合各子智能体结果生成综合报告。在CyberGym基准测试中,该架构性能媲美更大参数模型。内部评估结果突出:在谷歌‘Big Sleep’评测中,Flash Cyber显著超越主干版3.5 Flash与3.6 Flash;在V8 JavaScript引擎测试中,固定调用次数下确认发现55个独特漏洞,高于3.5 Flash(47个)与Claude Opus 4.6(36个),其中10个为另两者均未检出;一次真实测试中,谷歌云漏洞研究团队借助其在两小时内定位到公共API中的远程代码执行漏洞。
社区反响分化:效率获赞,旗舰缺席引质疑
开发者普遍欢迎新模型的价格优势与效率提升。但同期旗舰级模型(如传闻中的Gemini 3.7或3.8)迟迟未发布,引发最强烈批评。Hacker News等平台有用户指出,谷歌存在过度宣传算力供给能力的问题,称实际编码体验常令人沮丧。此外,Flash Cyber采取受限访问策略,也触发关于双用途技术管控权归属的讨论。
本文为企业智脑(优秘智能)编译整理自公开资讯,信息与观点以原文为准,仅供参考。阅读原文(MarkTechPost) →