Google 发布 Gemini 3.6 Flash 等三款模型:省 17% Token 成本,速度快一倍

CN
1小时前
这些模型专为大规模构建 AI Agent 所需的效率、延迟和可靠性而设计。

作者:Google DeepMind

编译:深潮 TechFlow

深潮导读:Google 这次发布的三款模型核心都在解决 AI Agent 商业化的真实痛点——成本和速度。3.6 Flash 比上代省 17%token、价格更低但质量更好;3.5 Flash-Lite 速度达到 350 token/秒,是目前最快的 3.5 系列模型;而专门的网络安全模型 Flash Cyber 则瞄准了代码漏洞修复这个刚需市场。这不是性能跑分游戏,是在为大规模部署 AI Agent 铺路。

Google DeepMind 今日发布三款新 Gemini 模型:3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber。这些模型专为大规模构建 AI Agent 所需的效率、延迟和可靠性而设计。

Gemini 3.6 Flash:更高效、更优质

3.6 Flash 直接基于开发者对 3.5 Flash 的反馈改进。它不仅在编码和知识工作上更进一步,还显著提升了 token 效率。根据 Artificial Analysis Index,3.6 Flash 比 3.5 Flash 减少 17%的输出 token 消耗。在某些基准测试如 Datacurve 的 DeepSWE 中,减少幅度高达 65%。完成多步骤工作流所需的推理步骤和工具调用也更少。

这种效率提升还伴随着更低的价格。定价为每百万输入 token 1.5 美元、每百万输出 token 7.5 美元,3.6 Flash 降低了每个 Agent 任务的总成本,让构建和运行 Agent 更经济。

即便更高效,3.6 Flash 在各类用例中的性能也优于 3.5 Flash:

代码编辑更精准,减少了不必要的修改和执行循环,在 DeepSWE 上达到 49%(3.5 Flash 为 37%),在机器学习研究基准 MLE Bench 上显著提升至 63.9%(3.5 Flash 为 49.7%)

电脑操作能力改进,OSWorld-Verified 得分 83.0%(3.5 Flash 为 78.4%)。电脑操作现已通过 Gemini API 和 Gemini Enterprise 作为内置客户端工具提供

知识工作表现更好,如 GDPval-AA v2 基准得分 1421(3.5 Flash 为 1349)。Hebbia 和 Harvey 等客户发现它在文档解析、图表和数据分析、报告起草等多模态任务上尤其出色

客户反馈 3.6 Flash 在成本和质量上都是进步,在复杂工作流和知识型任务中平衡了 token 效率、准确性和速度。

安全性设计

3.6 Flash 配备了增强的前沿安全防护措施,涵盖化学、生物、放射和核(CBRN)以及网络攻击滥用领域。这些防护使模型对越狱攻击的抵抗力大幅提升。同时,模型经过训练,尽量减少对有益用途的拒绝。

Gemini 3.5 Flash-Lite:为 Agent 工作流规模化而生

3.5 Flash-Lite 专为低延迟任务和需要高吞吐量的开发场景设计,如 Agent 搜索和文档处理。

3.5 Flash-Lite 是 3.5 系列中最快的模型。据 Artificial Analysis 测量,运行速度达每秒 350 个输出 token。定价为每百万输入 token 0.3 美元、每百万输出 token 2.5 美元,且质量大幅优于 3.1 Flash-Lite,为运行大流量生产任务的开发者和客户提供了出色的性价比。

3.5 Flash-Lite 支持 Agent 系统的高效扩展。在各个思考级别上,该模型显著优于 3.1 Flash-Lite。开发者可以根据工作负载配置模型:对大批量任务使用最小和低思考级别,优先考虑低延迟、低成本执行;或启用更高思考级别来处理多步骤子 Agent 工作负载。该模型现在也将电脑操作作为内置工具,可靠支持跨界面的 Agent 任务。

它在编码和 Agent 任务上有显著提升,如 Terminal-Bench 2.1 得分 54%(3.1 Flash-Lite 为 31%),长上下文如 GDM-MRCR v2 得分 72.2%(3.1 Flash-Lite 为 60.1%),实际任务执行如 GDPval-AA v2 得分 1140(3.1 Flash-Lite 为 642)。

实际上,在许多 Agent 和编码评测中,3.5 Flash-Lite 甚至超过了 3 Flash,包括 SWE-Bench Pro(54.2% vs 49.6%)和 OSWorld-Verified(74.0% vs 65.1%),成为 2.5 和 3 Flash 工作负载更快更强的选择。

早期客户强调 3.5 Flash-Lite 在扩展 Agent 工作流和数据处理任务方面,速度、智能和成本效率的独特组合。

Gemini 3.5 Flash Cyber in CodeMender:高效发现并修复漏洞

AI 模型发现安全漏洞的速度已经超过当前系统修复它们的速度。应对这一日益严重的威胁需要一种既高效又强大的软件安全方法。

Flash 的性能和效率使其成为大规模检测、验证和修补代码安全问题的理想基础。Gemini 3.5 Flash Cyber 基于 3.5 Flash 构建,经过微调专门用于发现和修复网络安全漏洞,且每 token 价格低于大型模型。

在 CodeMender 中,多个 3.5 Flash Cyber Agent 协同工作生成单一综合报告,在流行基准 CyberGym 上达到前沿竞争水平。

鉴于这项技术的双重用途性质,我们采取了审慎的部署方式。该模型将很快通过 CodeMender 以限制访问试点项目的形式专门提供给政府和可信合作伙伴。这将让一线防御者在关键漏洞被利用之前抢先发现并修复,同时缓解更广泛的滥用风险。

立即开始使用

3.6 Flash 和 3.5 Flash-Lite 从今天起可用:

开发者可通过 Google AI Studio 和 Android Studio 的 Gemini API 使用。3.6 Flash 还可在 Google Antigravity 中使用

企业可在 Gemini Enterprise Agent 平台中使用。3.6 Flash 还可在 Gemini Enterprise 应用中使用

所有人都可通过 Gemini 应用使用。3.5 Flash-Lite 也正在 Google 搜索中推出

欢迎提供反馈以改进未来的 Gemini 模型,我们期待很快发布 3.5 Pro。

免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。

分享至:
APP下载

X

Telegram

Facebook

Reddit

复制链接