刚刚,Gemini 3.7 Flash 正式发布,谷歌真的急了

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
刚刚,Gemini 3.7 Flash 正式发布,谷歌真的急了
8973点击    2026-08-14 07:19

Gemini 新官上任后的第一把火,来了。


距离 3.6 Flash 发布才过去 3 周,Google 又端上了 Gemini 3.7 Flash。


刚刚接掌 Google DeepMind 的 Koray Kavukcuoglu 发文介绍,这是新一代面向 Coding 和 Agent 工作流的主力模型,首发价格只有 Gemini 3.6 Flash 原始价格的一半。


刚刚,Gemini 3.7 Flash 正式发布,谷歌真的急了


随后,他还专门晒出了一组过去 3 个月的进化曲线。


DeepSWE v1.1 从 37.0% 涨到 65.3%,Web Development 的 Code Arena Elo 从 1506 涨到 1588,企业自动化 AutomationBench 则从 13.4% 提高到 30.4%。


刚刚,Gemini 3.7 Flash 正式发布,谷歌真的急了


短短 3 个月,Flash 已经从 3.5 一路更新到 3.7,原本主打便宜大碗的它,现在明显被赋予了更多任务,Coding、Agent、企业自动化都成了它的主战场。


三周一更,Flash 不满足于「便宜好用」了


先看看 Gemini 3.7 Flash 到底升级了什么。


按照 Google 官方的说法,它是目前 Flash 系列中最智能的 Coding 和 Agent 主力模型,其中软件工程能力的提升尤其明显。


相比 3.6 Flash,Gemini 3.7 Flash 在 FrontierCode 1.1 Main 上从 34.4% 提高到 43.6%,DeepSWE v1.1 则从 49.0% 提高到 65.3%。


刚刚,Gemini 3.7 Flash 正式发布,谷歌真的急了


放进 Google 官方公布的横向成绩里看,结果多少有些出人意料。


FrontierCode 1.1 Main 上,3.7 Flash 的 43.6% 已经略高于 Claude Sonnet 5 的 42.7% 和 GPT-5.6 Terra 的 41.3%;


WebDev Code Arena 上,它拿到 1588 Elo,同样超过 Claude Sonnet 5 的 1541 和 GPT-5.6 Terra 的 1523。


刚刚,Gemini 3.7 Flash 正式发布,谷歌真的急了


过去主要靠速度和价格打市场的 Flash,如今已经能在部分 Coding 和 Web Development 测试里,和旗舰模型坐到一张桌子上。


当然,全面反超还远远谈不上。


DeepSWE v1.1 上,Gemini 3.7 Flash 的 65.3% 仍低于 GPT-5.6 Terra 的 69.6%;Terminal-bench 2.1 上,3.7 Flash 的 85.8% 也稍逊于后者的 87.4%。


刚刚,Gemini 3.7 Flash 正式发布,谷歌真的急了


真正值得关注的是,Flash 的能力上限正在快速提高,同时 Google 并没有因此丢掉它原本最重要的优势:速度和价格。


相比跑分,Google 最近对 Agentic workflows 的强调甚至更加频繁。


3.7 Flash 在多步骤规划、Tool Call、遇到障碍后的调整以及指令遵循等方面都有提升。面对复杂任务时,模型会投入更多推理资源,Google 希望借此减少人工监督,以及失败之后反复重试的次数。


企业自动化测试 AutomationBench 很能说明 Flash 的主打方向。


Gemini 3.6 Flash 的成绩只有 17.0%,到了 3.7 Flash 已经提高到 30.4%。Google model card 公布的同项成绩中,Claude Sonnet 5 为 10.7%,GPT-5.6 Terra 为 23.6%。


刚刚,Gemini 3.7 Flash 正式发布,谷歌真的急了


跑分成绩和真实生产环境之间当然还有距离,但最近几代 Flash 的产品定位已经越来越清楚:Google 希望它承担更多 Coding、工具调用和复杂工作流,逐渐成为 Agent 后台那个长期在线、持续干活的主力模型。


进入 Agent 阶段以后,Flash 原本的成本优势也变得更加关键。


3.6 Flash 发布时的原始价格分别是 1.5 美元和 7.5 美元。现在到今年年底之前,Gemini 3.7 Flash 的推广价为输入 0.75 美元 / 100 万 Tokens,输出 3.75 美元 / 100 万 Tokens。


Google 一方面持续把 Flash 的能力向旗舰级别靠拢,另一方面又将首发调用成本直接砍到了上一代的一半。


在聊天类应用中,这种价格差异或许还不算显眼;但一旦进入每天执行数万甚至数百万次调用的 Agent 和企业级工作流场景,最终的成本差距就会被迅速放大。


很明显,Google 已经在围绕这类高频使用场景进行产品布局了。


比如,Gemini 3.7 Flash 配合 Nano Banana,可以从一段文字开始动态生成角色、道具和纹理,最终做出一个可以直接玩的 3D 游戏。


刚刚,Gemini 3.7 Flash 正式发布,谷歌真的急了


到了 Web Development 场景,它还能调度多个 sub-agents,再结合 Gemini Omni 生成带有交互视差效果的网页。无论输入是截图、图片还是完整 Design System,新模型都能用更少的 Prompt 生成完成度更高的页面。


刚刚,Gemini 3.7 Flash 正式发布,谷歌真的急了


机器人训练同样被纳入了 Flash 的能力版图。


Google 展示了一个由三个 Agent 组成的闭环系统,让 Gemini 3.7 Flash 借助多模态理解参与到机器人训练流程中;与此同时,一份原本静态的 PDF 年报,也能被直接转化为带有图表、数据汇总以及交互功能的网页。


刚刚,Gemini 3.7 Flash 正式发布,谷歌真的急了


从写代码、跑企业流程,再到训练机器人,Flash 能干的工种明显越来越多了。


与此同时,Google 在 I/O 上推出的 24/7 个人 Agent Gemini Spark,也会从今天开始换用 3.7 Flash。


升级之后,Spark 面向 Google Workspace 的 Tool Use 能力也会加强,可以处理整理文件、起草邮件、更新状态文档等任务。


开发者可以通过 Gemini API、Google AI Studio、Android Studio 和 Google Antigravity 使用 3.7 Flash;企业端则能从 Gemini Enterprise Agent Platform 和 Gemini Enterprise App 接入。


Google 给 Flash 准备的入口其实已经足够多了。Workspace、Cloud、Android,再加上 Gemini 自己的消费者产品,一旦模型能力成熟,马上就能进入 Google 现成的产品体系和企业工作流。


Sergey Brin 下场催更,Google AI 内部开始重新排兵布阵


就在 3.7 Flash 发布前一周,Google DeepMind 刚刚完成了一次相当大的权力调整。


Demis Hassabis 转任 Google DeepMind 主席,减少日常管理职责;Koray Kavukcuoglu 则进一步上位,并拥有 DeepMind 重大决策的最终决定权。


一周之后发布的 Gemini 3.7 Flash,也因此成了 Koray 掌权之后第一款正式亮相的 Gemini 模型。


当然,一款大模型不可能在一周内临时训练出来,人事调整和 3.7 Flash 的研发之间也不存在这样的直接因果关系。


可两个时间点撞在一起,还是很有节目效果。尤其是路透社随后又披露了一系列 Google 内部细节。报道称,Google 联合创始人 Sergey Brin 最近几个月一直在亲自给 Gemini 团队施压。


刚刚,Gemini 3.7 Flash 正式发布,谷歌真的急了


今年 4 月,面对 Anthropic Claude Mythos 带来的竞争,Brin 曾在一次面向数百名员工的内部会议上要求 Google DeepMind 加快速度,并把更多注意力集中到 Gemini 上。


虽然 Brin 已经没有正式管理职位,但作为 Google 联合创始人,他依然能够影响部分重要资源的分配。按照路透社的报道,Brin 还在推动 recursive self-improvement,也就是递归式自我改进等方向,希望 Google 尽快重新回到前沿位置。


Google 确实有着急的理由。


去年 11 月,Gemini 3 一度帮助 Google 追上第一梯队,但随着 Anthropic 和 OpenAI 持续更新新模型,领先位置很快又发生变化。


更麻烦的是,Google 原计划推出的新一代旗舰 Gemini 还延期了。


旗舰没能按计划推出,组织内部还有不少积累已久的问题。


按照路透社采访的多位知情人士说法,算力资源紧张、Gemini 多位负责人之间存在意见分歧,再加上 Google 庞大的决策流程,都曾拖慢模型研发。其中,Coding 等后来被证明越来越重要的能力,也一度没有获得足够资源。


刚刚,Gemini 3.7 Flash 正式发布,谷歌真的急了


Koray Kavukcuoglu


Koray 的上位,正发生在这样的背景之下。


他过去长期负责 DeepMind 与 Google Cloud 之间的沟通,后来又被 Pichai 任命为 Google 首席 AI 架构师,核心任务之一就是推动 Gemini 进入 Google 各条产品线。


路透社称,随着 Koray 权力扩大,一些 DeepMind 原有管理者对 Gemini 技术路线的影响已经减弱;DeepMind 的部分非技术团队,也开始转入 Google 公司体系。


Gemini 的权力中心正在进一步向美国山景城移动,DeepMind 原本相对独立的研究机构属性,也在继续淡化。


再回头看 Gemini 3.7 Flash,意味就不太一样了。能力暂时还做不到处处绝对领先,就用更高的迭代频率、更低的调用成本,再叠加 Workspace、Cloud、Android 这些早已存在的入口,提前去抢真实生产环境。


Google 手里恰好握着这样的分发优势。相比几个月憋一次 Pro 旗舰模型,一个三周更新一次、性能继续上涨、价格还能减半的 Gemini Flash,既是无奈之举,也显然更像眼下的 Google 真正需要的东西。


文章来自于微信公众号 “APPSO”,作者 “APPSO”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

3
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0