谷歌3连发!Gemini 3.5 Pro已在路上,最强Gemini 4已启动训练

发布时间:2026年07月26日 来源:AIGC开放社区 作者:suani 浏览量:25

Google刚刚一口气发布了3款Gemini新模型Gemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber。

图片

3.6 Flash用更少的Token干更多的活,3.5 Flash-Lite把输出速度拉到每秒350个Token,3.5 Flash Cyber则专攻代码安全漏洞的发现和修复。

三款模型,三个方向,目标一致:让AI Agent在生产环境里真正跑起来,跑得起。

更少的Token,更强的活

先说3.6 Flash。

Google把它定位为工作主力模型,直接对标自家上一代3.5 Flash。

开发者和客户反馈最多的痛点是Token消耗太高,推理步骤太多,工具调用太频繁,跑一个多步骤工作流下来,账单看着心疼。

3.6 Flash直接回应用户需求。根据Artificial Analysis Index的测量,完成同样的任务,3.6 Flash比3.5 Flash少用17%的输出Token。

图片

在Datacurve的DeepSWE基准上,这个差距拉到了65%。更少的推理步骤,更少的工具调用,多步骤工作流跑下来,整体成本实打实地降了。

3.6 Flash在OSWorld验证任务中展现了比3.5 Flash更好的Token效率和更少的冗余输出。

图片

性能全面超越3.5 Flash,价格更便宜。

图片

写代码这块,DeepSWE得分从37%涨到49%,精度更高,不想要的代码修改更少,执行循环也减少了。机器学习研究方面,MLE Bench从49.7%跳到63.9%,进步相当明显。

计算机操作能力也有提升,OSWorld-Verified从78.4%涨到83.0%。值得一提的是,Computer Use(计算机操作)现在作为内置的客户端工具,直接集成在Gemini API和Gemini Enterprise里了,不用再额外折腾。

知识工作方面,GDPval-AA v2得分从1349涨到1421。Hebbia和Harvey这些客户已经在用了,反馈说3.6 Flash在多模态任务上表现突出,文档解析、图表和数据分析、报告起草,都有提升。

例如,3.6 Flash在Gemini App中使用画布功能,帮助开发用于3D工作流的摄影纹理提取器。

图片

3.6 Flash使用Google Antigravity和tldraw离线编辑器,能凭借强大的视觉理解能力构建交互式主题工作室。

已关注

关注

重播 分享

关闭

观看更多

更多

退出全屏

切换到竖屏全屏退出全屏

AIGC开放社区已关注

分享视频

,时长00:44

0/0

00:00/00:44

切换到横屏模式

继续播放

进度条,百分之0

播放

00:00

/

00:44

00:44

倍速

全屏

倍速播放中

0.5倍 0.75倍 1.0倍 1.5倍 2.0倍

超清 流畅

您的浏览器不支持 video 标签

继续观看

谷歌3连发!Gemini 3.5 Pro已在路上,最强Gemini 4已启动训练

观看更多

转载

,

谷歌3连发!Gemini 3.5 Pro已在路上,最强Gemini 4已启动训练

AIGC开放社区已关注

分享点赞在看

已同步到看一看写下你的评论

视频详情

安全方面,3.6 Flash出厂就带着增强版Frontier Safety(前沿安全)防护,覆盖化学、生物、放射性和核(CBRN)以及网络攻击滥用领域。抗越狱能力大幅增强,同时针对正当用途做了训练,尽量减少误拒。

每秒350个Token

3.5 Flash-Lite走的是另一条路:快,便宜,能扛量。

Artificial Analysis测出来的数据是每秒350个输出Token,3.5系列里最快。价格压到了输入每百万0.3美元,输出每百万2.5美元。

它的设计思路是给开发者一个灵活的旋钮。高吞吐、低延迟的场景,比如Agent搜索、文档批处理,把thinking level调到minimal或low,成本极低,速度极快。遇到多步骤子Agent工作流,把思考等级拉高,模型也能胜任。Computer Use同样作为内置工具集成进来了。

对比上一代3.1 Flash-Lite,性能有显著提升。Terminal-Bench 2.1从31%涨到54%,长上下文GDM-MRCR v2从60.1%涨到72.2%,真实任务执行GDPval-AA v2从642涨到1140。

图片

3.5 Flash-Lite在不少Agent和编码评测上,甚至超过了上一代的3 Flash。SWE-Bench Pro拿到54.2%,3 Flash是49.6%。OSWorld-Verified拿到74.0%,3 Flash是65.1%。一个Lite版,跑赢了上一代的标准版,速度还更快。

图片

3.5 Flash-Lite能从庞大的电商数据集中提取产品特征并进行综合。

已关注

关注

重播 分享

关闭

观看更多

更多

退出全屏

切换到竖屏全屏退出全屏

AIGC开放社区已关注

分享视频

,时长00:33

0/0

00:00/00:33

切换到横屏模式

继续播放

进度条,百分之0

播放

00:00

/

00:33

00:33

倍速

全屏

倍速播放中

0.5倍 0.75倍 1.0倍 1.5倍 2.0倍

超清 流畅

您的浏览器不支持 video 标签

继续观看

谷歌3连发!Gemini 3.5 Pro已在路上,最强Gemini 4已启动训练

观看更多

转载

,

谷歌3连发!Gemini 3.5 Pro已在路上,最强Gemini 4已启动训练

AIGC开放社区已关注

分享点赞在看

已同步到看一看写下你的评论

视频详情

3.5 Flash-Lite与3.6 Flash作为主Agent协同工作,可以实现即时生成25个独特的、可探索的网页设计概念。

已关注

关注

重播 分享

关闭

观看更多

更多

退出全屏

切换到竖屏全屏退出全屏

AIGC开放社区已关注

分享视频

,时长01:25

0/0

00:00/01:25

切换到横屏模式

继续播放

进度条,百分之0

播放

00:00

/

01:25

01:25

倍速

全屏

倍速播放中

0.5倍 0.75倍 1.0倍 1.5倍 2.0倍

超清 流畅

您的浏览器不支持 video 标签

继续观看

谷歌3连发!Gemini 3.5 Pro已在路上,最强Gemini 4已启动训练

观看更多

转载

,

谷歌3连发!Gemini 3.5 Pro已在路上,最强Gemini 4已启动训练

AIGC开放社区已关注

分享点赞在看

已同步到看一看写下你的评论

视频详情

给代码找漏洞

AI发现安全漏洞的速度,已经超过了现有系统修复漏洞的速度。这个缺口越拉越大,光靠人盯不现实。

Gemini 3.5 Flash Cyber基于3.5 Flash微调,专门针对网络安全漏洞的发现和修复做了优化。

它的定位是嵌入CodeMender(代码修复器)这个代码安全Agent里。CodeMender内部跑多个3.5 Flash Cyber Agent,协同工作,最终输出一份合并报告。

在CyberGym这个主流基准上,这套组合达到了前沿水平的竞争力,同时每Token成本比大模型低得多。

图片

因为这项技术天然具有双重用途,能找漏洞也能被滥用,Google在部署上非常谨慎。

3.5 Flash Cyber不会公开发布,仅通过CodeMender向政府和受信任的合作伙伴提供,作为限量访问试点项目的一部分。目的是让一线防御者抢在攻击者前面,发现和修复关键漏洞,同时控制滥用风险。

而人们期待已久的Gemini 3.5 Pro呢?

Google说正在和合作伙伴测试,准备好了就广泛开放。

团队已经启动了Gemini 4的预训练,官方原话是迄今最有野心的一次预训练运行。

参考资料:

https://x.com/GoogleAIStudio/status/2079633334485811523

https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/

https://storage.googleapis.com/deepmind-media/gemini/gemini_3-6_flash_model_evaluation.pdf

免责声明:本文来自AIGC开放社区客户端,不代表超天才网的观点和立场。文章及图片来源网络,版权归作者所有,如有投诉请联系删除。

0 0 0
有话要说  人讨论    25 人阅读
发表

游客

这位投稿者太神秘了,什么都没留下~

超天才网©2017 www.supergenius.cn All Rights Reserved ICP备09005826号 京ICP证130304号

联系我们| 加入我们| 法律声明| 关于我们| 评论互动

超天才网©2013-2014 All Rights Reserved ICP备09005826号 京ICP证130304号

关注我们: