Google刚刚一口气发布了3款Gemini新模型Gemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber。
3.6 Flash用更少的Token干更多的活,3.5 Flash-Lite把输出速度拉到每秒350个Token,3.5 Flash Cyber则专攻代码安全漏洞的发现和修复。
三款模型,三个方向,目标一致:让AI Agent在生产环境里真正跑起来,跑得起。
先说3.6 Flash。
Google把它定位为工作主力模型,直接对标自家上一代3.5 Flash。
开发者和客户反馈最多的痛点是Token消耗太高,推理步骤太多,工具调用太频繁,跑一个多步骤工作流下来,账单看着心疼。
3.6 Flash直接回应用户需求。根据Artificial Analysis Index的测量,完成同样的任务,3.6 Flash比3.5 Flash少用17%的输出Token。
在Datacurve的DeepSWE基准上,这个差距拉到了65%。更少的推理步骤,更少的工具调用,多步骤工作流跑下来,整体成本实打实地降了。
3.6 Flash在OSWorld验证任务中展现了比3.5 Flash更好的Token效率和更少的冗余输出。
性能全面超越3.5 Flash,价格更便宜。
写代码这块,DeepSWE得分从37%涨到49%,精度更高,不想要的代码修改更少,执行循环也减少了。机器学习研究方面,MLE Bench从49.7%跳到63.9%,进步相当明显。
计算机操作能力也有提升,OSWorld-Verified从78.4%涨到83.0%。值得一提的是,Computer Use(计算机操作)现在作为内置的客户端工具,直接集成在Gemini API和Gemini Enterprise里了,不用再额外折腾。
知识工作方面,GDPval-AA v2得分从1349涨到1421。Hebbia和Harvey这些客户已经在用了,反馈说3.6 Flash在多模态任务上表现突出,文档解析、图表和数据分析、报告起草,都有提升。
例如,3.6 Flash在Gemini App中使用画布功能,帮助开发用于3D工作流的摄影纹理提取器。
3.6 Flash使用Google Antigravity和tldraw离线编辑器,能凭借强大的视觉理解能力构建交互式主题工作室。
已关注
关注
重播 分享 赞
关闭
观看更多
更多
退出全屏
切换到竖屏全屏退出全屏
AIGC开放社区已关注
分享视频
,时长00:44
0/0
00:00/00:44
切换到横屏模式
继续播放
进度条,百分之0
播放
00:00
/
00:44
00:44
倍速
全屏
倍速播放中
0.5倍 0.75倍 1.0倍 1.5倍 2.0倍
超清 流畅
您的浏览器不支持 video 标签
继续观看
谷歌3连发!Gemini 3.5 Pro已在路上,最强Gemini 4已启动训练
观看更多
转载
,
谷歌3连发!Gemini 3.5 Pro已在路上,最强Gemini 4已启动训练
AIGC开放社区已关注
分享点赞在看
已同步到看一看写下你的评论
视频详情
安全方面,3.6 Flash出厂就带着增强版Frontier Safety(前沿安全)防护,覆盖化学、生物、放射性和核(CBRN)以及网络攻击滥用领域。抗越狱能力大幅增强,同时针对正当用途做了训练,尽量减少误拒。
3.5 Flash-Lite走的是另一条路:快,便宜,能扛量。
Artificial Analysis测出来的数据是每秒350个输出Token,3.5系列里最快。价格压到了输入每百万0.3美元,输出每百万2.5美元。
它的设计思路是给开发者一个灵活的旋钮。高吞吐、低延迟的场景,比如Agent搜索、文档批处理,把thinking level调到minimal或low,成本极低,速度极快。遇到多步骤子Agent工作流,把思考等级拉高,模型也能胜任。Computer Use同样作为内置工具集成进来了。
对比上一代3.1 Flash-Lite,性能有显著提升。Terminal-Bench 2.1从31%涨到54%,长上下文GDM-MRCR v2从60.1%涨到72.2%,真实任务执行GDPval-AA v2从642涨到1140。
3.5 Flash-Lite在不少Agent和编码评测上,甚至超过了上一代的3 Flash。SWE-Bench Pro拿到54.2%,3 Flash是49.6%。OSWorld-Verified拿到74.0%,3 Flash是65.1%。一个Lite版,跑赢了上一代的标准版,速度还更快。
3.5 Flash-Lite能从庞大的电商数据集中提取产品特征并进行综合。
已关注
关注
重播 分享 赞
关闭
观看更多
更多
退出全屏
切换到竖屏全屏退出全屏
AIGC开放社区已关注
分享视频
,时长00:33
0/0
00:00/00:33
切换到横屏模式
继续播放
进度条,百分之0
播放
00:00
/
00:33
00:33
倍速
全屏
倍速播放中
0.5倍 0.75倍 1.0倍 1.5倍 2.0倍
超清 流畅
您的浏览器不支持 video 标签
继续观看
谷歌3连发!Gemini 3.5 Pro已在路上,最强Gemini 4已启动训练
观看更多
转载
,
谷歌3连发!Gemini 3.5 Pro已在路上,最强Gemini 4已启动训练
AIGC开放社区已关注
分享点赞在看
已同步到看一看写下你的评论
视频详情
3.5 Flash-Lite与3.6 Flash作为主Agent协同工作,可以实现即时生成25个独特的、可探索的网页设计概念。
已关注
关注
重播 分享 赞
关闭
观看更多
更多
退出全屏
切换到竖屏全屏退出全屏
AIGC开放社区已关注
分享视频
,时长01:25
0/0
00:00/01:25
切换到横屏模式
继续播放
进度条,百分之0
播放
00:00
/
01:25
01:25
倍速
全屏
倍速播放中
0.5倍 0.75倍 1.0倍 1.5倍 2.0倍
超清 流畅
您的浏览器不支持 video 标签
继续观看
谷歌3连发!Gemini 3.5 Pro已在路上,最强Gemini 4已启动训练
观看更多
转载
,
谷歌3连发!Gemini 3.5 Pro已在路上,最强Gemini 4已启动训练
AIGC开放社区已关注
分享点赞在看
已同步到看一看写下你的评论
视频详情
给代码找漏洞
AI发现安全漏洞的速度,已经超过了现有系统修复漏洞的速度。这个缺口越拉越大,光靠人盯不现实。
Gemini 3.5 Flash Cyber基于3.5 Flash微调,专门针对网络安全漏洞的发现和修复做了优化。
它的定位是嵌入CodeMender(代码修复器)这个代码安全Agent里。CodeMender内部跑多个3.5 Flash Cyber Agent,协同工作,最终输出一份合并报告。
在CyberGym这个主流基准上,这套组合达到了前沿水平的竞争力,同时每Token成本比大模型低得多。
因为这项技术天然具有双重用途,能找漏洞也能被滥用,Google在部署上非常谨慎。
3.5 Flash Cyber不会公开发布,仅通过CodeMender向政府和受信任的合作伙伴提供,作为限量访问试点项目的一部分。目的是让一线防御者抢在攻击者前面,发现和修复关键漏洞,同时控制滥用风险。
而人们期待已久的Gemini 3.5 Pro呢?
Google说正在和合作伙伴测试,准备好了就广泛开放。
团队已经启动了Gemini 4的预训练,官方原话是迄今最有野心的一次预训练运行。
参考资料:
https://x.com/GoogleAIStudio/status/2079633334485811523
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/
https://storage.googleapis.com/deepmind-media/gemini/gemini_3-6_flash_model_evaluation.pdf
免责声明:本文来自AIGC开放社区客户端,不代表超天才网的观点和立场。文章及图片来源网络,版权归作者所有,如有投诉请联系删除。