9月2日,Google正式发布Gemini 3.8 Flash和Gemini 3.8 Flash Cyber。
两款模型共享基础能力,但面向不同场景:3.8 Flash主要服务编程、智能体和企业工作流,已经作为稳定版本上线;3.8 Flash Cyber专门用于发现和修复软件漏洞,目前仅向经过审核的政府部门、关键基础设施运营方、软件维护者及安全研究伙伴开放。
这是Google六周内第三次更新Flash系列。与单纯刷新模型跑分相比,这次发布更值得注意的变化是:通用智能体与高风险网络安全模型,开始采用不同的开放方式。
图源:Google官方发布页面
Google将Gemini 3.8 Flash定位为面向编程和智能体的主力模型。
它支持文本、图片、音频、视频和PDF等多种输入形式,拥有约100万Token的上下文窗口,单次最多可输出约6.5万Token。
在工具能力上,3.8 Flash支持代码执行、函数调用、文件搜索、搜索增强和结构化输出,计算机操作能力处于预览阶段。不过,它目前不支持图片生成、音频生成和Live API,输出形式仍然是文本。
Google这次重点强调的是长任务执行能力。例如,模型能否持续处理大型软件工程项目,能否多次调用工具并根据结果调整方案,以及能否完成涉及多份文件和多个步骤的企业任务。
3.8 Flash已作为稳定模型在Gemini API、Google AI Studio、Gemini应用、Gemini Enterprise Agent Platform、Google搜索AI Mode和Antigravity等渠道提供。不同产品的实际可用范围可能受到地区、账号和订阅方案限制。
3.8 Flash目前延续3.7 Flash的API价格:每百万输入Token为0.75美元,输出为3.75美元。该价格执行至2026年底,2027年起将上调;免费层仍有使用额度限制。
长任务能力提升明显
Google公布的测试结果显示,3.8 Flash在部分编程、金融分析和专家推理任务上取得了明显进步。
在长周期软件工程测试DeepSWE v1.1中,3.8 Flash得到73.7%,接近Google测试中Claude Opus 5的74.0%,高于GPT-5.6 Sol的72.7%。
在其他测试中:
Vals Finance Agent v2:61.4%;
Terminal-bench 2.1:89.4%;
HLE-Verified:54.9%;
CharXiv Reasoning:86.2%。
图源:Google;不同模型成绩由Google按照其测试设置整理
但同一张表也说明,3.8 Flash并非在所有任务上领先。
在Terminal-bench 4.0中,3.8 Flash的成绩为19.1%,低于Google公布的Claude Opus 5成绩51.8%和GPT-5.6 Sol成绩37.3%;在OSWorld计算机操作测试和GDPval知识工作测试中,它也没有取得最高分。
换句话说,3.8 Flash的优势更集中在部分长周期编程、金融分析、图表理解和专业推理任务上。面对通用计算机操作或不同类型的智能体环境,模型表现仍有明显差异。
Gemini 3.8 Flash Cyber针对网络安全任务进行了专门优化,主要能力包括发现漏洞、分析代码风险和生成修复补丁。
Google公布的CyberGym测试显示,3.8 Flash Cyber在C/C++漏洞发现任务中的Pass@1成绩为86.2%,高于3.5 Flash Cyber的77.5%。
图源:Google;测试成绩及对比模型设置由Google披露
Google还构建了一套覆盖20种编程语言的内部测试,用于评估模型在复杂代码库中发现不同类型漏洞的能力。按照Google公布的数据,3.8 Flash Cyber在这项测试中的成功率超过70%。
在由Collinear运行的外部补丁测试CWE-Bench中,3.8 Flash Cyber的Pass@1为47.2%,略低于Fable 5的47.8%。Google强调,前者完成单次任务的成本更低。
发现漏洞和生成补丁的能力具有明显的双重用途。
安全团队可以利用模型提前发现问题,攻击者同样可能用它寻找可利用的缺陷。Google因此没有把3.8 Flash Cyber放入普通Gemini API,而是通过新设立的Fairwind计划提供受控访问。
根据Fairwind计划说明,Google优先考虑以下申请者:
政府和国家网络安全主管部门;
医疗、能源、通信和金融等关键基础设施运营方;
影响大量下游用户的核心技术平台;
从事防御性评估的安全研究机构和学术实验室。
获准使用的机构需要实施用户身份认证、抗钓鱼多因素认证和访问控制,只能将权限提供给内部安全、应急响应或渗透测试团队。机构不得转售、共享或重新分发模型访问权限。
按照Google的说法,3.8 Flash和3.8 Flash Cyber共享基础智能,但采用不同的安全限制和部署环境。
面向普通用户和开发者的3.8 Flash保留了针对网络攻击以及化学、生物、放射性和核风险的安全措施;Cyber版为了完成更深入的安全研究,采用相对宽松的网络安全限制,因此必须配合机构审核、权限管理和使用监控。
这套安排反映出大模型安全思路正在变化。当模型能够调用工具、操作计算机甚至自主寻找漏洞时,仅依靠对话层面的内容拒绝已经不够。谁能使用模型、模型能连接哪些工具、操作是否被记录,都开始成为安全机制的一部分。
首先,Google没有披露3.8 Flash新增的参数规模、训练数据规模和训练算力。官方模型卡只说明它基于3.7 Flash,外界暂时无法从架构层面判断升级幅度。
其次,Gemini 3.8 Flash模型卡显示,其多语言安全自动评估指标相较3.7 Flash回退了5.4个百分点。Google表示,人工复核发现大部分差异属于误报或非严重问题,但多语言安全表现仍值得继续观察。
模型卡还承认,3.8 Flash可能出现响应变慢或超时。在较高推理强度下,模型会增加推理步骤和工具调用次数,Token消耗也可能上升。
这意味着“Flash”并不保证在每一种任务中都更快、更便宜。开发者仍需结合任务长度、推理等级和工具调用次数计算实际成本。
Gemini 3.8 Flash与Cyber版同时发布,说明Google正在推动Flash系列进入更复杂的生产场景。
一方面,3.8 Flash试图用相对较低的阶段性价格承担长周期编程、知识分析和企业智能体任务;另一方面,Cyber版把漏洞研究能力放进受控计划,探索高风险专业模型的开放边界。
这次发布没有证明Google在所有测试中都已经领先。但它释放出的方向很明确:Flash不再只是一个追求快速响应的轻量模型,而是开始承担Google智能体产品体系中的主力工作。
最终决定3.8 Flash竞争力的,不是发布时的某一项跑分,而是它能否在真实项目中稳定完成长任务,以及Cyber版能否在安全限制下真正提高漏洞发现和修复效率。
信息来源:
Google:Gemini 3.8 Flash与3.8 Flash Cyber发布公告
Google DeepMind:Gemini 3.8 Flash模型卡
Google开发者文档:Gemini 3.8 Flash规格
Google开发者文档:Gemini API价格
Google DeepMind:Fairwind受控访问计划
免责声明:本文来自AIGC开放社区客户端,不代表超天才网的观点和立场。文章及图片来源网络,版权归作者所有,如有投诉请联系删除。