1250亿主模型,每个Token激活约60亿:阿里发布Qwen3.8-Flash-Next

发布时间:2026年08月28日 来源:AIGC开放社区 作者:suani 浏览量:29

8月26日,Qwen团队开放了Qwen3.8-Flash-Next的模型权重。它采用混合专家架构,主模型参数为1250亿,但每处理一个Token,MoE主体只激活约60亿参数。

更值得注意的是,Qwen团队明确表示,这套架构将用于未来的Qwen4。

换句话说,Qwen3.8-Flash-Next既是一款可以下载部署的多模态模型,也是Qwen4的一次架构预演。

Qwen官方标识

图源:Qwen官方GitHub仓库

先看参数

Qwen3.8-Flash-Next是一款开放权重的多模态混合专家模型。

按照官方模型卡,它的参数由三部分组成:

  • 1250亿主模型参数,其中约60亿参数按Token激活;

  • 510亿N-gram Embedding参数;

  • 约40亿MTP参数,用于多Token预测。

如果将三部分相加,模型整体规模约为1800亿参数。但这并不是一个“1800亿参数全部参与计算”的稠密模型,三部分参数承担的功能不同,不能简单拿总参数量直接比较推理成本。

模型原生支持262,144 Token上下文,可以通过YaRN扩展至100万Token;支持文本、图片和视频输入,输出形式为文本。

目前,模型权重已经上线Hugging Face和ModelScope,并提供FP8等不同版本。

换了架构

Qwen3.8-Flash-Next主要改了四个地方:注意力机制、残差连接、Embedding和训练优化。

Qwen3.8-Flash-Next官方架构图

图源:Qwen官方模型仓库,原图来自Qwen技术资料

首先是Gated DeltaNet与Qwen Sparse Attention组成的混合注意力架构。

Gated DeltaNet负责压缩历史信息,Qwen Sparse Attention则通过轻量索引器,从长上下文中筛选更重要的内容。它不再逐个选择Token,而是以“微块”为单位进行检索,目的是降低长上下文场景中的延迟。

其次是Gated Residual。

Qwen团队将传统残差流扩展成四个分支,再通过动态门控控制信息的读取和写入。按照官方技术说明,这样做可以增强跨层信息传递,同时改善大规模训练的稳定性。

第三项改动是N-gram Embedding。

它会根据相邻词组等局部上下文查找对应的Embedding,相当于增加了一块存储局部语言模式的“记忆区”。

这部分参数还可以放在主机内存中,通过异步预取与模型计算重叠,减少对GPU显存的长期占用。

最后是训练优化。Qwen3.8-Flash-Next采用Muon与AdamW组合,不同类型的参数使用不同优化器,同时重新拟合了新架构下的缩放规律。

省算力

Qwen3.8-Flash-Next想解决的问题很直接:模型容量继续扩大,但单次计算成本不能跟着线性上涨。

官方披露,Qwen3.8-Flash-Next的训练成本约为Qwen3.7-Plus的九分之一,同时在编程和办公任务上取得了更高成绩。

不过,这里的“九分之一”来自Qwen团队自己的训练测算。由于官方尚未完整披露两款模型的硬件配置、训练周期和资源利用率,现阶段不宜把它理解为所有部署场景都能节省九成成本。

“每个Token激活60亿参数”也不代表整个推理过程只需要计算60亿参数。注意力计算、视觉编码器、Embedding读取以及KV Cache都会消耗算力和内存。

更准确的说法是:在MoE主体中,每个Token约有60亿参数参与计算。

看成绩

在Qwen公布的测试中,Qwen3.8-Flash-Next在多项编程和智能体评测上超过Qwen3.7-Plus。

例如:

  • SWE-bench Pro:62.5,对比Qwen3.7-Plus的55.8;

  • CoWorkBench:73.9,对比Qwen3.7-Plus的65.1;

  • LiveCodeBench v6:91.9,对比Qwen3.7-Plus的89.6;

  • AndroidWorld:84.5,对比Qwen3.7-Plus的81.0。

这些成绩说明新架构在代码、办公智能体和多模态操作方面具备潜力,但仍属于厂商组织的测试,部分项目还使用了Qwen内部评测集,因此不能完全代替独立测试。

第三方评测平台Artificial Analysis目前给Qwen3.8-Flash-Next的综合智能指数为56,高于同类开放权重模型28分的中位数。

该平台测得的输出速度约为73.3 Token/秒,高于同类模型约65.3 Token/秒的中位数;首Token延迟约3.14秒,则高于2.22秒的同类中位数。

简单说,它的连续输出速度不慢,但开始回答前的等待时间还有优化空间。

需要注意,Artificial Analysis的数据基于阿里API端点,不等于不同硬件上的本地部署表现;榜单和名次也会随新模型加入而变化,因此更适合看分数与趋势,不宜使用固定排名。

算成本

Qwen官方发布稿中,生产版本被命名为Qwen3.8-Flash,默认提供100万Token上下文和内置工具。

官方公布的价格为每百万输入Token 0.16美元、每百万输出Token 0.47美元。Artificial Analysis记录的测试端点价格则为输入0.15美元、输出0.47美元。

两组价格的输入端相差0.01美元,可能来自服务版本或统计口径不同。对外表述时,应分别注明来源,不宜混为同一个价格。

发布稿最初把相关API标注为“即将上线”,目前官方GitHub已经提供QwenCloud调用说明,Artificial Analysis也显示存在可用的阿里API端点。

能部署吗

模型权重已经公开,并兼容Transformers、vLLM、SGLang、TokenSpeed和llama.cpp等框架。

但“每个Token激活60亿参数”不等于普通电脑可以轻松运行。

Hugging Face上的完整模型文件规模达到数百GB,本地部署仍然需要考虑权重存储、显存容量、内存卸载、量化和多卡调度。对于个人开发者,FP8或社区量化版本更现实,但量化后是否影响视觉、长上下文和代码能力,还需要单独测试。

许可证同样值得注意。

Qwen3.8-Flash-Next采用Qwen Community License 1.0,而不是Apache 2.0。它允许下载权重和自行部署,也允许一定范围内的商业使用,但附带相应条件。

因此,更严谨的表述是“开放权重模型”,而不是“没有任何使用限制的完全开源模型”。

看Qwen4

Qwen3.8-Flash-Next最值得关注的,并不是参数又增加了多少,而是阿里正在重新设计大模型扩展能力的方式。

过去,模型能力提升往往伴随着参数、算力和推理成本同步上涨。现在,Qwen希望通过稀疏激活、N-gram Embedding、长上下文稀疏注意力和内存卸载,在扩大模型容量的同时控制计算成本。

类似的路线并非阿里独有。如何减少每个Token实际参与计算的参数、降低长上下文成本,已经成为国内外大模型厂商共同面对的问题。

Qwen3.8-Flash-Next给出了一套较为完整的方案,也提前暴露了Qwen4可能采用的技术方向。

但它目前仍带有明显的实验性质:官方成本数据需要更多复现,百万Token上下文需要在真实任务中检验,开放权重版本的部署效率也会受到硬件和推理框架影响。

Qwen4还没有正式到来。

它的“底盘”,已经先摆到了桌面上。


参考资料:

Qwen官方发布文章

Qwen3.8-Flash-Next官方GitHub仓库

Hugging Face模型页面

官方技术报告

Artificial Analysis第三方评测

免责声明:本文来自AIGC开放社区客户端,不代表超天才网的观点和立场。文章及图片来源网络,版权归作者所有,如有投诉请联系删除。

0 0 0
有话要说  人讨论    29 人阅读
发表

游客

这位投稿者太神秘了,什么都没留下~

超天才网©2017 www.supergenius.cn All Rights Reserved ICP备09005826号 京ICP证130304号

联系我们| 加入我们| 法律声明| 关于我们| 评论互动

超天才网©2013-2014 All Rights Reserved ICP备09005826号 京ICP证130304号

关注我们: