8月26日,Qwen团队开放了Qwen3.8-Flash-Next的模型权重。它采用混合专家架构,主模型参数为1250亿,但每处理一个Token,MoE主体只激活约60亿参数。
更值得注意的是,Qwen团队明确表示,这套架构将用于未来的Qwen4。
换句话说,Qwen3.8-Flash-Next既是一款可以下载部署的多模态模型,也是Qwen4的一次架构预演。
图源:Qwen官方GitHub仓库
Qwen3.8-Flash-Next是一款开放权重的多模态混合专家模型。
按照官方模型卡,它的参数由三部分组成:
1250亿主模型参数,其中约60亿参数按Token激活;
510亿N-gram Embedding参数;
约40亿MTP参数,用于多Token预测。
如果将三部分相加,模型整体规模约为1800亿参数。但这并不是一个“1800亿参数全部参与计算”的稠密模型,三部分参数承担的功能不同,不能简单拿总参数量直接比较推理成本。
模型原生支持262,144 Token上下文,可以通过YaRN扩展至100万Token;支持文本、图片和视频输入,输出形式为文本。
目前,模型权重已经上线Hugging Face和ModelScope,并提供FP8等不同版本。
Qwen3.8-Flash-Next主要改了四个地方:注意力机制、残差连接、Embedding和训练优化。
图源:Qwen官方模型仓库,原图来自Qwen技术资料
首先是Gated DeltaNet与Qwen Sparse Attention组成的混合注意力架构。
Gated DeltaNet负责压缩历史信息,Qwen Sparse Attention则通过轻量索引器,从长上下文中筛选更重要的内容。它不再逐个选择Token,而是以“微块”为单位进行检索,目的是降低长上下文场景中的延迟。
其次是Gated Residual。
Qwen团队将传统残差流扩展成四个分支,再通过动态门控控制信息的读取和写入。按照官方技术说明,这样做可以增强跨层信息传递,同时改善大规模训练的稳定性。
第三项改动是N-gram Embedding。
它会根据相邻词组等局部上下文查找对应的Embedding,相当于增加了一块存储局部语言模式的“记忆区”。
这部分参数还可以放在主机内存中,通过异步预取与模型计算重叠,减少对GPU显存的长期占用。
最后是训练优化。Qwen3.8-Flash-Next采用Muon与AdamW组合,不同类型的参数使用不同优化器,同时重新拟合了新架构下的缩放规律。
Qwen3.8-Flash-Next想解决的问题很直接:模型容量继续扩大,但单次计算成本不能跟着线性上涨。
官方披露,Qwen3.8-Flash-Next的训练成本约为Qwen3.7-Plus的九分之一,同时在编程和办公任务上取得了更高成绩。
不过,这里的“九分之一”来自Qwen团队自己的训练测算。由于官方尚未完整披露两款模型的硬件配置、训练周期和资源利用率,现阶段不宜把它理解为所有部署场景都能节省九成成本。
“每个Token激活60亿参数”也不代表整个推理过程只需要计算60亿参数。注意力计算、视觉编码器、Embedding读取以及KV Cache都会消耗算力和内存。
更准确的说法是:在MoE主体中,每个Token约有60亿参数参与计算。
在Qwen公布的测试中,Qwen3.8-Flash-Next在多项编程和智能体评测上超过Qwen3.7-Plus。
例如:
SWE-bench Pro:62.5,对比Qwen3.7-Plus的55.8;
CoWorkBench:73.9,对比Qwen3.7-Plus的65.1;
LiveCodeBench v6:91.9,对比Qwen3.7-Plus的89.6;
AndroidWorld:84.5,对比Qwen3.7-Plus的81.0。
这些成绩说明新架构在代码、办公智能体和多模态操作方面具备潜力,但仍属于厂商组织的测试,部分项目还使用了Qwen内部评测集,因此不能完全代替独立测试。
第三方评测平台Artificial Analysis目前给Qwen3.8-Flash-Next的综合智能指数为56,高于同类开放权重模型28分的中位数。
该平台测得的输出速度约为73.3 Token/秒,高于同类模型约65.3 Token/秒的中位数;首Token延迟约3.14秒,则高于2.22秒的同类中位数。
简单说,它的连续输出速度不慢,但开始回答前的等待时间还有优化空间。
需要注意,Artificial Analysis的数据基于阿里API端点,不等于不同硬件上的本地部署表现;榜单和名次也会随新模型加入而变化,因此更适合看分数与趋势,不宜使用固定排名。
Qwen官方发布稿中,生产版本被命名为Qwen3.8-Flash,默认提供100万Token上下文和内置工具。
官方公布的价格为每百万输入Token 0.16美元、每百万输出Token 0.47美元。Artificial Analysis记录的测试端点价格则为输入0.15美元、输出0.47美元。
两组价格的输入端相差0.01美元,可能来自服务版本或统计口径不同。对外表述时,应分别注明来源,不宜混为同一个价格。
发布稿最初把相关API标注为“即将上线”,目前官方GitHub已经提供QwenCloud调用说明,Artificial Analysis也显示存在可用的阿里API端点。
模型权重已经公开,并兼容Transformers、vLLM、SGLang、TokenSpeed和llama.cpp等框架。
但“每个Token激活60亿参数”不等于普通电脑可以轻松运行。
Hugging Face上的完整模型文件规模达到数百GB,本地部署仍然需要考虑权重存储、显存容量、内存卸载、量化和多卡调度。对于个人开发者,FP8或社区量化版本更现实,但量化后是否影响视觉、长上下文和代码能力,还需要单独测试。
许可证同样值得注意。
Qwen3.8-Flash-Next采用Qwen Community License 1.0,而不是Apache 2.0。它允许下载权重和自行部署,也允许一定范围内的商业使用,但附带相应条件。
因此,更严谨的表述是“开放权重模型”,而不是“没有任何使用限制的完全开源模型”。
Qwen3.8-Flash-Next最值得关注的,并不是参数又增加了多少,而是阿里正在重新设计大模型扩展能力的方式。
过去,模型能力提升往往伴随着参数、算力和推理成本同步上涨。现在,Qwen希望通过稀疏激活、N-gram Embedding、长上下文稀疏注意力和内存卸载,在扩大模型容量的同时控制计算成本。
类似的路线并非阿里独有。如何减少每个Token实际参与计算的参数、降低长上下文成本,已经成为国内外大模型厂商共同面对的问题。
Qwen3.8-Flash-Next给出了一套较为完整的方案,也提前暴露了Qwen4可能采用的技术方向。
但它目前仍带有明显的实验性质:官方成本数据需要更多复现,百万Token上下文需要在真实任务中检验,开放权重版本的部署效率也会受到硬件和推理框架影响。
Qwen4还没有正式到来。
它的“底盘”,已经先摆到了桌面上。
参考资料:
Qwen官方发布文章
Qwen3.8-Flash-Next官方GitHub仓库
Hugging Face模型页面
官方技术报告
Artificial Analysis第三方评测
免责声明:本文来自AIGC开放社区客户端,不代表超天才网的观点和立场。文章及图片来源网络,版权归作者所有,如有投诉请联系删除。