阿里通义千问团队正式发布Qwen3.8-Flash,该模型参数亮眼、架构有四大变化,还提前开放Qwen3.8-Flash-Next开源权重,与智谱同日发布新品,国内Flash之战打响。
Qwen3.8-Flash拥有125B总参数 + 51B N-gram Embedding,每token只激活6B参数,原生支持262K上下文,可扩展到1M。相比Qwen3.7-Plus,训练开销仅为其1/9,在编码和办公任务上能力更强。
Attention层采用Gated DeltaNet和Qwen Sparse Attention混合架构,加速显著;Residual连接改成Gated Residual,降低访存开销;Embedding层引入51B的N-gram Embedding,不增加每token计算量;优化器换成Muon,明确参数分工。
通义提前开放Qwen3.8-Flash-Next的开源权重,这是Qwen4系列模型的雏形,等社区检验完再构建完整模型家族,权重可在HuggingFace和ModelScope下载。
Qwen3.8-Flash现已上线千问AI平台,对外提供API服务,每百万Tokens输入1元,输出3元。
阿里通义千问和智谱同一天晚上先后发布Qwen3.8-Flash和GLM-5.3-Flash,都走能力不降级、价格降级路线,且都选国产芯片做推理部署验证。
编辑观点:Qwen3.8-Flash的发布展现了阿里在大模型领域的技术实力,与智谱的竞争将推动国内大模型市场发展,未来或有更多创新成果涌现。