2.4T参数,Qwen 3.8模型开源,国产超大模型架构走向趋同
除去是2.4T的大参数模型,这次开源对于阿里而言还有另外的意义。
虽然之前Qwen曾经多次开源旗舰模型,但Qwen 很早就形成了两条线。一边是开放权重模型,一边是更大的闭源 Max模型。2024 年 Qwen 自己介绍第一代产品时就明确区分了“大型开源模型Qwen-72B”和“大型闭源模型”;后来 Qwen-Max-0428 也是只通过 Qwen Chat 和 DashScope API 提供,并没有释放权重。Qwen2.5-Max 到 2025 年依然如此,只开放 API,而同时拿 Qwen2.5-72B 作为自己的开放权重对照。
而这,是Qwen第一个开放权重的 Max 规模模型。
Qwen3.8本次的开源暂时没有对应的模型,只有简单的架构、后训练、推理Infra,以及开源规则。但从中我们已经可以获得不少信息了。
01 架构
Qwen3.8共有92层(K3 96层),总参数2.4T,每个Token激活95B。它使用512个专家(K3 896个),每次选择10个路由专家,同时还有1个共享专家。相比
注意力机制上,Qwen3.8继承了Qwen3.5的混合架构。92层实际上由23组相同结构组成,每组包含3层Gated DeltaNet(门控Delta网络)和1层Gated Attention(门控全注意力),也就是69层线性注意力加23层传统注意力,比例正好接近3:1。
这和
不过K3在层间信息流上还多做了一步。它引入AttnRes(Attention Residuals,注意力残差),允许模型重新组合多个历史层的输出。从config.json中看,Qwen3.8沿用了Qwen3.5的实现。目前Qwen 3.5公开代码里仍然是比较传统的Pre-Norm残差结构,每个子层完成以后,只和进入该子层之前的 residual 直接相加。
Qwen3.8原生上下文为262,144 Token,并可以扩展到1,010,000 Token,同时进行了多步MTP(Multi-Token Prediction,多Token预测)训练。
02 Infra
这里首先要区分两种Infra。Training Infra(训练基础设施)回答的是“这个模型怎么训出来”,例如优化器、并行训练、通信、显存管理、Checkpoint和容错。Inference Infra(推理基础设施)回答的是“权重已经训完以后,怎么把它真正部署起来,并让每个Token足够快、足够便宜地吐出来”。
Qwen目前并没有像
首先是量化。Qwen官方提供BF16和FP8 checkpoint,Inferact进一步提供NVFP4和MXFP4量化版本。BF16/FP8完整版本至少需要两台NVIDIA B300或AMD MI355X节点,而FP4之后可以压缩到单节点部署。
第二则是并行。Qwen3.8 在推理阶段采用 TP(张量并行)、DP(数据并行)和 EP(专家并行) 的组合。Attention 部分更依赖 TP,把矩阵计算拆开,MoE 部分则依靠 EP,把不同专家分布到不同 GPU。与此同时,推理框架还需要通过融合通信、专用 MoE Kernel(算子)以及高速互联网络,尽量降低专家调度带来的通信开销。
最后还有MTP。Qwen3.8训练了Multi-Token Prediction能力,示例配置一次预测3个候选Token。如果候选被主模型接受,相当于一次前向传播推进多个Token,从而减少自回归逐Token生成带来的串行延迟。值得注意的是,
03 后训练
相比架构,Qwen这次对后训练具体技术披露得更少,因为config文档里也没这些。
但它的后训练目标非常清楚。
Qwen在模型卡里直接把Agent Execution列为核心升级方向,强调更强的autonomous planning(自主规划)、对environment feedback(环境反馈)的处理能力,以及更可靠的end-to-end task completion(端到端任务完成)。
但基本上现在所有的后训练都会强调这些点。
官方公布的成绩也能看到这种倾斜。在Qwen自己的对照中,从Qwen3.7-Max到3.8-Max,Terminal Bench 2.1从74.5升至86.6,PaperBench从64.8升至93.0,JobBench从31.3升至53.4,Toolathlon Verified从49.7升至72.5。
相比之下,GPQA Diamond只是从92.4变为92.6,HLE从41.4升到43.6。至少从官方评测呈现方式看,这一代最大的增量明显更多发生在Coding Agent、General Agent和专业工作,而不是传统单轮知识与推理Benchmark。
另外,Qwen3.8默认开启preserve_thinking,把之前轮次中的推理上下文继续保留下来。这样Agent在一次工具调用之后,不必只拿着最终答案和工具结果重新开始,而可以继续利用此前已经形成的推理状态。
两家同时走到这里,说明“保留推理状态”正在从Harness的职责,逐渐转入旗舰Agent模型本身的训练与接口范式。
04 开源规则
这次开源的Qwen3.8-2.4T-A95B并不完全等同于云端Qwen3.8-Max。开放版本目前是text-only(纯文本),只能运行thinking mode,原生上下文为262K。而官方Qwen3.8-Max则建立在这一模型之上,额外提供视觉输入、non-thinking模式、默认1M上下文以及官方内置工具。
拆开增强版放云,这已经是一个目前开源模型的常见模式了,这样开源也可以保有部分商业能力。比如Minimax H3的开源,就把影响成片质量的素材理解、2K 重生成和稀疏注意力实现留在云端。
许可证同样发生了变化。Qwen3时代大量模型使用Apache 2.0,而Qwen3.8改成了专门的Qwen3.8-Max License。许可证仍允许使用、复制、修改、分发、微调、部署、托管甚至出售衍生产品,但如果商业产品超过1亿月活或月收入超过2000万美元,需要在界面显著展示模型名称。如果企业从事Model-as-a-Service或AI Work Assistant业务,并且连续12个月集团收入超过5000万美元,则商业使用前需要另外取得Qwen许可。
这和
换句话说,到了3T级旗舰模型,两家公司选择的都是open-weight(开放权重)+自定义商业许可,而不是过去小模型时代更加宽松的Apache式开放。
如果把Qwen3.8和
总参数都进入2—3T,激活参数都控制在100B左右。Attention不再全部采用传统Transformer,而是用大约四分之三的递归/线性状态层配合四分之一的全局Attention,上下文目标开始稳定在百万Token。后训练重点转向Coding、Research和长程Agent。最终能不能部署,则越来越依赖FP4/FP8、融合kernel、Expert Parallelism和机架级高速互联。
但无论如何,他们的架构选择都只是小优化差异,而非大区别了。infra方面反而可能不同更大,但各种并行之间的调剂依然是最重要的问题。
配方的底子已经开始收敛,下一个谁能打破这个底子做点新意,就更值得期待了。
本文来自微信公众号“腾讯科技”,作者:博阳,36氪经授权发布。















