2.4T参数,Qwen 3.8模型开源,国产超大模型架构走向趋同

36氪的朋友们·2026年08月13日 20:10
超大模型训练配方已经开始收敛

Kimi K3 开源半个月后,8月13日,阿里Qwen也正式开放了Qwen3.8-2.4T的模型权重。

除去是2.4T的大参数模型,这次开源对于阿里而言还有另外的意义。

虽然之前Qwen曾经多次开源旗舰模型,但Qwen 很早就形成了两条线。一边是开放权重模型,一边是更大的闭源 Max模型。2024 年 Qwen 自己介绍第一代产品时就明确区分了“大型开源模型Qwen-72B”和“大型闭源模型”;后来 Qwen-Max-0428 也是只通过 Qwen Chat 和 DashScope API 提供,并没有释放权重。Qwen2.5-Max 到 2025 年依然如此,只开放 API,而同时拿 Qwen2.5-72B 作为自己的开放权重对照。

而这,是Qwen第一个开放权重的 Max 规模模型。

Qwen3.8本次的开源暂时没有对应的模型,只有简单的架构、后训练、推理Infra,以及开源规则。但从中我们已经可以获得不少信息了。

01 架构

Qwen3.8共有92层(K3 96层),总参数2.4T,每个Token激活95B。它使用512个专家(K3 896个),每次选择10个路由专家,同时还有1个共享专家。相比Kimi K3,每个专家更大,但总激活量稍小(Kimi K3为16专家,103B)。

注意力机制上,Qwen3.8继承了Qwen3.5的混合架构。92层实际上由23组相同结构组成,每组包含3层Gated DeltaNet(门控Delta网络)和1层Gated Attention(门控全注意力),也就是69层线性注意力加23层传统注意力,比例正好接近3:1。

这和Kimi K3非常像。K3的93层里有69层Kimi Delta Attention(KDA,Kimi Delta注意力)和24层Gated MLA(门控多头潜在注意力),也是大约3:1。两者甚至属于相近的技术谱系,KDA可以看作对Gated DeltaNet遗忘机制进一步细粒度化的版本。

不过K3在层间信息流上还多做了一步。它引入AttnRes(Attention Residuals,注意力残差),允许模型重新组合多个历史层的输出。从config.json中看,Qwen3.8沿用了Qwen3.5的实现。目前Qwen 3.5公开代码里仍然是比较传统的Pre-Norm残差结构,每个子层完成以后,只和进入该子层之前的 residual 直接相加。

Qwen3.8原生上下文为262,144 Token,并可以扩展到1,010,000 Token,同时进行了多步MTP(Multi-Token Prediction,多Token预测)训练。

02 Infra

这里首先要区分两种Infra。Training Infra(训练基础设施)回答的是“这个模型怎么训出来”,例如优化器、并行训练、通信、显存管理、Checkpoint和容错。Inference Infra(推理基础设施)回答的是“权重已经训完以后,怎么把它真正部署起来,并让每个Token足够快、足够便宜地吐出来”。

Qwen目前并没有像Kimi K3技术报告那样系统披露训练Infra,因此不能从这次发布判断它具体如何完成2.4T规模的训练。但推理侧的信息相对丰富。

首先是量化。Qwen官方提供BF16和FP8 checkpoint,Inferact进一步提供NVFP4和MXFP4量化版本。BF16/FP8完整版本至少需要两台NVIDIA B300或AMD MI355X节点,而FP4之后可以压缩到单节点部署。

第二则是并行。Qwen3.8 在推理阶段采用 TP(张量并行)、DP(数据并行)和 EP(专家并行) 的组合。Attention 部分更依赖 TP,把矩阵计算拆开,MoE 部分则依靠 EP,把不同专家分布到不同 GPU。与此同时,推理框架还需要通过融合通信、专用 MoE Kernel(算子)以及高速互联网络,尽量降低专家调度带来的通信开销。

Kimi K3 面临的是同一个问题。在训练 2.8T 参数、896 专家的 Stable LatentMoE 时,Moonshot 并没有简单扩大传统 EP,而是提出 MoonEP,让热门专家根据当前负载动态复制到更多 GPU 上。

最后还有MTP。Qwen3.8训练了Multi-Token Prediction能力,示例配置一次预测3个候选Token。如果候选被主模型接受,相当于一次前向传播推进多个Token,从而减少自回归逐Token生成带来的串行延迟。值得注意的是,DeepSeek V4 在技术报告中也明确用了 MTP。

03 后训练

相比架构,Qwen这次对后训练具体技术披露得更少,因为config文档里也没这些。

但它的后训练目标非常清楚。

Qwen在模型卡里直接把Agent Execution列为核心升级方向,强调更强的autonomous planning(自主规划)、对environment feedback(环境反馈)的处理能力,以及更可靠的end-to-end task completion(端到端任务完成)。

但基本上现在所有的后训练都会强调这些点。

官方公布的成绩也能看到这种倾斜。在Qwen自己的对照中,从Qwen3.7-Max到3.8-Max,Terminal Bench 2.1从74.5升至86.6,PaperBench从64.8升至93.0,JobBench从31.3升至53.4,Toolathlon Verified从49.7升至72.5。

相比之下,GPQA Diamond只是从92.4变为92.6,HLE从41.4升到43.6。至少从官方评测呈现方式看,这一代最大的增量明显更多发生在Coding Agent、General Agent和专业工作,而不是传统单轮知识与推理Benchmark。

另外,Qwen3.8默认开启preserve_thinking,把之前轮次中的推理上下文继续保留下来。这样Agent在一次工具调用之后,不必只拿着最终答案和工具结果重新开始,而可以继续利用此前已经形成的推理状态。

Kimi K3也采取了几乎相同的方向。官方明确表示其后训练保留了推理历史。多轮交互和工具调用时,需要把此前的reasoning content和tool calls完整送回模型。

两家同时走到这里,说明“保留推理状态”正在从Harness的职责,逐渐转入旗舰Agent模型本身的训练与接口范式。

04 开源规则

这次开源的Qwen3.8-2.4T-A95B并不完全等同于云端Qwen3.8-Max。开放版本目前是text-only(纯文本),只能运行thinking mode,原生上下文为262K。而官方Qwen3.8-Max则建立在这一模型之上,额外提供视觉输入、non-thinking模式、默认1M上下文以及官方内置工具。

拆开增强版放云,这已经是一个目前开源模型的常见模式了,这样开源也可以保有部分商业能力。比如Minimax H3的开源,就把影响成片质量的素材理解、2K 重生成和稀疏注意力实现留在云端。

许可证同样发生了变化。Qwen3时代大量模型使用Apache 2.0,而Qwen3.8改成了专门的Qwen3.8-Max License。许可证仍允许使用、复制、修改、分发、微调、部署、托管甚至出售衍生产品,但如果商业产品超过1亿月活或月收入超过2000万美元,需要在界面显著展示模型名称。如果企业从事Model-as-a-Service或AI Work Assistant业务,并且连续12个月集团收入超过5000万美元,则商业使用前需要另外取得Qwen许可。

这和Kimi K3也非常类似。K3同样采用自己的Kimi K3 License,而不是Apache 2.0;同样允许广泛使用和修改,也设置了超大规模商业产品的署名要求以及MaaS业务的额外授权门槛。区别主要在具体阈值和覆盖业务范围。

换句话说,到了3T级旗舰模型,两家公司选择的都是open-weight(开放权重)+自定义商业许可,而不是过去小模型时代更加宽松的Apache式开放。

如果把Qwen3.8和Kimi K3放在一起看,反而可以看到2026年旗舰模型开始出现一种相当明显的收敛。

总参数都进入2—3T,激活参数都控制在100B左右。Attention不再全部采用传统Transformer,而是用大约四分之三的递归/线性状态层配合四分之一的全局Attention,上下文目标开始稳定在百万Token。后训练重点转向Coding、Research和长程Agent。最终能不能部署,则越来越依赖FP4/FP8、融合kernel、Expert Parallelism和机架级高速互联。

Kimi K3在模型架构上走得更激进一些,它同时引入KDA、AttnRes和Stable LatentMoE;Qwen3.8则更像一次把已经在Qwen3.5验证过的混合注意力架构直接Scale到Max级别,并围绕长程Agent和生产推理把整个生态补齐。

但无论如何,他们的架构选择都只是小优化差异,而非大区别了。infra方面反而可能不同更大,但各种并行之间的调剂依然是最重要的问题。

配方的底子已经开始收敛,下一个谁能打破这个底子做点新意,就更值得期待了。

本文来自微信公众号“腾讯科技”,作者:博阳,36氪经授权发布。

+1
1

好文章,需要你的鼓励

参与评论
评论千万条,友善第一条
后参与讨论
提交评论0/1000

36氪AI测评

选靠谱AI,看真实评测
查看
36氪AI测评官方交流社区
加入

36氪项目推荐

咨询项目审核和入驻
联系
36氪项目推荐订阅号
关注
36氪APP让一部分人先看到未来
36氪
鲸准
氪空间

推送和解读前沿、有料的科技创投资讯

一级市场金融信息和系统服务提供商

聚焦全球优秀创业者,项目融资率接近97%,领跑行业