2026年8月13日,阿里云Qwen团队正式向公众开放Qwen3.8-2.4T-A95B模型的全部权重参数。这是Qwen系列中首次开源Max级别模型,标志着该系列在开源深度与模型能力上的重要进展。
该模型总参数量达2.4万亿,采用混合架构设计,延续Qwen3.5的技术路线,在端到端任务完成能力方面实现显著增强。每个输入Token平均激活950亿参数,兼顾计算效率与表达能力。
当前云端部署的Qwen3.8-Max版本即基于此次开源权重构建,并进一步整合面向实际生产环境的功能优化。在编程智能体、通用智能体、专业领域任务及超长上下文理解等多维度评测中,其综合表现优于同期多个主流闭源模型,在PaperBench、IFBench等权威基准测试中均位列前列。
Qwen3.8-2.4T-A95B为因果语言建模架构,MoE结构每层配置512个专家,单Token路由选择10个专家并额外激活1个共享专家,形成高效稀疏激活机制。模型经多轮MTP训练,支持具备相应能力的推理引擎一次性预测多个后续Token。其面向办公场景与智能体任务的后训练流程,系统划分为三个关键阶段,分别聚焦于功能适配、行为对齐与任务泛化。

评论
更多评论