Qwen3.8-Max 是阿里目前最强的旗舰模型,也是首个开源权重(open weights)的 Max 级 Qwen。它采用混合专家(MoE)架构,总参数约 2.4 万亿,但每个 token 只激活 95 亿参数,因此在保有超大参数预算的同时,每次前向只流经一小部分专家。它支持文本、图片、视频输入并输出文本,架构基于 Qwen 3.5,采用混合 Gated-DeltaNet + 全注意力设计,并带有 token 级多预测(MTP)。阿里在 2026 年 7 月 19 日世界人工智能大会上进行预览,8 月 3 日正式通用发布。
模型规格
| 规格 | Qwen3.8-Max |
|---|---|
| 架构 | 稀疏 MoE(混合 Gated-DeltaNet + 全注意力,Qwen 3.5 技术栈) |
| 总参数 | 2.4T |
| 激活参数 | 每 token 95B |
| 每层专家数 | 512(10 路由 + 1 共享) |
| 模态 | 文本、图片、视频输入;文本输出 |
| 上下文 | 原生 262,144(256K),可扩展至约 1.01M;输出最高 131K |
| 发布 | 7 月 19 日预览;8 月 3 日 GA |
| 开源权重 | Qwen3.8-2.4T-A95B(ModelScope / Hugging Face,8 月 12 日) |
| API 定价 | 输入 $2.00 / 输出 $6.00 每百万 token |
核心功能
- 首个开放的 Max:此前所有 Qwen Max 级模型都只走闭源 API。Qwen3.8-Max 扭转了这一局面,从 8 月 12 日起把 2.4T 权重和一个更小的配套模型放到线上。
- 极稀疏 MoE:每个 token 只触发 512 个专家中的 11 个,虽然整个模型需要数据中心才能放得下,但每 token 的算力消耗很低。
- 原生多模态输入:可理解图表、截图和文档的文本、图片、视频。
- 长上下文:原生 256K,可朝百万级扩展,适合长程与智能体读取。
- 推理原生、面向智能体:针对编码、长周期任务和多模态智能体调整,支持工具调用与结构化输出。
- 多种 API 形式:兼容 OpenAI、DashScope 和 Anthropic,可通过 QwenCloud 及 OpenRouter 等聚合平台访问。
适用场景
谁应该使用?
- 想用开放 Qwen 旗舰、但实际选择托管路径的团队。
- 长上下文 / 智能体方向的开发者,处理大型代码库或长文档。
- 多模态需求,需要把截图、视频或扫描件作为输入。
- 在意性价比的前沿团队,看重 $2/$6 相对闭源竞品的优势。
解决的问题
- 拿到 Max 级开放模型:权重现在可以下载,弥补了 Qwen 多年的空白。
- 规模化推理成本:2.4T 中只激活 95B,使每 token 服务成本低于参数数字给人的直觉。
- 本地部署触达:2.4T 模型现实中需要数据中心,这正是一个较小、可上消费级 GPU 的 Qwen3.8-27B 配套版本存在的原因。
定价方案
| 途径 | 价格 |
|---|---|
| 开源权重 | ModelScope / Hugging Face 免费下载(Qwen 定制许可证) |
| API 输入 | $2.00 / 1M token |
| API 输出 | $6.00 / 1M token |
| 聚合平台 | 部分第三方约 $1.65 输入 / $4.99 输出 |
开放权重给你的是基础模型;托管的 qwen3.8-max 额外加入生产后训练。自托管 2.4T 模型是集群决策而非工作站决策:在 4-bit 量化下大约需要 1.2 TB 显存。
优势对比
相比竞品:
- 相比 Claude Opus / GPT-5.6:在厂商自报基准上逼近前沿,价格却只有三分之一到一半。
- 相比 Qwen3.7-Max:更便宜($2/$6 vs $2.50/$7.50),并新增图片与视频输入,更拿到了前一代从未有的开放权重。
- 相比 DeepSeek / GLM 等开放对手:参数预算大得多,并采用面向长上文的混合注意力设计。
独特卖点:
- 首个开放权重的 Max 级 Qwen,价格激进。
- 稀疏激活让大规模运行更便宜,但拥有成本并不低。
重要提醒
所有头条基准均为厂商自报。上线时独立的排行榜、Artifactory Analysis 评分或标准 SWE-bench 尚未给出结果,且曾有报道称中立 harness 会逆转部分智能体成绩。请把 OSWorld-Verified 86.1、PaperBench 93.0、Terminal-Bench 86.6 视为阿里的自报,待其他来源核实后再采信。
快速开始
- API:把客户端指向 QwenCloud 或 DashScope,模型 id 为
qwen3.8-max,或走 OpenAI / Anthropic 兼容端点。 - 开放权重:有数据中心 GPU 时,从 ModelScope 或 Hugging Face 下载
Qwen3.8-2.4T-A95B。 - 自托管:单张消费级 GPU 请改用 Apache-2.0 的 Qwen3.8-27B。
- 搭配 Qwen Code:这款开源的终端编码智能体专门为 Qwen 模型优化。
常见问题
支持多模态吗?
支持。文本、图片、视频输入,文本输出。
真实上下文是多少?
原生 256K,可扩展到约 1.01M,但该模式的品质折损阿里尚未完全说明。
能本地跑吗?
现实不现实。2.4T 需要数据中心级集群,本地请优先用 27B 配套版本。
什么许可证?
权重采用 Qwen 定制许可,接近 MIT 但商业使用前需要细读条款,并非 Apache 2.0。
替代方案
- Qwen3.8-27B:单卡可用的 Apache-2.0 稠密配套模型。
- Qwen3.8-Flash-Next:Qwen4 的廉价架构预览,价格约为其十二分之一。
- GLM-5.3-Flash:另一款近期开放权重的性价比发布,320B / 18B 激活,MIT。
使用技巧
- 先读许可证:在 ModelScope 仓库的 license 文件,"定制"不等于宽松。
- 不要默认 1M 上下文:原生窗口是 256K。
- 在自己的任务上做基准:厂商的智能体成绩曾被报道在中立 harness 下缩水,请用你自己的任务重测。
总结
Qwen3.8-Max 是阿里迄今最大的开放 Qwen:2.4T MoE、95B 激活、多模态输入、百万级上下文,以及首个 Max 级开源权重,定价 $2/$6 每百万 token。对于想要前沿级开放模型又不想被闭源厂商绑定的开发者,这是本月的头条选项。从 Qwen 官方博客 或 QwenCloud 模型页 开始。
评论
还没有评论。成为第一个评论的人!