Qwen3.8-Max logo

Qwen3.8-Max

打开

阿里 2.4T 参数开源旗舰:95B 激活的 MoE,原生文本/图片/视频输入,1M 上下文,输入 $2 / 输出 $6 每百万 token。

分享:

Qwen3.8-Max 是阿里目前最强的旗舰模型,也是首个开源权重(open weights)的 Max 级 Qwen。它采用混合专家(MoE)架构,总参数约 2.4 万亿,但每个 token 只激活 95 亿参数,因此在保有超大参数预算的同时,每次前向只流经一小部分专家。它支持文本、图片、视频输入并输出文本,架构基于 Qwen 3.5,采用混合 Gated-DeltaNet + 全注意力设计,并带有 token 级多预测(MTP)。阿里在 2026 年 7 月 19 日世界人工智能大会上进行预览,8 月 3 日正式通用发布。

模型规格

规格 Qwen3.8-Max
架构 稀疏 MoE(混合 Gated-DeltaNet + 全注意力,Qwen 3.5 技术栈)
总参数 2.4T
激活参数 每 token 95B
每层专家数 512(10 路由 + 1 共享)
模态 文本、图片、视频输入;文本输出
上下文 原生 262,144(256K),可扩展至约 1.01M;输出最高 131K
发布 7 月 19 日预览;8 月 3 日 GA
开源权重 Qwen3.8-2.4T-A95B(ModelScope / Hugging Face,8 月 12 日)
API 定价 输入 $2.00 / 输出 $6.00 每百万 token

核心功能

  • 首个开放的 Max:此前所有 Qwen Max 级模型都只走闭源 API。Qwen3.8-Max 扭转了这一局面,从 8 月 12 日起把 2.4T 权重和一个更小的配套模型放到线上。
  • 极稀疏 MoE:每个 token 只触发 512 个专家中的 11 个,虽然整个模型需要数据中心才能放得下,但每 token 的算力消耗很低。
  • 原生多模态输入:可理解图表、截图和文档的文本、图片、视频。
  • 长上下文:原生 256K,可朝百万级扩展,适合长程与智能体读取。
  • 推理原生、面向智能体:针对编码、长周期任务和多模态智能体调整,支持工具调用与结构化输出。
  • 多种 API 形式:兼容 OpenAI、DashScope 和 Anthropic,可通过 QwenCloud 及 OpenRouter 等聚合平台访问。

适用场景

谁应该使用?

  • 想用开放 Qwen 旗舰、但实际选择托管路径的团队
  • 长上下文 / 智能体方向的开发者,处理大型代码库或长文档。
  • 多模态需求,需要把截图、视频或扫描件作为输入。
  • 在意性价比的前沿团队,看重 $2/$6 相对闭源竞品的优势。

解决的问题

  1. 拿到 Max 级开放模型:权重现在可以下载,弥补了 Qwen 多年的空白。
  2. 规模化推理成本:2.4T 中只激活 95B,使每 token 服务成本低于参数数字给人的直觉。
  3. 本地部署触达:2.4T 模型现实中需要数据中心,这正是一个较小、可上消费级 GPU 的 Qwen3.8-27B 配套版本存在的原因。

定价方案

途径 价格
开源权重 ModelScope / Hugging Face 免费下载(Qwen 定制许可证)
API 输入 $2.00 / 1M token
API 输出 $6.00 / 1M token
聚合平台 部分第三方约 $1.65 输入 / $4.99 输出

开放权重给你的是基础模型;托管的 qwen3.8-max 额外加入生产后训练。自托管 2.4T 模型是集群决策而非工作站决策:在 4-bit 量化下大约需要 1.2 TB 显存。

优势对比

相比竞品

  1. 相比 Claude Opus / GPT-5.6:在厂商自报基准上逼近前沿,价格却只有三分之一到一半。
  2. 相比 Qwen3.7-Max:更便宜($2/$6 vs $2.50/$7.50),并新增图片与视频输入,更拿到了前一代从未有的开放权重。
  3. 相比 DeepSeek / GLM 等开放对手:参数预算大得多,并采用面向长上文的混合注意力设计。

独特卖点

  • 首个开放权重的 Max 级 Qwen,价格激进。
  • 稀疏激活让大规模运行更便宜,但拥有成本并不低。

重要提醒

所有头条基准均为厂商自报。上线时独立的排行榜、Artifactory Analysis 评分或标准 SWE-bench 尚未给出结果,且曾有报道称中立 harness 会逆转部分智能体成绩。请把 OSWorld-Verified 86.1、PaperBench 93.0、Terminal-Bench 86.6 视为阿里的自报,待其他来源核实后再采信。

快速开始

  1. API:把客户端指向 QwenCloud 或 DashScope,模型 id 为 qwen3.8-max,或走 OpenAI / Anthropic 兼容端点。
  2. 开放权重:有数据中心 GPU 时,从 ModelScope 或 Hugging Face 下载 Qwen3.8-2.4T-A95B
  3. 自托管:单张消费级 GPU 请改用 Apache-2.0 的 Qwen3.8-27B
  4. 搭配 Qwen Code:这款开源的终端编码智能体专门为 Qwen 模型优化。

常见问题

支持多模态吗?

支持。文本、图片、视频输入,文本输出。

真实上下文是多少?

原生 256K,可扩展到约 1.01M,但该模式的品质折损阿里尚未完全说明。

能本地跑吗?

现实不现实。2.4T 需要数据中心级集群,本地请优先用 27B 配套版本。

什么许可证?

权重采用 Qwen 定制许可,接近 MIT 但商业使用前需要细读条款,并非 Apache 2.0。

替代方案

  • Qwen3.8-27B:单卡可用的 Apache-2.0 稠密配套模型。
  • Qwen3.8-Flash-Next:Qwen4 的廉价架构预览,价格约为其十二分之一。
  • GLM-5.3-Flash:另一款近期开放权重的性价比发布,320B / 18B 激活,MIT。

使用技巧

  1. 先读许可证:在 ModelScope 仓库的 license 文件,"定制"不等于宽松。
  2. 不要默认 1M 上下文:原生窗口是 256K。
  3. 在自己的任务上做基准:厂商的智能体成绩曾被报道在中立 harness 下缩水,请用你自己的任务重测。

总结

Qwen3.8-Max 是阿里迄今最大的开放 Qwen:2.4T MoE、95B 激活、多模态输入、百万级上下文,以及首个 Max 级开源权重,定价 $2/$6 每百万 token。对于想要前沿级开放模型又不想被闭源厂商绑定的开发者,这是本月的头条选项。从 Qwen 官方博客QwenCloud 模型页 开始。

评论

还没有评论。成为第一个评论的人!