Qwen3.8-Max 是阿里目前最强的旗舰模型,也是首个开源权重(open weights)的 Max 级 Qwen。它采用混合专家(MoE)架构,总参数约 2.4 万亿,但每个 token 只激活 95 亿参数,因此在保有超大参数预算的同时,每次前向只流经一小部分专家。它支持文本、图片、视频输入并输出文本,架构基于 Qwen 3.5,采用混合 Gated-DeltaNet + 全注意力设计,并带有 token 级多预测(MTP)。阿里在 2026 年 7 月 19 日世界人工智能大会上进行预览,8 月 3 日正式通用发布。
模型规格
| 规格 | Qwen3.8-Max |
|---|---|
| 架构 | 稀疏 MoE(混合 Gated-DeltaNet + 全注意力,Qwen 3.5 技术栈) |
| 总参数 | 2.4T |
| 激活参数 | 每 token 95B |
| 每层专家数 | 512(10 路由 + 1 共享) |
| 模态 | 文本、图片、视频输入;文本输出 |
| 上下文 | 原生 262,144(256K),可扩展至约 1.01M;输出最高 131K |
| 发布 | 7 月 19 日预览;8 月 3 日 GA |
| 开源权重 | Qwen3.8-2.4T-A95B(ModelScope / Hugging Face,8 月 12 日) |
| API 定价 | 输入 $2.00 / 输出 $6.00 每百万 token |
核心功能
- 首个开放的 Max:此前所有 Qwen Max 级模型都只走闭源 API。Qwen3.8-Max 扭转了这一局面,从 8 月 12 日起把 2.4T 权重和一个更小的配套模型放到线上。
- 极稀疏 MoE:每个 token 只触发 512 个专家中的 11 个,虽然整个模型需要数据中心才能放得下,但每 token 的算力消耗很低。
- 原生多模态输入:可理解图表、截图和文档的文本、图片、视频。
- 长上下文:原生 256K,可朝百万级扩展,适合长程与智能体读取。
- 推理原生、面向智能体:针对编码、长周期任务和多模态智能体调整,支持工具调用与结构化输出。
- 多种 API 形式:兼容 OpenAI、DashScope 和 Anthropic,可通过 QwenCloud 及 OpenRouter 等聚合平台访问。
适用场景
谁应该使用?
- 想用开放 Qwen 旗舰、但实际选择托管路径的团队。
- 长上下文 / 智能体方向的开发者,处理大型代码库或长文档。
- 多模态需求,需要把截图、视频或扫描件作为输入。
- 在意性价比的前沿团队,看重 $2/$6 相对闭源竞品的优势。
解决的问题
- 拿到 Max 级开放模型:权重现在可以下载,弥补了 Qwen 多年的空白。
- 规模化推理成本:2.4T 中只激活 95B,使每 token 服务成本低于参数数字给人的直觉。
- 本地部署触达:2.4T 模型现实中需要数据中心,这正是一个较小、可上消费级 GPU 的 Qwen3.8-27B 配套版本存在的原因。
定价方案
| 途径 | 价格 |
|---|---|
| 开源权重 | ModelScope / Hugging Face 免费下载(Qwen 定制许可证) |
| API 输入 | $2.00 / 1M token |
| API 输出 | $6.00 / 1M token |
| 聚合平台 | 部分第三方约 $1.65 输入 / $4.99 输出 |
开放权重给你的是基础模型;托管的 qwen3.8-max 额外加入生产后训练。自托管 2.4T 模型是集群决策而非工作站决策:在 4-bit 量化下大约需要 1.2 TB 显存。
优势对比
相比竞品:
- 相比 Claude Opus / GPT-5.6:在厂商自报基准上逼近前沿,价格却只有三分之一到一半。
- 相比 Qwen3.7-Max:更便宜($2/$6 vs $2.50/$7.50),并新增图片与视频输入,更拿到了前一代从未有的开放权重。
- 相比 DeepSeek / GLM 等开放对手:参数预算大得多,并采用面向长上文的混合注意力设计。
独特卖点:
- 首个开放权重的 Max 级 Qwen,价格激进。
- 稀疏激活让大规模运行更便宜,但拥有成本并不低。
重要提醒
所有头条基准均为厂商自报。上线时独立的排行榜、Artifactory Analysis 评分或标准 SWE-bench 尚未给出结果,且曾有报道称中立 harness 会逆转部分智能体成绩。请把 OSWorld-Verified 86.1、PaperBench 93.0、Terminal-Bench 86.6 视为阿里的自报,待其他来源核实后再采信。
快速开始
- API:把客户端指向 QwenCloud 或 DashScope,模型 id 为
qwen3.8-max,或走 OpenAI / Anthropic 兼容端点。 - 开放权重:有数据中心 GPU 时,从 ModelScope 或 Hugging Face 下载
Qwen3.8-2.4T-A95B。 - 自托管:单张消费级 GPU 请改用 Apache-2.0 的 Qwen3.8-27B。
- 搭配 Qwen Code:这款开源的终端编码智能体专门为 Qwen 模型优化。
常见问题
支持多模态吗?
支持。文本、图片、视频输入,文本输出。
真实上下文是多少?
原生 256K,可扩展到约 1.01M,但该模式的品质折损阿里尚未完全说明。
能本地跑吗?
现实不现实。2.4T 需要数据中心级集群,本地请优先用 27B 配套版本。
什么许可证?
权重采用 Qwen 定制许可,接近 MIT 但商业使用前需要细读条款,并非 Apache 2.0。
替代方案
- Qwen3.8-27B:单卡可用的 Apache-2.0 稠密配套模型。
- Qwen3.8-Flash-Next:Qwen4 的廉价架构预览,价格约为其十二分之一。
- GLM-5.3-Flash:另一款近期开放权重的性价比发布,320B / 18B 激活,MIT。
使用技巧
- 先读许可证:在 ModelScope 仓库的 license 文件,"定制"不等于宽松。
- 不要默认 1M 上下文:原生窗口是 256K。
- 在自己的任务上做基准:厂商的智能体成绩曾被报道在中立 harness 下缩水,请用你自己的任务重测。
总结
Qwen3.8-Max 是阿里迄今最大的开放 Qwen:2.4T MoE、95B 激活、多模态输入、百万级上下文,以及首个 Max 级开源权重,定价 $2/$6 每百万 token。对于想要前沿级开放模型又不想被闭源厂商绑定的开发者,这是本月的头条选项。从 Qwen 官方博客 或 QwenCloud 模型页 开始。
评论
还没有评论。成为第一个评论的人!
相关工具
Qwen3.8-Flash-Next
qwen.ai
阿里通义千问公开的 Qwen4 架构预览:125B 多模态 MoE、每 token 仅激活 6B,外加 51B N-gram 词表,原生 262K 上下文,输入定价 $0.16/百万 token。
Qwen3.8-27B
qwen.ai
阿里巴巴开源的 27B 稠密模型,Qwen3.8-Max 的配套稠密版本,Apache 2.0 协议,支持图文多模态输入,面向本地部署与小批量推理。
Qwen3.8-2.4T-A95B
qwen.ai
阿里巴巴旗舰 2.4T MoE 模型,激活参数 95B,1M token 上下文,原生多模态输入,PaperBench 与 OSWorld 全球登顶,史上最大的 Qwen 模型。
相关洞察

Grok Bot、Hermes Bot:一个人,终于配上了智囊团和秘书处
Grok Bot 进了 Cursor Pro+,Hermes Bot 能跑在 VPS 上。它们不是更聪明的聊天框。出主意的是智囊团,抓落实的是秘书处,拍板的还是你。
Windows 上把 OpenCode Go 接进 Codex,别再新开一套工具
ChatGPT 登录的 Codex 桌面版,默认选择器几乎只露出 GPT。Windows 上只开 OpenCode Go 这一家,就能把已经付过钱的 Grok、GLM、Kimi、DeepSeek、MiniMax 接回同一个 picker。密钥不出本机,原生 GPT 也不动。
锁死 Codex 的不是模型,是选择器
你已经为 OpenCode Go、Grok、Z.ai 付过钱了,但 Codex 的 picker 默认只露出 GPT。社区项目 codex-router 做的不是再教一遍安装步骤,而是把已经买过的模型能力接回选择器:密钥不出本机,原生 GPT 也不动。