Qwen3.8-Flash-Next 是阿里通义千问于 2026 年 8 月 26 日发布的开源权重模型,用于预览即将到来的 Qwen4 家族所采用的架构。这是一款多模态混合专家(MoE)模型,总共 125B 参数但每次推理只激活 6B,外加一个 51B 参数的 N-gram 词嵌入层,运行在系统内存而非 GPU 中。团队称其为"新架构,迈向极致成本效率":在以约九分之一训练成本的前提下,效果优于 Qwen3.7-Plus。
模型规格
| 规格 | Qwen3.8-Flash-Next |
|---|---|
| 架构 | 多模态 MoE(Gated DeltaNet + Gated Attention) |
| 总参数 | 125B(主体)+ 51B(N-gram 词嵌入) |
| 激活参数 | 每 token 6B |
| 输入模态 | 文本、图像(多模态图像文本) |
| 上下文窗口 | 原生 262,144;YaRN 可扩展至约 1M |
| 许可 | Qwen 专用许可(Hugging Face / ModelScope 开放权重) |
| API 价格 | $0.16 / 百万输入,$0.47 / 百万输出(QwenCloud 上的 Qwen3.8-Flash) |
核心功能
- Qwen4 架构预告:先前提及的 Gated DeltaNet + Gated Attention 混合设计提前发布,让社区在 Qwen4 全家族落地前先审视该架构。
- 极稀疏激活:125B 中每 token 只激活 6B 参数,保有庞大参数预算的同时压低推理成本。
- N-gram 词嵌入层:一个 51B 参数的"短语词典",将常用词组作为独立条目存储,放在常规系统内存里,附加成本相对较低。
- 多模态:原生图像文本输入,覆盖截图、图表和文档理解。
- 成本效率打法:约为 Qwen3.7-Plus 九分之一的训练成本,却取得更好效果,编码与办公任务提升最大。
- ModelScope + Transformers 支持:ModelScope 提供一等支持并兼容 OpenAI、Anthropic 风格的 API 规范,也能用
transformers serve轻松本地部署。
适用场景
谁应该使用这个工具?
- 架构观察者:想在 Qwen4 全系落地前看到下一代 Qwen 设计。
- 成本敏感的开发者:想要一个激活参数少的 MoE 来跑智能体编码与办公负载。
- 本地部署者:GPU 能装下 125B 模型,因为 N-gram 层可卸载到内存。
- 已用阿里云百炼的团队:关注即将上线的生产级 Qwen3.8-Flash API。
解决的问题
- 训练成本:抢先发布架构,让社区以极小算力对 Qwen4 的效率方案做原型验证。
- 推理成本:125B 中仅 6B 激活,总容量大而单 token 服务便宜。
- 内存压力:51B N-gram 词表常驻系统内存,模型很大一部分无需进入显存。
定价方案
权重可从 Hugging Face 或 ModelScope 免费下载(Qwen 专用许可)。托管路径为 QwenCloud 上的 Qwen3.8-Flash,定价 $0.16/百万输入 token、$0.47/百万输出 token;生产级 API 宣布即将上线。作为参考,旗舰级 Qwen3.8-Max 在输入输出上约是其十二倍。
| 路径 | 价格 |
|---|---|
| 权重(Qwen 许可) | 免费下载 |
| Qwen3.8-Flash API 输入 | $0.16 / 百万 token |
| Qwen3.8-Flash API 输出 | $0.47 / 百万 token |
| Qwen3.8-Max(参考) | 输入 $2.00 / 输出 $6.00 每百万 |
优势对比
相比竞品的优势:
- 对比 Qwen3.7-Plus:约九分之一训练成本但效果更好,编码与办公任务提升最大。
- 对比 DeepSeek-V4-Flash:在官方公布的多数基准任务上领先,尽管激活参数更少。
- 对比 Qwen3.8-Max:略低于旗舰但成本约为十二分之一,输入输出均有数量级差距。
- 对比 Anthropic Claude Opus 4.6:在其公布的排行榜上于多数测试行胜出。
独特卖点:
- N-gram 词嵌入层运行在内存中,这种少见的分置降低了显存压力。
- 它是 Qwen4 的早期预览,而非现有世代的点升级。
用户评价
社区反响快速而热烈。在 r/opencode 和 r/LocalLLaMA 上,Qwen3.8-Flash-Next 与 GLM-5.3-Flash 同日发布,成为当天主要讨论点。已有 Qwen3.8-27B 用户指出该家族容易"过度思考",这一特质延续下来。在 NVIDIA DGX Spark 论坛上,开发者权衡 6B 激活模型是否能在双 Spark 上跑 FP8 量化版,并质疑那 51B 词表的 dtype 与量化方式。
快速开始
入门指南
- 下载:从 Hugging Face 或 ModelScope 拉取权重,例如
huggingface download Qwen/Qwen3.8-Flash-Next。 - 本地服务:运行
transformers serve Qwen/Qwen3.8-Flash-Next,或用本地运行时加量化版本适配显存。 - 配合 Qwen Code:搭配为通义千问优化、面向仓库级软件工程的开源终端编码智能体。
- 走托管:调用 QwenCloud 上的 Qwen3.8-Flash API,兼容 OpenAI 与 Anthropic 风格规范。
集成
- Hugging Face 与 ModelScope:权重、微调(LLaMA-Factory)、服务。
- 阿里云百炼 API,兼容 OpenAI 与 Anthropic 风格规范。
- Qwen Code,开源终端编码智能体。
常见问题
Qwen3.8-Flash-Next 是 MoE 模型吗?
是的。它是多模态 MoE,125B 参数、每 token 激活 6B,外加 51B N-gram 词嵌入层。
它就是 Qwen4 吗?
不是。它是 Qwen4 的早期架构预告。完整的 Qwen4 家族将基于此设计构建,但本次发布是实验性的前身。
上下文窗口是多少?
原生 262,144 token,可用 YaRN 扩展到约一百万 token。
许可是什么?
权重采用 Qwen 专用许可(非 Apache 2.0),可从 Hugging Face 与 ModelScope 下载。生产级 Qwen3.8-Flash API 属托管服务。
替代方案
- Qwen3.8-27B:面向本地部署与小批量推理的稠密 Apache 2.0 型号。
- GLM-5.3-Flash:同为 8 月 26 日发布的成本效率模型,320B 总参 / 18B 激活,MIT。
- DeepSeek V4 Flash:成本敏感智能体负载的强劲开源选择。
使用技巧
- 提前规划词表内存:51B N-gram 参数主要在内存中,内存规划不同于常规 MoE;部署前确认 dtype 与量化。
- 留意"预览"属性:这是架构发布,先在自有任务上基准验证再用于生产。
- 匹配硬件:6B 激活模型在词表卸载后,双 Spark 或中等显存配置下就能跑得很快。
总结
Qwen3.8-Flash-Next 是阿里对如何构建 Qwen4 的公开预演:极稀疏激活、常驻内存的 N-gram 词表,以及在编码与办公上优于上一代、训练成本却约九分之一的方案。对于想要一款便宜、当下世代的开源 MoE、同时又想瞥见未来走向的开发者,它是值得研究的发布。建议从 Qwen 官方博客 或 GitHub 仓库 的技术报告入手。
评论
还没有评论。成为第一个评论的人!
相关工具
GLM-5.3-Flash
z.ai
智谱首个原生多模态 GLM 系列模型(即此前匿名的 'Ox Alpha'):320B MoE、仅 18B 激活、1M 上下文、MIT 开源权重,输入定价 $0.15/百万 token。
Qwen3.8-2.4T-A95B
qwen.ai
阿里巴巴旗舰 2.4T MoE 模型,激活参数 95B,1M token 上下文,原生多模态输入,PaperBench 与 OSWorld 全球登顶,史上最大的 Qwen 模型。
Qwen3.8-27B
qwen.ai
阿里巴巴开源的 27B 稠密模型,Qwen3.8-Max 的配套稠密版本,Apache 2.0 协议,支持图文多模态输入,面向本地部署与小批量推理。
相关洞察
7 款 AI 编程 CLI 用了半年,我悟出一个道理:模型再强,干活也要有监督
Claude Code、Codex、opencode、pi、omp、DeepSeek Harness 各有性格。半年深度使用后我总结出一套分工矩阵:pi 做最省事的 CR、omp 审复杂 PR、DeepSeek Harness 配 V4 Flash 高频低成本审查、Claude Code 与 Qoder 写代码。模型再强,干活也要有监督,而且最好是独立第三方。
Claudesidian:让 Obsidian 变成 AI 驱动的第二大脑
通过 Claudesidian 这个开源项目,将 Obsidian 笔记系统与 Claude Code 完美结合。内置 PARA 方法、自定义命令、自动化工作流,从想法到实现的完整解决方案。
锁死 Codex 的不是模型,是选择器
你已经为 OpenCode Go、Grok、Z.ai 付过钱了,但 Codex 的 picker 默认只露出 GPT。社区项目 codex-router 做的不是再教一遍安装步骤,而是把已经买过的模型能力接回选择器:密钥不出本机,原生 GPT 也不动。