Qwen3.8-Flash-Next logo

Qwen3.8-Flash-Next

打开

阿里通义千问公开的 Qwen4 架构预览:125B 多模态 MoE、每 token 仅激活 6B,外加 51B N-gram 词表,原生 262K 上下文,输入定价 $0.16/百万 token。

分享:

Qwen3.8-Flash-Next 是阿里通义千问于 2026 年 8 月 26 日发布的开源权重模型,用于预览即将到来的 Qwen4 家族所采用的架构。这是一款多模态混合专家(MoE)模型,总共 125B 参数但每次推理只激活 6B,外加一个 51B 参数的 N-gram 词嵌入层,运行在系统内存而非 GPU 中。团队称其为"新架构,迈向极致成本效率":在以约九分之一训练成本的前提下,效果优于 Qwen3.7-Plus。

模型规格

规格 Qwen3.8-Flash-Next
架构 多模态 MoE(Gated DeltaNet + Gated Attention)
总参数 125B(主体)+ 51B(N-gram 词嵌入)
激活参数 每 token 6B
输入模态 文本、图像(多模态图像文本)
上下文窗口 原生 262,144;YaRN 可扩展至约 1M
许可 Qwen 专用许可(Hugging Face / ModelScope 开放权重)
API 价格 $0.16 / 百万输入,$0.47 / 百万输出(QwenCloud 上的 Qwen3.8-Flash)

核心功能

  • Qwen4 架构预告:先前提及的 Gated DeltaNet + Gated Attention 混合设计提前发布,让社区在 Qwen4 全家族落地前先审视该架构。
  • 极稀疏激活:125B 中每 token 只激活 6B 参数,保有庞大参数预算的同时压低推理成本。
  • N-gram 词嵌入层:一个 51B 参数的"短语词典",将常用词组作为独立条目存储,放在常规系统内存里,附加成本相对较低。
  • 多模态:原生图像文本输入,覆盖截图、图表和文档理解。
  • 成本效率打法:约为 Qwen3.7-Plus 九分之一的训练成本,却取得更好效果,编码与办公任务提升最大。
  • ModelScope + Transformers 支持:ModelScope 提供一等支持并兼容 OpenAI、Anthropic 风格的 API 规范,也能用 transformers serve 轻松本地部署。

适用场景

谁应该使用这个工具?

  • 架构观察者:想在 Qwen4 全系落地前看到下一代 Qwen 设计。
  • 成本敏感的开发者:想要一个激活参数少的 MoE 来跑智能体编码与办公负载。
  • 本地部署者:GPU 能装下 125B 模型,因为 N-gram 层可卸载到内存。
  • 已用阿里云百炼的团队:关注即将上线的生产级 Qwen3.8-Flash API。

解决的问题

  1. 训练成本:抢先发布架构,让社区以极小算力对 Qwen4 的效率方案做原型验证。
  2. 推理成本:125B 中仅 6B 激活,总容量大而单 token 服务便宜。
  3. 内存压力:51B N-gram 词表常驻系统内存,模型很大一部分无需进入显存。

定价方案

权重可从 Hugging Face 或 ModelScope 免费下载(Qwen 专用许可)。托管路径为 QwenCloud 上的 Qwen3.8-Flash,定价 $0.16/百万输入 token$0.47/百万输出 token;生产级 API 宣布即将上线。作为参考,旗舰级 Qwen3.8-Max 在输入输出上约是其十二倍。

路径 价格
权重(Qwen 许可) 免费下载
Qwen3.8-Flash API 输入 $0.16 / 百万 token
Qwen3.8-Flash API 输出 $0.47 / 百万 token
Qwen3.8-Max(参考) 输入 $2.00 / 输出 $6.00 每百万

优势对比

相比竞品的优势

  1. 对比 Qwen3.7-Plus:约九分之一训练成本但效果更好,编码与办公任务提升最大。
  2. 对比 DeepSeek-V4-Flash:在官方公布的多数基准任务上领先,尽管激活参数更少。
  3. 对比 Qwen3.8-Max:略低于旗舰但成本约为十二分之一,输入输出均有数量级差距。
  4. 对比 Anthropic Claude Opus 4.6:在其公布的排行榜上于多数测试行胜出。

独特卖点

  • N-gram 词嵌入层运行在内存中,这种少见的分置降低了显存压力。
  • 它是 Qwen4 的早期预览,而非现有世代的点升级。

用户评价

社区反响快速而热烈。在 r/opencode 和 r/LocalLLaMA 上,Qwen3.8-Flash-Next 与 GLM-5.3-Flash 同日发布,成为当天主要讨论点。已有 Qwen3.8-27B 用户指出该家族容易"过度思考",这一特质延续下来。在 NVIDIA DGX Spark 论坛上,开发者权衡 6B 激活模型是否能在双 Spark 上跑 FP8 量化版,并质疑那 51B 词表的 dtype 与量化方式。

快速开始

入门指南

  1. 下载:从 Hugging Face 或 ModelScope 拉取权重,例如 huggingface download Qwen/Qwen3.8-Flash-Next
  2. 本地服务:运行 transformers serve Qwen/Qwen3.8-Flash-Next,或用本地运行时加量化版本适配显存。
  3. 配合 Qwen Code:搭配为通义千问优化、面向仓库级软件工程的开源终端编码智能体。
  4. 走托管:调用 QwenCloud 上的 Qwen3.8-Flash API,兼容 OpenAI 与 Anthropic 风格规范。

集成

  • Hugging Face 与 ModelScope:权重、微调(LLaMA-Factory)、服务。
  • 阿里云百炼 API,兼容 OpenAI 与 Anthropic 风格规范。
  • Qwen Code,开源终端编码智能体。

常见问题

Qwen3.8-Flash-Next 是 MoE 模型吗?

是的。它是多模态 MoE,125B 参数、每 token 激活 6B,外加 51B N-gram 词嵌入层。

它就是 Qwen4 吗?

不是。它是 Qwen4 的早期架构预告。完整的 Qwen4 家族将基于此设计构建,但本次发布是实验性的前身。

上下文窗口是多少?

原生 262,144 token,可用 YaRN 扩展到约一百万 token。

许可是什么?

权重采用 Qwen 专用许可(非 Apache 2.0),可从 Hugging Face 与 ModelScope 下载。生产级 Qwen3.8-Flash API 属托管服务。

替代方案

  • Qwen3.8-27B:面向本地部署与小批量推理的稠密 Apache 2.0 型号。
  • GLM-5.3-Flash:同为 8 月 26 日发布的成本效率模型,320B 总参 / 18B 激活,MIT。
  • DeepSeek V4 Flash:成本敏感智能体负载的强劲开源选择。

使用技巧

  1. 提前规划词表内存:51B N-gram 参数主要在内存中,内存规划不同于常规 MoE;部署前确认 dtype 与量化。
  2. 留意"预览"属性:这是架构发布,先在自有任务上基准验证再用于生产。
  3. 匹配硬件:6B 激活模型在词表卸载后,双 Spark 或中等显存配置下就能跑得很快。

总结

Qwen3.8-Flash-Next 是阿里对如何构建 Qwen4 的公开预演:极稀疏激活、常驻内存的 N-gram 词表,以及在编码与办公上优于上一代、训练成本却约九分之一的方案。对于想要一款便宜、当下世代的开源 MoE、同时又想瞥见未来走向的开发者,它是值得研究的发布。建议从 Qwen 官方博客GitHub 仓库 的技术报告入手。

评论

还没有评论。成为第一个评论的人!