Qwen3.8-27B logo

Qwen3.8-27B

打开

阿里巴巴开源的 27B 稠密模型,Qwen3.8-Max 的配套稠密版本,Apache 2.0 协议,支持图文多模态输入,面向本地部署与小批量推理。

分享:

Qwen3.8-27B 是阿里巴巴为旗舰模型 Qwen3.8-2.4T-A95B(MoE)推出的开源稠密配套版本,2026 年 8 月 5 日以 Apache 2.0 协议上架 Hugging Face。2.4T 旗舰冲击的是前沿榜单,而这款 27B 稠密模型服务的是实践者:一个能在自有硬件上运行、微调并交付的当代通用模型。它同时理解文本与图像,也兑现了阿里在 Qwen3.8-Max 之外提供稠密开源权重版本的承诺。

模型规格

规格 Qwen3.8-27B
架构 稠密(每个 token 激活全部参数)
总参数 约 27.8B(safetensors 合计 27,781,427,952)
输入模态 文本、图像
输出模态 文本
上下文长度 尚未披露
协议 Apache 2.0
API 接入 QwenCloud(模型 ID 见控制台)

核心功能

  • Apache 2.0 开源权重:可下载、自托管、微调,允许商用。
  • 稠密架构:每个 token 激活全部网络,行为与单 token 延迟可预测,无需调试专家路由。
  • 多模态输入:image-text-to-text,单模型覆盖截图分析、图表阅读与文档理解。
  • 为本地硬件而生:量化后可上单张高端 GPU,体量足以胜任严肃的推理与编码任务。
  • 社区热度高:初步模型卡发布数日即在 r/LocalLLaMA 收获约 499 个赞,Hugging Face 超过 7,856 个喜欢。

适用场景

谁应该使用这个工具?

  • 本地 LLM 玩家:想要宽松协议的当代稠密模型。
  • 微调团队:需要完整权重、无使用限制。
  • 隐私敏感部署:提示词与图像不能离开自有硬件的场景。
  • 智能体构建者:以可预测成本运行小批量推理。

解决的问题

  1. 高频任务的 API 成本:自托管消除小批量高频调用的按 token 计费。
  2. 协议摩擦:Apache 2.0 可直接用于商业产品,无需谈判。
  3. MoE 的复杂性:稠密权重单 token 成本均匀,容量规划更简单。

定价方案

权重在 Hugging Face 免费提供(Apache 2.0),只需自付算力。也可通过 QwenCloud API 调用,但截至发布,阿里尚未公布该稠密模型的独立 token 定价。在官方价格卡落地前,可参考 Qwen3.8-Max 的国际版定价(输入 $2.00 / 输出 $6.00 每百万 token)作为上限参照。

优势对比

相比竞品的优势

  1. 相比自家 MoE 旗舰:一台机器即可承载,无需集群。
  2. 相比受限协议:Apache 2.0 几乎是开源权重中最宽松的协议。
  3. 相比老款 27B 级模型:Qwen3.8 这一代训练成果,原生支持图像输入。

独特卖点

  • Qwen3.8 代首个稠密开源权重模型。
  • 同时提供 QwenCloud API,适合偏好托管推理的团队。

用户评价

发布初期社区反响强劲:r/LocalLLaMA 公告帖"A preliminary Qwen3.8-27B model card is live!"收获约 499 赞,Hugging Face 仓库数日内突破 7,800 喜欢。实践者也提醒:稠密意味着重。社区测试指出,在 RTX 3060 这类低显存单卡上做 offload 时,稠密 27B 可能比小激活参数的 MoE(如 Qwen3.6 35B-A3B)慢得多,请如实评估显存。

快速开始

入门指南

  1. 下载:从 Hugging Face 的 Qwen 官方组织拉取权重。
  2. 部署:用熟悉的本地运行时加载,显存紧张选量化版本。
  3. 验证:模型卡标注为 preliminary,上生产前先在自己的任务上评测。
  4. 或走托管:通过 QwenCloud API 调用。

集成

  • Hugging Face 生态工具(下载与微调)。
  • QwenCloud API 托管推理。

常见问题

Qwen3.8-27B 是 MoE 吗?

不是。它是稠密模型,每个 token 激活全部约 278 亿参数。

单张消费级显卡能跑吗?

高显存卡加量化可以。RTX 3060(12GB)这类卡,社区反馈 offload 慢到不可用,低显存更适合小激活参数的 MoE。

上下文长度是多少?

尚未披露,模型卡仍是 preliminary 状态。

可以商用吗?

可以,Apache 2.0 协议允许。

替代方案

使用技巧

  1. 单卡选量化:全精度稠密 27B 对显存要求很高。
  2. 盯紧模型卡:标注 preliminary,规格仍在补齐。
  3. 按硬件选架构:低显存场景下,小激活参数 MoE 会快过任何稠密 27B。

总结

Qwen3.8-27B 补全了 Qwen3.8 发布的另一半故事:MoE 旗舰拿榜单,这款稠密 27B 则以 Apache 2.0 给社区一个可本地部署、可微调、可小批量推理的主力模型。如果你的硬件装得下它,这就是在自己的机器上运行当代 Qwen 最实际的方式。

评论

还没有评论。成为第一个评论的人!