Qwen3.8-27B 是阿里巴巴为旗舰模型 Qwen3.8-2.4T-A95B(MoE)推出的开源稠密配套版本,2026 年 8 月 5 日以 Apache 2.0 协议上架 Hugging Face。2.4T 旗舰冲击的是前沿榜单,而这款 27B 稠密模型服务的是实践者:一个能在自有硬件上运行、微调并交付的当代通用模型。它同时理解文本与图像,也兑现了阿里在 Qwen3.8-Max 之外提供稠密开源权重版本的承诺。
模型规格
| 规格 | Qwen3.8-27B |
|---|---|
| 架构 | 稠密(每个 token 激活全部参数) |
| 总参数 | 约 27.8B(safetensors 合计 27,781,427,952) |
| 输入模态 | 文本、图像 |
| 输出模态 | 文本 |
| 上下文长度 | 尚未披露 |
| 协议 | Apache 2.0 |
| API 接入 | QwenCloud(模型 ID 见控制台) |
核心功能
- Apache 2.0 开源权重:可下载、自托管、微调,允许商用。
- 稠密架构:每个 token 激活全部网络,行为与单 token 延迟可预测,无需调试专家路由。
- 多模态输入:image-text-to-text,单模型覆盖截图分析、图表阅读与文档理解。
- 为本地硬件而生:量化后可上单张高端 GPU,体量足以胜任严肃的推理与编码任务。
- 社区热度高:初步模型卡发布数日即在 r/LocalLLaMA 收获约 499 个赞,Hugging Face 超过 7,856 个喜欢。
适用场景
谁应该使用这个工具?
- 本地 LLM 玩家:想要宽松协议的当代稠密模型。
- 微调团队:需要完整权重、无使用限制。
- 隐私敏感部署:提示词与图像不能离开自有硬件的场景。
- 智能体构建者:以可预测成本运行小批量推理。
解决的问题
- 高频任务的 API 成本:自托管消除小批量高频调用的按 token 计费。
- 协议摩擦:Apache 2.0 可直接用于商业产品,无需谈判。
- MoE 的复杂性:稠密权重单 token 成本均匀,容量规划更简单。
定价方案
权重在 Hugging Face 免费提供(Apache 2.0),只需自付算力。也可通过 QwenCloud API 调用,但截至发布,阿里尚未公布该稠密模型的独立 token 定价。在官方价格卡落地前,可参考 Qwen3.8-Max 的国际版定价(输入 $2.00 / 输出 $6.00 每百万 token)作为上限参照。
优势对比
相比竞品的优势:
- 相比自家 MoE 旗舰:一台机器即可承载,无需集群。
- 相比受限协议:Apache 2.0 几乎是开源权重中最宽松的协议。
- 相比老款 27B 级模型:Qwen3.8 这一代训练成果,原生支持图像输入。
独特卖点:
- Qwen3.8 代首个稠密开源权重模型。
- 同时提供 QwenCloud API,适合偏好托管推理的团队。
用户评价
发布初期社区反响强劲:r/LocalLLaMA 公告帖"A preliminary Qwen3.8-27B model card is live!"收获约 499 赞,Hugging Face 仓库数日内突破 7,800 喜欢。实践者也提醒:稠密意味着重。社区测试指出,在 RTX 3060 这类低显存单卡上做 offload 时,稠密 27B 可能比小激活参数的 MoE(如 Qwen3.6 35B-A3B)慢得多,请如实评估显存。
快速开始
入门指南
- 下载:从 Hugging Face 的 Qwen 官方组织拉取权重。
- 部署:用熟悉的本地运行时加载,显存紧张选量化版本。
- 验证:模型卡标注为 preliminary,上生产前先在自己的任务上评测。
- 或走托管:通过 QwenCloud API 调用。
集成
- Hugging Face 生态工具(下载与微调)。
- QwenCloud API 托管推理。
常见问题
Qwen3.8-27B 是 MoE 吗?
不是。它是稠密模型,每个 token 激活全部约 278 亿参数。
单张消费级显卡能跑吗?
高显存卡加量化可以。RTX 3060(12GB)这类卡,社区反馈 offload 慢到不可用,低显存更适合小激活参数的 MoE。
上下文长度是多少?
尚未披露,模型卡仍是 preliminary 状态。
可以商用吗?
可以,Apache 2.0 协议允许。
替代方案
- Qwen3.8-2.4T-A95B:追求前沿能力的 MoE 旗舰。
- DeepSeek V4 Flash:成本敏感部署的另一强开源选择。
使用技巧
- 单卡选量化:全精度稠密 27B 对显存要求很高。
- 盯紧模型卡:标注 preliminary,规格仍在补齐。
- 按硬件选架构:低显存场景下,小激活参数 MoE 会快过任何稠密 27B。
总结
Qwen3.8-27B 补全了 Qwen3.8 发布的另一半故事:MoE 旗舰拿榜单,这款稠密 27B 则以 Apache 2.0 给社区一个可本地部署、可微调、可小批量推理的主力模型。如果你的硬件装得下它,这就是在自己的机器上运行当代 Qwen 最实际的方式。
评论
还没有评论。成为第一个评论的人!
相关工具
Qwen3.8-2.4T-A95B
qwen.ai
阿里巴巴旗舰 2.4T MoE 模型,激活参数 95B,1M token 上下文,原生多模态输入,PaperBench 与 OSWorld 全球登顶,史上最大的 Qwen 模型。
DFlash 2
inco.ai/blog/dflash2
Inco AI 的 Apache 2.0 块扩散推测解码草稿模型。2026-08-18 发布,覆盖 Qwen3.8-27B 与 Muse Glimmer。
Gemma 4 26B A4B
ai.google.dev/gemma
Google DeepMind 开源权重模型,25.2B 总参数 MoE 架构每 token 仅激活 3.8B,256K 上下文,支持图文多模态输入,Apache 2.0 商用友好协议。
相关洞察
Windows 上把 OpenCode Go 接进 Codex,别再新开一套工具
ChatGPT 登录的 Codex 桌面版,默认选择器几乎只露出 GPT。Windows 上只开 OpenCode Go 这一家,就能把已经付过钱的 Grok、GLM、Kimi、DeepSeek、MiniMax 接回同一个 picker。密钥不出本机,原生 GPT 也不动。
锁死 Codex 的不是模型,是选择器
你已经为 OpenCode Go、Grok、Z.ai 付过钱了,但 Codex 的 picker 默认只露出 GPT。社区项目 codex-router 做的不是再教一遍安装步骤,而是把已经买过的模型能力接回选择器:密钥不出本机,原生 GPT 也不动。
7 款 AI 编程 CLI 用了半年,我悟出一个道理:模型再强,干活也要有监督
Claude Code、Codex、opencode、pi、omp、DeepSeek Harness 各有性格。半年深度使用后我总结出一套分工矩阵:pi 做最省事的 CR、omp 审复杂 PR、DeepSeek Harness 配 V4 Flash 高频低成本审查、Claude Code 与 Qoder 写代码。模型再强,干活也要有监督,而且最好是独立第三方。