Qwen3.8 系列有几个型号:27B、2.4T-A95B 和 Max 各自去哪儿拿
搜「Qwen3.8」的时候很容易被绕晕:有人说它是 27B 的开源模型,有人说它是要调 API 的旗舰模型,还有人提到一个 2.4T 的版本。
这三种说法都对,因为Qwen3.8 是一个系列名,下面挂着好几个差别很大的型号。它们的架构类别不同、分发渠道不同、能不能自己部署也不同。
这篇把它们对照清楚。
这篇的依据
事实来自四个公开来源,采集时间统一为 2026-08-24:
- Hugging Face 模型 API
- OpenRouter 的
/api/v1/models接口 - 阿里云百炼「模型大全」文档页
- Ollama 官方模型库与 ModelScope 模型 API
我们没有下载任何权重、没有调用任何 API。 本文只做渠道与元数据的对照,不涉及任何能力或效果的比较——那需要实测,我们没做。
三个型号的总览
| 型号 | 架构类别 | 有 HF 权重仓 | 能自己部署 |
|---|---|---|---|
| Qwen3.8-27B | 稠密(dense) | 是 | 是 |
| Qwen3.8-2.4T-A95B | 稀疏专家(MoE) | 是 | 理论上是 |
| Qwen3.8-Max | 未公开 | 否 | 否 |
下面逐个说。
一个能一眼分辨开源与否的字段
先给个实用技巧。在 OpenRouter 的 /api/v1/models 返回里,每个模型条目可能带一个 hugging_face_id 字段:
qwen/qwen3.8-27b→"hugging_face_id": "Qwen/Qwen3.8-27B"qwen/qwen3.8-2.4t-a95b→"hugging_face_id": "Qwen/Qwen3.8-2.4T-A95B"qwen/qwen3.8-max→ 没有这个字段
有 hugging_face_id 就意味着有对应的公开权重仓,没有就意味着只能通过 API 用。 这比去搜「XX 模型开源吗」可靠得多,一个 curl 就能确认。
Qwen3.8-27B:稠密开源版
这是本站拆得最细的一个型号。核心元数据:
| 项 | 值 |
|---|---|
| HF 仓库 | Qwen/Qwen3.8-27B |
| architectures | Qwen3_5ForConditionalGeneration |
| license | apache-2.0 |
| 上下文 | max_position_embeddings 为 262144 |
架构上它是稠密模型——64 层里每一层的前馈网络都是普通 MLP,不走稀疏专家。这一点在 vLLM 的实现里有明确证据:解码层构造时按 model_type 分支,27B 的 qwen3_5_text 走的是稠密 MLP 那一支(详见 64 层在 vLLM 里怎么分流)。
注意「稠密」只是说 MLP 部分不稀疏,注意力层本身仍然是混合的:48 层线性注意力加 16 层全注意力(见 64 层怎么排)。这两件事经常被混为一谈。
获取渠道最多的也是它:
| 渠道 | 标识 |
|---|---|
| Hugging Face | Qwen/Qwen3.8-27B |
| ModelScope | Qwen/Qwen3.8-27B,中文名「千问3.8-27B」 |
| Ollama | ollama pull qwen3.8 |
| OpenRouter | qwen/qwen3.8-27b |
许可是 Apache-2.0(细节见 许可实读),这是它能被这么多渠道分发的前提。
Qwen3.8-2.4T-A95B:稀疏开源版
OpenRouter 对它的描述原文是:open-weight sparse mixture-of-experts model,并且明确写了它是 Qwen3.8 Max 的开放权重变体(the open-weight variant of Qwen3.8 Max)。
这句话信息量很大:它和闭源旗舰是同源的,不是一个独立的小模型。
架构上它走的是 MoE 路线。这在 vLLM 的注册表里能对上——registry.py 里除了 27B 用的 Qwen3_5ForConditionalGeneration,还有一条平行的 Qwen3_5MoeForConditionalGeneration,指向同一个 qwen3_5 模块里的另一组类。实现代码里也确实有一套完整的 MoE 分支:Qwen3NextSparseMoeBlock、专家数量管理、专家并行相关的元数据更新方法。
「理论上能自己部署」是什么意思? 权重是公开的、框架是支持的,这两条都成立。但 2.4T 这个量级的总参数量意味着硬件门槛完全不是 27B 那个级别——具体需要什么配置本文不做估算,因为那取决于量化方案、专家卸载策略和并行方式,不是一个能拍出来的数字。
对绝大多数人来说,这个型号的现实意义是:如果你需要旗舰级别的能力又要求权重自主可控,它是那条路。 否则直接调 Max 的 API 更省事。
Qwen3.8-Max:闭源旗舰
OpenRouter 上的条目是 qwen/qwen3.8-max,canonical_slug 带 -20260803 日期后缀,描述里说它是 Qwen3.8 系列的旗舰,是 Qwen3.8 Max Preview 的正式版继任者。
没有 hugging_face_id,也就没有公开权重仓。 用它只有一条路:调 API。
在阿里云百炼上,截至 2026-08-24 采集,「选择模型」页的文本生成和图像视频理解两栏里都出现了 qwen3.8-max。本站也写过千问办公接入 Qwen3.8-Max 的官方公告。
从框架注册表看这个系列的完整结构
分发渠道说的是「能不能拿到」,框架注册表说的是「框架认得几种形态」。后者更能看出这个系列的设计结构。
在 vLLM 的 registry.py 里搜 Qwen3_5,会得到六条注册项,分成三组:
| 组 | 注册的类名 | 指向模块 |
|---|---|---|
| 纯文本 | Qwen3_5ForCausalLM / Qwen3_5MoeForCausalLM | qwen3_5 |
| 多模态 | Qwen3_5ForConditionalGeneration / Qwen3_5MoeForConditionalGeneration | qwen3_5 |
| 多步预测 | Qwen3_5MTP / Qwen3_5MoeMTP | qwen3_5_mtp |
这张表透露了三层信息。
第一层,稠密与稀疏是全程平行的。 每一组都有一个带 Moe 的孪生版本,三组六个,一个不缺。这说明 dense 和 MoE 不是两个独立模型,而是同一套架构的两种前馈网络配置——共用同一个模块文件,只在 MLP 那一层分叉。
第二层,纯文本和多模态是两个入口。 ForCausalLM 是纯文本,ForConditionalGeneration 是带视觉塔的多模态。Qwen3.8-27B 的 config.json 里 architectures 写的是后者,所以它默认按多模态加载。
这里有个实际用途:vLLM 的实现里专门处理了一种情况——社区把多模态版本剥成纯文本版本时,权重名会残留 model.language_model. 前缀,代码里有一条映射规则负责剥掉它。这说明纯文本变体在实践中确实有人在做。
第三层,MTP 是独立注册的。 它不在 qwen3_5 模块里,而是单独的 qwen3_5_mtp。这与主模型加载时直接丢弃 mtp. 前缀权重的行为是一致的——MTP 那一层 从框架视角看就是另一个模型,不是主模型的一部分。
所以完整的矩阵是「稠密/稀疏」×「纯文本/多模态」再加一组独立的 MTP。 你在渠道上看到的三个型号名,只是这个矩阵里被实际发布出来的那几个点。
一个反直觉的分发格局
把上面的信息交叉起来,会得到一个有点意外的结论:
在阿里云百炼上,你能调到闭源的 Max,但调不到开源的 27B。
截至 2026-08-24 采集,百炼「选择模型」页里的 qwen3.x 型号有 qwen3.8-max、qwen3.7-plus、qwen3.7-flash、qwen3.5-omni-plus 等,未见 qwen3.8-27b。
这不奇怪,反而挺合理:百炼是官方的商业推理服务,主推自家旗舰;而开源权重的分发本来就该走 HF、ModelScope、Ollama 这些开放渠道,以及 OpenRouter 上那些第三方托管商。两条路服务的是不同需求。
需要说明核实边界:百炼那个页面底部有「模型广场」入口,标注可查看所有千问、三方、领域及历史版本模型。本文核实的是「选择模型」这个精选页,不是完整清单,也不能据此断言 27B 永远不会上架。要确认当下状态,以百炼模型广场的实时页面为准。
怎么选
按需求倒推,路径其实很清楚:
想在自己机器上跑、硬件是消费级或单卡服务器 → Qwen3.8-27B,从 Ollama 或 HF 拿。
想要旗舰能力、不想管基础设施 → Qwen3.8-Max,走百炼或 OpenRouter。
想要旗舰级能力但权重必须自主可控 → Qwen3.8-2.4T-A95B,先想清楚硬件。
想快速试一下 27B 不想装环境 → OpenRouter 的 qwen/qwen3.8-27b,但记得先查 endpoints(见 八家供应商给的参数并不一样)。
小结
- Qwen3.8 是系列名,至少对应三个型号
- 27B 稠密开源、2.4T-A95B 稀疏开源且与 Max 同源、Max 闭源
hugging_face_id字段在不在,是判断开不开源最快的办法- 开源权重走 HF / ModelScope / Ollama / OpenRouter,百炼上架的是闭源旗舰
- 以上全部为 2026-08-24 采集时的渠道状态,这类信息变化很快,用之前请自行复核
想接着了解具体某个渠道的用法,可以看 ModelScope 上的千问3.8-27B,或回到 Qwen3.8-27B 专题。