Qwen 团队(阿里)发布开源多模态旗舰模型 Qwen3.8-27B。这是一款稠密(dense)、原生视觉语言模型:在约 27B 参数(BF16 约 28B)的规模上,原生上下文 262K token、可扩展至 1M,同时理解文本、图像与最长小时级的视频。模型采用 Gated DeltaNet 线性注意力 与全注意力混合的架构,在超长上下文和 Agent 场景下兼顾效率与能力,并以 Apache 2.0 开源协议发布。
混合架构:线性注意力与全注意力分工
Qwen3.8-27B 采用非均匀的混合层结构,每个超层包含 4 个中间块,构成 16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN)) 的模式:
- Gated DeltaNet:类 Mamba 的线性注意力,前 3 块使用,负责高效处理大部分 token——48 个线性注意力头(V)、16 个(QK)、注意力头维度 128;
- Gated Attention:以 RingAttention 方式实现的全注意力,每 4 块出现一次,负责全局信息交换与长程依赖——24 个 Q 头、4 个 KV 头、注意力头维度 256、RoPE 维度 64;
- 中间 FFN 维度 17,408,采用 MTP(多 token 预测)进行多步训练。
通过 3:1 的线性注意力与全注意力配比,模型在保持强大长程建模能力的同时,显著降低超长上下文下的计算与 KV 缓存开销。
能力矩阵:多模态 + Agent
模型覆盖文本(对话、代码、Agent)、图像理解与视频理解(最长小时级)。思考模式默认开启,可按请求关闭;reasoning_effort 提供 xhigh(默认)/medium/low 三档,并默认开启 preserve_thinking 以跨轮次保留推理上下文。
推荐的采样参数因模式而异:思考模式建议 temperature=1.0, top_p=0.95, top_k=20;Instruct 模式建议 temperature=0.7, top_p=0.80, presence_penalty=1.5。
基准表现(相对 Qwen3.6-27B)
| 基准 | Qwen3.8-27B | Qwen3.6-27B |
|---|---|---|
| SWE-bench Pro | 61.7 | 53.5 |
| Terminal Bench 2.1 | 73.0 | 63.4 |
| LiveCodeBench v6 | 90.3 | 83.9 |
| GPQA Diamond | 89.2 | 87.8 |
| HLE | 30.8 | 24.0 |
| JobBench | 33.4 | 21.8 |
| IFBench | 79.5 | 69.1 |
多模态 / Agent 方面(视觉语言)提升尤为明显:
| 基准 | Qwen3.8-27B | Qwen3.6-27B |
|---|---|---|
| OSWorld-Verified | 84.3 | 63.9 |
| WebArena-Verified | 64.8 | 48.8 |
| AndroidWorld | 81.9 | 70.3 |
| OmniDocBench 1.5 | 91.1 | 89.4 |
| RealWorldQA | 85.9 | 84.1 |
| MathVision(含 CI) | 94.6 | — |
| BabyVision(含 CI) | 85.6 | — |
从 Agent 界面基准(OSWorld、WebArena、AndroidWorld)到文档理解(OmniDocBench、RealWorldQA),Qwen3.8-27B 相对上代均有显著进步,展现出更强的多模态感知与工具调用能力。
生态与可用性
- 官方提供 4 个微调模型、28 个量化版本(覆盖 llama.cpp、LM Studio、Jan、Ollama 等)与 2 个推理 Space;
- 支持 vLLM、SGLang、TokenSpeed、Hugging Face Transformers 与 Docker Model Runner 等推理框架;
- 模型权重可在 ModelScope 与 Hugging Face 获取,Qwen Cloud 托管服务即将上线。
来源:Qwen3.8-27B - ModelScope|Qwen3.8-27B - Hugging Face
注:以上技术规格与基准数据均来自 Qwen 官方模型卡;实际表现与部署环境相关,请以官方文档为准。



