Qwen 团队(阿里)发布开源多模态旗舰模型 Qwen3.8-27B。这是一款稠密(dense)、原生视觉语言模型:在约 27B 参数(BF16 约 28B)的规模上,原生上下文 262K token、可扩展至 1M,同时理解文本、图像与最长小时级的视频。模型采用 Gated DeltaNet 线性注意力 与全注意力混合的架构,在超长上下文和 Agent 场景下兼顾效率与能力,并以 Apache 2.0 开源协议发布。

混合架构:线性注意力与全注意力分工

Qwen3.8-27B 采用非均匀的混合层结构,每个超层包含 4 个中间块,构成 16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN)) 的模式:

  • Gated DeltaNet:类 Mamba 的线性注意力,前 3 块使用,负责高效处理大部分 token——48 个线性注意力头(V)、16 个(QK)、注意力头维度 128;
  • Gated Attention:以 RingAttention 方式实现的全注意力,每 4 块出现一次,负责全局信息交换与长程依赖——24 个 Q 头、4 个 KV 头、注意力头维度 256、RoPE 维度 64;
  • 中间 FFN 维度 17,408,采用 MTP(多 token 预测)进行多步训练。

通过 3:1 的线性注意力与全注意力配比,模型在保持强大长程建模能力的同时,显著降低超长上下文下的计算与 KV 缓存开销。

能力矩阵:多模态 + Agent

模型覆盖文本(对话、代码、Agent)、图像理解与视频理解(最长小时级)。思考模式默认开启,可按请求关闭;reasoning_effort 提供 xhigh(默认)/medium/low 三档,并默认开启 preserve_thinking 以跨轮次保留推理上下文。

推荐的采样参数因模式而异:思考模式建议 temperature=1.0, top_p=0.95, top_k=20;Instruct 模式建议 temperature=0.7, top_p=0.80, presence_penalty=1.5

基准表现(相对 Qwen3.6-27B)

基准Qwen3.8-27BQwen3.6-27B
SWE-bench Pro61.753.5
Terminal Bench 2.173.063.4
LiveCodeBench v690.383.9
GPQA Diamond89.287.8
HLE30.824.0
JobBench33.421.8
IFBench79.569.1

多模态 / Agent 方面(视觉语言)提升尤为明显:

基准Qwen3.8-27BQwen3.6-27B
OSWorld-Verified84.363.9
WebArena-Verified64.848.8
AndroidWorld81.970.3
OmniDocBench 1.591.189.4
RealWorldQA85.984.1
MathVision(含 CI)94.6
BabyVision(含 CI)85.6

从 Agent 界面基准(OSWorld、WebArena、AndroidWorld)到文档理解(OmniDocBench、RealWorldQA),Qwen3.8-27B 相对上代均有显著进步,展现出更强的多模态感知与工具调用能力。

生态与可用性

  • 官方提供 4 个微调模型28 个量化版本(覆盖 llama.cpp、LM Studio、Jan、Ollama 等)与 2 个推理 Space;
  • 支持 vLLM、SGLang、TokenSpeed、Hugging Face Transformers 与 Docker Model Runner 等推理框架;
  • 模型权重可在 ModelScope 与 Hugging Face 获取,Qwen Cloud 托管服务即将上线。

来源:Qwen3.8-27B - ModelScopeQwen3.8-27B - Hugging Face

注:以上技术规格与基准数据均来自 Qwen 官方模型卡;实际表现与部署环境相关,请以官方文档为准。