智谱 AI 在其开放平台(BigModel)上线 GLM-5.3-Flash,这是 GLM-5 系列首个原生多模态模型:总计 320B 参数、每个 token 激活 18B,上下文 1M、最大输出 128K,支持视频、图像、文本与文件输入。官方称其在 Artificial Analysis 综合智能指数(AA)取得 57 分,超越 GLM-5.2,与 Claude Opus 4.8 持平;而定价仅为 Opus 4.8 的 1/40(限时折扣价为 GLM-5.3 的 1/20),主打”极致低成本”。
架构:稀疏 + 线性注意力的极致低成本
GLM-5.3-Flash 是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型:线性注意力通过递归机制捕获局部依赖,稀疏注意力用轻量级索引器召回全局上下文。为控制 1M 上下文下的时延与内存,官方引入 IndexPool,通过加权池化把索引器的 4 个缓存向量压缩为 1 个。
相比 GLM-5.3,GLM-5.3-Flash 的注意力计算量与 KV 缓存大小分别降低 3.01 倍与 4.44 倍;与 DeepSeek-V4-Flash、Kimi-K3 等基线相比,其注意力计算量在所有模型中最低,KV 缓存仍略高于后两者(官方列为后续优化方向)。此外,模型还采用流形约束超连接(mHC)进一步提升 scaling 能力。
原生多模态:从视觉 Coding 到办公成品
视觉能力原生融入 Coding 循环:模型能主动观察界面、渲染结果与交互反馈,并据此持续改进,在代码、浏览器与图形界面之间协同完成任务。官方给出一个 Blender 案例:在无外部素材的情况下,模型自主运行 16 小时搭建了一套约 400 平方米的专业厨房场景。
超出 Coding 之外,GLM-5.3-Flash 可交付 PPTX、PDF、DOCX、XLSX 等 Office 成品,通过视觉理解检查并优化自身输出;金融、法律等专业工作流(研究溯源、报告生成、合同审查等)也做了针对性优化。根据自研 Z.ai Code Bench 的体感评测,其编程表现与 Claude Opus 4.8 相当。
可用性与国产芯片落地
GLM-5.3-Flash 已全量上线 GLM Coding Plan,额度为 GLM-5.3 的 3 倍,采用基于积分的配额系统,非高峰时段(含周末全天)调用仅消耗标准积分的 50%。API 模型名为 glm-5.3-flash,参数与 GLM-5.3 一致,官方建议 temperature: 1、top_p: 0.95、reasoning_effort: max,思考模式仅支持 enabled、不可关闭。
值得关注的是其国产芯片部署:智谱首次在大规模流量中用国产加速芯片集群提供该模型服务,基于自研高带宽互联与 SGLang 定制推理引擎,结合 ReplaySSM、W8A8、INT8/FP8/BF16 混合缓存量化与 EPD(Encode–Prefill–Decode)分离式架构支撑 1M 上下文。官方称端到端服务性能为同硬件初始基线的 3 倍,硬件效率与单 token 成本已接近主流英伟达 GPU 水平。
核心总结
- 规格:320B 总参 / 18B 激活,1M 上下文、128K 输出,多模态输入(视频/图像/文本/文件)
- 架构:稀疏 + 线性注意力混合与 IndexPool,相比 GLM-5.3 注意力计算量 -3.01×、KV 缓存 -4.44×
- 性能:AA 综合智能指数 57 分,看齐 Claude Opus 4.8;定价约为其 1/40(约为 GLM-5.3 的 1/10)
- 落地:GLM Coding Plan 额度 3 倍;国产芯片集群规模化服务,端到端性能提升 3 倍
原文:GLM-5.3-Flash - 智谱 AI 开放文档(智谱 AI 开放文档,2026-08)



