智谱 AI 在其开放平台(BigModel)上发布了新一代旗舰基座模型 GLM-5.3。官方将其定位为”旗舰基座模型”,主打”以极致后训练 Scaling 实现能力跃迁”——在与 GLM-5.2 完全相同的基座上,依托数十倍规模的长程任务环境、更丰富的环境类型与超长周期的后训练,编程体感较前代提升 50%,并在 Terminal Bench 3.0 等公开基准中位列开源模型第一。

规格与能力

GLM-5.3 为纯文本模型,上下文窗口 1M Token、最大输出 128K Token。能力矩阵覆盖流式输出、Function Calling、上下文缓存、结构化输出(JSON),并支持通过 MCP 灵活调用外部工具与数据源。思考功能始终开启、不可关闭,提供 lowhighmax 三档思考等级(默认 max);官方建议 Coding 等复杂任务使用 max 档位,若迁移时应用传了 thinking.type: "disabled",需改为 enabled 并将 reasoning_effort 设为 low,否则请求会失败。

编程与 Agent 能力再突破

官方称,GLM-5.3 在多项主流基准中位居前列的开源模型,编程与智能体能力比肩 Claude Fable 5,实际编程体感领先其他国产模型:

基准GLM-5.2GLM-5.3
Terminal-Bench 3.04.628.3
DeepSWE v1.146.266.9
Agents’ Last Exam23.828.5
GDPval-AA v2(44 种职业)1769 分

在覆盖 44 种职业的 GDPval-AA v2 中取得 1769 分,展现出从编程向专业任务执行延伸的能力。智谱内部基准 Z.ai Code Bench(~7.5 万 Token/任务)上,Max 档位准确率从 5.2 的 23.4% 提升至 34.5%,High 档位约用一半 Token 即达 31.4%,超过 Claude Opus 4.8 的 29.5%(但距 Claude Fable 5 的 Max 档 39.5% 仍有差距)。模型更强调”不只做出 Demo,更能交付复杂项目”:能在数万行代码、上百个文件及多个相互依赖的系统之间持续推进,面对前端开发、Bug 修复、代码重构等真实任务,可在极少人工干预下自主开发、反复验证,把项目推进到可交付状态。

真实专家工作流中完成后训练 Scaling

与其前代只在孤立的编程题上训练不同,GLM-5.3 的训练扩展到了从发现问题、分析方案到实施、验证、交付的完整流程。部分训练任务相当于资深工程师连续数天的工作量,模型需要使用真实的计算集群、存储系统、内部文档与代码库完成任务。官方强调,在相近 Token 预算下,GLM-5.3 在完成质量、执行速度与使用成本之间取得了更好的平衡。

涌现更强网络安全能力

随着长程任务环境不断扩展,GLM-5.3 在白盒代码审查、漏洞发现与验证等安全任务中涌现出超出预期的能力:

  • CyberGym(白盒漏洞识别):84.5%,略高于 Mythos 5 的 83.8% 与 GPT-5.6 Sol 的 83.6%;
  • ExploitBench(漏洞利用推理):由 24.4% 提升至 54.4%;Mythos 5 为 78.0%、GPT-5.6 Sol 为 76.5%;
  • ExploitGym(时间归一化的漏洞利用任务):2 小时完成 105 项、6 小时完成 130 项,远超 5.2 的 29 与 39 项。

规律上,基准越深入漏洞利用链路,GLM-5.3 相对 5.2 的提升越大、与闭源前沿模型的差距也越大——官方称之为”当前差距最大的方向,恰恰也是能力增长最快的方向”。

此外,智谱自 GLM-5.2 起与多家中国安全团队合作,在 269 个真实项目中发现 2,436 个漏洞,其中 1,097 个中高危漏洞,覆盖内核、操作系统、浏览器引擎、基础设施、Web 应用与网络协议等,最长被隐藏的漏洞潜伏约 40 年;相关进展记录在 Z.ai 安全漏洞披露台账中。

上线情况

目前 GLM Coding Plan 已全量上线 GLM-5.3,采用积分配额制,非高峰时段(含周末全天)消耗标准积分的 50%;模型 API 将于近期上线,届时将同时开放完整调用示例(OpenAI Chat Completion / OpenAI Response / Anthropic Message 三种协议)与模型体验中心。具体定价尚未公布。

来源:GLM-5.3 - 智谱AI开放文档

注:以上数据均来自智谱官方 GLM-5.3 模型文档页;API、定价与 Coding Plan 规则以上线时公布为准。