智谱 AI 宣布推出 GLM 5.3。这款 7430 亿参数的开放权重模型,核心升级主要来自后训练,而不是扩大基础模型规模;公司称其在 Z.ai Code Bench 上较 GLM 5.2 提升约 50%。 GLM 5.3 在 Terminal Bench 3.0 上得分 28.3,在 DeepSWE 1.1 上得分 66.9;相比 GLM 5.2 的 4.6 和 46.2,长流程软件工程任务进步明显。
研究答案

Create a landscape editorial hero image for this Studio Global article: What did Chinese AI startup Zhipu AI announce about its next-generation open-source foundation model GLM-5.3, including its 743-billion-para. Article summary: Zhipu AI announced GLM-5.3, a 743-billion-parameter open-weights foundation model positioned as a major capability upgrade achieved primarily through post-training rather than a larger base model. The company says it sub. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
智谱 AI 发布了 GLM-5.3,一款拥有 7430 亿参数的开放权重基础模型。与侧重对话问答不同,这一代产品把重点放在编程、软件工程和智能体任务上:模型不仅要生成代码,还要能够调用工具、操作软件,并在较少人工干预的情况下推进多步骤工作流。智谱表示,GLM-5.3 与 GLM-5.2 使用相同的参数规模,主要通过后训练实现能力提升。
从目前披露的数据看,GLM-5.3 最值得关注的并不是参数量,而是它在长流程编程测试中的跃升。智谱称,该模型在自有 Z.ai Code Bench 上的编程表现较 GLM-5.2 提升约 50%;在 Terminal-Bench 3.0 上得分 28.3,在 DeepSWE 1.1 上得分 66.9。不过,这些数字目前仍属于厂商及相关报告披露的结果,是否能稳定复现,还需要更多独立测试和真实开发场景验证。
GLM-5.3 的参数规模为 7430 亿,与 GLM-5.2 保持一致。智谱将这次发布描述为一次主要依靠后训练完成的能力升级,而非重新扩大基础模型。
对模型开发而言,这一思路具有一定意义:提升性能并不只有增加参数这一条路径。后训练可以进一步塑造模型的任务规划、工具使用、指令遵循和错误恢复能力,使其更适合处理复杂、连续的工作流程。现有资料支持智谱关于“同一规模、侧重后训练”的说法,但尚不足以独立判断具体哪一种后训练技术贡献了多少提升。
智谱称,GLM-5.3 在 Z.ai Code Bench 上较 GLM-5.2 提升约 50%。在需要模型持续处理软件任务的测试中,升级幅度更加突出:
Terminal-Bench 3.0 的意义在于,它不只是评估模型能否给出一段静态代码,还涉及终端和 Shell 环境中的软件操作。DeepSWE 1.1 则更接近完整的软件工程任务,因此更能反映模型处理多步骤开发流程的能力。
智谱表示,GLM-5.3 在发布时的 Terminal-Bench 3.0 得分为开放模型中最高,并领先于月之暗面 Kimi K3。 但这仍是公司披露的排名。比较不同模型时,还需要关注评测版本、提示词、工具配置以及各模型实际运行条件是否一致。
GLM-5.3 的产品方向,是让 AI 编程从回答单个问题进一步发展为执行完整任务。按照智谱的定位,模型可以检查代码仓库、运行命令、分析报错、修改文件,并围绕目标持续推进,而不是只给出一段供开发者手动复制的代码。
这正是“编程智能体”与传统代码助手的区别:前者需要在连续行动中理解环境、使用工具并根据反馈调整策略。Terminal-Bench 和 DeepSWE 的成绩提升与这一方向相符,但单一基准分数并不能证明模型在陌生的生产环境中一定可靠,也不能替代对权限控制、错误恢复和人工审批机制的测试。
智谱还称,GLM-5.3 的编程和智能体能力正在接近 Claude Fable 5,并在真实编程任务上具备优于其他中国模型的实用表现。 这些属于智谱的产品定位和对比性表述,不应直接视为独立排行榜上的最终结论。
智谱还将 GLM-5.3 的推理和工具调用能力延伸到网络安全场景,包括发现软件漏洞。公开披露的评测信息显示,该模型在 CyberGym 的漏洞发现与验证任务中取得了 84.5% 的结果。
这类能力具有明显的双重用途。更强的代码理解和软件操作能力,可能帮助安全团队识别缺陷;但如果缺乏严格限制,同样可能放大自动化系统执行不安全操作的风险。因此,现有证据最多支持将“漏洞发现”描述为 GLM-5.3 的一项已报告能力,而不能据此断言它已经是可靠的安全审计工具,或能够安全地自主进行漏洞利用。
GLM-5.3 的真正看点,不只是 7430 亿参数这个庞大的数字,而是智谱把后训练和长流程任务评测放在了发布叙事的中心。对于准备评估该模型的开发者,以下问题比单看榜单排名更重要:
GLM-5.3 是一款拥有 7430 亿参数的模型。智谱 AI 称,它在不扩大 GLM-5.2 基础模型规模的情况下,主要通过后训练提升了编程、软件工程和智能体能力。
从 Terminal-Bench 3.0 的 4.6 提升到 28.3、以及 DeepSWE 1.1 的 46.2 提升到 66.9,模型的主打方向已经十分清楚:处理更长、更复杂的软件任务,而不仅是生成孤立的代码片段。
这组结果足以让开发者和开源模型社区进一步关注 GLM-5.3,尤其是在编程智能体和工具调用工作流方面。但从亮眼的基准成绩到稳定、可控的自主软件操作,中间仍有距离。最终表现还需要独立评测、真实项目测试,以及对安全和部署条件的进一步确认。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
智谱 AI 宣布推出 GLM 5.3。这款 7430 亿参数的开放权重模型,核心升级主要来自后训练,而不是扩大基础模型规模;公司称其在 Z.ai Code Bench 上较 GLM 5.2 提升约 50%。
智谱 AI 宣布推出 GLM 5.3。这款 7430 亿参数的开放权重模型,核心升级主要来自后训练,而不是扩大基础模型规模;公司称其在 Z.ai Code Bench 上较 GLM 5.2 提升约 50%。 GLM 5.3 在 Terminal Bench 3.0 上得分 28.3,在 DeepSWE 1.1 上得分 66.9;相比 GLM 5.2 的 4.6 和 46.2,长流程软件工程任务进步明显。
智谱将 GLM 5.3 定位为面向工具调用、软件操作和多步骤开发流程的 AI 智能体,并称其具备识别潜在漏洞的能力,但相关结果仍主要是厂商披露,尚待独立验证。