GLM-5:从氛围编程迈向智能体工程 —— GLM 5 技术报告拆解
沐冰茶
2026年02月22日 19:35

本文是GLM-5 最新发的技术报告 GLM-5: from Vibe Coding to Agentic Engineering 的深度解读,该模型采用 混合专家(MoE)架构,通过集成代理、推理和编程能力,实现了在 长文本处理真实软件工程任务 中的显著突破。技术上,它引入了 异步强化学习训练基础设施,并优化了 多潜变量注意力(MLA) 机制,以极高的效率适配了国产 GPU 生态。实验数据表明,GLM-5 在 LMArenaArtificial Analysis 等多个主流榜单上达到了世界顶尖水平,尤其在端到端代码开发和复杂逻辑推理方面表现卓越。此外,该模型支持 交替思维思维保留 等特性,使其在长程对话和高难度智能体任务中展现出极高的可靠性与实用性。

大家好,欢迎来到关于 GLM-5 的深度解析。今天我们将探讨智谱 AI 与清华大学联合推出的下一代基座模型 GLM-5。它的核心愿景是推动 AI 编程从依赖人类提示的“直觉式编码(Vibe Coding)”正式迈向大模型自主主导的“代理工程(Agentic Engineering)”。值得兴奋的是,这款拥有 7440 亿总参数、支持 200K 长上下文的模型,其权重已经完全开源

过去我们写代码,往往是人写一段 Prompt,AI 生成一段代码,遇到报错还得人来排查,这就是直觉式编码(Vibe Coding)。但现实世界的软件工程远比这复杂。GLM-5 提出了一套全新的解决方案,即融合了代理(Agentic)、推理(Reasoning)和编码(Coding)能力(简称 ARC)的新一代 MoE 架构。在 Agentic Engineering 范式下,模型能够主动接收人类目标,自主进行长程规划、工具调用、代码执行,甚至在出错时自我纠错,最终交付完善的产品

为什么 GLM-5 能支持如此庞大的参数和上下文而不让计算成本失控?秘诀在于引入了 DeepSeek 稀疏注意力机制(DSA)。不同于传统的全注意力机制(高成本),DSA 能够根据 Token 的重要性动态分配计算资源。

技术细节: 这一创新使得 GLM-5 扩展到了 744B 的总参数量,但每次前向传播仅激活 40B 参数,并支持了高达 28.5T Tokens 的训练数据量。更重要的是,它在保持 128K 长上下文精度的同时,将计算成本降低了 1.5 到 2 倍,让超大规模模型在推理密集型任务中真正具备了经济可行性

GLM-5 的卓越性能离不开其精心设计的训练流水线。首先是基础模型阶段,消耗了 27T Tokens,在早期就优先强化了代码与推理能力。其次是中继训练阶段,逐步将上下文窗口扩展至 200K,并注入了大量长文档与复杂的 Agent 数据。

技术细节: 最关键的创新在于后训练(Post-Training)阶段。GLM-5 采用序列化强化学习(RL),依次进行推理 RL、Agentic RL,最后是通用 RL。为了防止模型在学习新技能时遗忘旧知识(能力遗忘),团队采用了在线跨阶段蒸馏(On-Policy Cross-Stage Distillation)技术,让模型在保持敏锐推理能力的同时,成为稳健的通用人才

在监督微调(SFT)阶段,GLM-5 被赋予了三种极为重要的高级思维模式,这让它的行为更像一个深思熟虑的人类工程师:

    1. 交错思考(Interleaved Thinking): 在每次响应和调用工具前都会进行思考,确保每一步行动都经过缜密规划。

    2. 保留思考(Preserved Thinking): 在多轮长对话中,它会自动保留之前的思维链,避免重复推理,这对于长程复杂任务的一致性至关重要。

    3. 轮次级思考(Turn-level Thinking): 支持思维开关的灵活控制,简单任务快速响应省成本,复杂任务则开启深度推理。

技术细节: 最关键的创新在于后训练(Post-Training)阶段。GLM-5 采用序列化强化学习(RL),依次进行推理 RL、Agentic RL,最后是通用 RL。为了防止模型在学习新技能时遗忘旧知识(能力遗忘),团队采用了在线跨阶段蒸馏(On-Policy Cross-Stage Distillation)技术,让模型在保持敏锐推理能力的同时,成为稳健的通用人才

面对耗时极长的 Agent 任务,传统的同步强化学习会导致 GPU 大量闲置等待。为此,GLM-5 基于 slime 框架,构建了全新的异步与解耦 RL 基础设施。

技术细节: 如图所示,推理引擎(Body)负责在环境中持续交互生成轨迹,而训练引擎(Brain)则在后台异步计算梯度并更新权重。为了解决异步带来的数据对齐问题,GLM-5 独创了 TITO(Token-in-Token-out)网关,确保动作与奖励的精确对齐,彻底消除了重新分词(Re-tokenization)带来的误差

GLM-5 不仅是一个代码补全工具,更是真正的软件工程师。在权威的 SWE-bench Verified(解决真实 GitHub Issue)测试中,GLM-5 取得了 77.8% 的极高胜率,超越了 Gemini 3 Pro,直逼闭源王者 Claude Opus 4.5 的 80%。在多语言 SWE-bench 和 Terminal-Bench 2.0 终端环境测试中,它同样稳居开源模型第一梯队,展现了处理端到端软件工程任务的空前能力

真正的智能体需要具备长期的资源管理和决策能力。在 Vending-Bench 2 这项模拟经营自动售货机一整年的测试中,GLM-5 以 $4,432 的最终余额断层领先所有开源模型。对比上一代 GLM-4.7 的 1,034,不仅进步惊人,甚至远超谷歌的Gemini3Pro(1,198),无限逼近 Claude Opus 4.5

在综合智能体现实力的 Artificial Analysis Index 智能指数上,GLM-5 创造了历史,成为首个得分突破 50 分的开源模型(较前代提升了 8 分)。在号称“人类终极考试”的 HLE 测试中(使用工具),它拿下了 50.4 分,超越 Gemini 3 Pro。同时,在真实用户盲测的 LMArena 文本与代码竞技场中,GLM-5 双双位列开源模型第一名

为了验证真实开发体验,我们使用了内部升级的 CC-Bench-V2 全栈评估集。

    ◦ 前端端: 创新性引入 Agent-as-a-Judge,通过真实模拟人类点击和截图来视觉测试,构建成功率高达 98%。

    ◦ 后端端: 涵盖 C++、Go、Rust 等真实项目,要求通过严格的单元测试。

    ◦ 仓库探索: 在包含数万个文件的复杂代码库中,仅凭自然语言语义就能精确定位目标文件,Pass@1 达到 65.6%,这项能力甚至超越了 Claude Opus 4.5

在排版与 UI 生成上,AI 很容易学会“作弊”(Reward Hacking),比如为了不越界直接隐藏超长内容,或者随意添加空白。GLM-5 构建了一个多级奖励系统(Multi-level Reward),从 HTML/CSS 的静态代码有效性(Level 1),到运行时几何渲染的合理性(Level 2),再到最终视觉美学的评分(Level 3)进行全方位优化。优化后生成的卡片美观度大幅提升,在人类评估中以 67.5% 的胜率击败了前代模型

GLM-5 不仅在软件上实现了突破,在硬件生态上也做到了极致。面对国产芯片环境各异的挑战,GLM-5 从第一天起就完成了对华为昇腾、摩尔线程、海光、寒武纪、昆仑芯、沐曦和燧原这七款国产算力平台的全栈深度适配。通过极度量化(W4A8)和高性能融合算子,实现了单节点国产芯片性能比肩国际双卡 GPU 集群的傲人成绩,大幅降低了部署成本

给大家分享一个幕后彩蛋。在发布前,我们以 'Pony Alpha' 的化名在 OpenRouter 社区进行了盲测。令人惊喜的是,社区开发者在不知情的情况下,仅凭模型处理复杂代码、Agent 任务和角色扮演的硬实力,就给予了极高评价。许多人甚至猜测这是 Claude 5 或 GPT-5 的泄露版。这次实验成功超越了品牌偏见,用纯粹的技术实力证明了中国大模型已完全具备世界顶尖水平

总结来看,GLM-5 毫无疑问确立了当前开源界的 SOTA(最先进)地位。无论是考验 Agentic 能力的 Vending-Bench,还是考验代码工程的 SWE-bench,亦或是考验极限推理的 HLE 测试,GLM-5 的数据均全面超越 Gemini 3 Pro,并与目前世界上最强的闭源模型 Claude Opus 4.5 和 GPT-5.2 (xhigh) 互有胜负、分庭抗礼