GLM-5.3 发布:基座不换只炼后训,开源编程能力超越 Claude Opus 4.8

发布时间:2026/8/14 20:46:39
GLM-5.3 发布:基座不换只炼后训,开源编程能力超越 Claude Opus 4.8 发布日期2026-08-14 | 数据来源智谱 AI 官方公告 | 话题GLM-5.3 · 智谱 AI · 开源大模型 · Agent 编程GLM-5.3 于 2026 年 8 月 14 日中午正式发布是智谱 AI GLM-5 系列的最新版本与 GLM-5.2 的核心差异在于技术路线——基座模型参数量约 7430 亿MoE 架构完全未变所有能力提升来自后训练阶段的极致 Scaling任务环境规模扩展数十倍、环境类型更丰富、后训练时长显著延长整体性能较 GLM-5.2 提升约 50%在 Z.ai Code Bench 高难度档以 31.4%耗 ~5 万 token超越 Claude Opus 4.8 的 29.5%耗 ~12 万 tokenDeepSWE v1.1 从 46.2 跃升至 66.9Terminal-Bench 3.0 从 4.6 跃升至 28.3开源第一网络安全能力新增披露CyberGym 以 84.5% 排第一Mythos 5 为 83.8%实际在 269 个项目中发现 2436 个漏洞模型权重将在发布两周内开源宽松许可证API 同步上线具体定价尚未公布。这次更新了什么不换基座只炼后训GLM-5.3 的技术决策与 DeepSeek V4 Pro 0813 版本思路高度一致基座参数量保持不变通过后训练阶段的系统性投入拉升能力上限。智谱官方表述「基座模型没变但通过极致的后训练 Scaling 大大提高了模型的智能上界。」后训练三个维度的扩展长程任务环境规模扩大数十倍覆盖更长时间跨度的真实工程任务环境类型更丰富从代码调试延伸到安全漏洞发现、系统工程等场景后训练时长显著增加部分训练任务相当于经验丰富工程师数天的工作量这种技术路线的意义在于保持开源权重的持续性——基座不变社区基于前代版本的微调和二次开发工作可以无缝延用底层结构。编程能力高难度超 Opus 4.8最高难度仍落后 Fable 5GLM-5.3 的官方编程基准以 Z.ai Code Bench智谱自研内部评测为核心分两个难度档难度档GLM-5.2GLM-5.3对比模型最高难度完成率23.4%~9.6 万 token34.5%~7.5 万 tokenFable 539.5%高难度完成率未披露31.4%~5 万 tokenClaude Opus 4.829.5%~12 万 token高难度档GLM-5.3 以 31.4% 超越 Claude Opus 4.8 的 29.5%同时 token 消耗仅约 5 万是 Opus 4.8 的 40%——以更少计算量完成更多任务。最高难度档34.5% vs Fable 5 的 39.5%差距约 5 个百分点仍未追上顶尖闭源模型。第三方独立基准数据vs GLM-5.2测试集GLM-5.2GLM-5.3涨幅DeepSWE v1.146.266.920.7ppTerminal-Bench 3.04.628.323.7pp开源第一Agents’ Last Exam23.828.54.7ppGDPval-AA v2—1769—Terminal-Bench 3.0 的 28.3 分是开源模型当前最高分DeepSWE v1.1 的 66.9 已超越同期 DeepSeek V4 Pro 的 62.7官方数据。网络安全能力CyberGym 全球第一GLM-5.3 首次在正式发布中突出网络安全评测数据并披露了实际漏洞发现成果基准测试测试集GLM-5.2GLM-5.3Mythos 5GPT-5.6 SolCyberGym77.2%84.5%✓83.8%83.6%ExploitBench24.4%54.4%78.0%✓73.5%ExploitGym2h 任务29105181✓—ExploitGym6h 任务39130247✓—CyberGym网络安全知识与防御排第一ExploitBench 和 ExploitGym漏洞发现与利用仍落后于 Mythos 5但提升幅度显著ExploitBench 翻倍以上。实际应用成果联合国内安全团队在 269 个真实开源项目中发现2436 个漏洞其中中高危漏洞1097 个部分漏洞存留时间约 40 年已建立智谱安全披露账本公开记录这是目前国内开源大模型中首次在正式发布场合大规模披露实际漏洞发现数据。Token 效率完成相同任务耗 5 万 vs 12 万Token 效率是 GLM-5.3 的重要差异化指标场景模型完成率平均 token 消耗Code Bench 高难度GLM-5.331.4%~5 万Code Bench 高难度Claude Opus 4.829.5%~12 万完成率更高的同时token 消耗约为对比模型的 40%。对于按 token 计费的 API 用量来说这直接影响实际调用成本——即使 GLM-5.3 未来定价与 Opus 4.8 相当实际单次任务成本也会因 token 效率差异而不同。开源与 API 计划项目状态API“很快上线”截至 2026-08-14 具体时间未定模型权重开源两周内完成安全评估后开源许可证宽松许可证具体类型待确认GLM Coding Plan8 月 14 日 13:00 全员额度重置GLM-5.2 此前采用 MIT 许可证GLM-5.3 预计延续宽松许可模式。参考GLM-5.2 API 定价GLM-5.3 定价待官方公布类型GLM-5.2 参考价输入约 ¥1.4/M tokens输出约 ¥4.4/M tokensGLM-5.3 正式 API 定价以智谱 AI 开放平台bigmodel.cn官方公告为准。竞品格局DeepSeek 涨价窗口下的差异化策略GLM-5.3 的发布时机在竞争格局上有其意义DeepSeek V4 Pro 于同一天8 月 13 日正式发布官方同步预告近期大幅涨价GLM-5.3 在 DeepSeek 涨价窗口期内上线且延续开源策略在国内主流大模型中形成差异化定位。同期主要模型数据参考模型DeepSWE v1.1Terminal-Bench是否开源GLM-5.366.928.3开源第一两周内DeepSeek V4 Pro62.7—否Gemini 3.7 Flash—85.8否Fable 5——否参考档DeepSWE v1.1 上GLM-5.3 的 66.9 已超过 DeepSeek V4 Pro 的 62.7但与闭源旗舰Fable 5 等仍有差距。常见问题QGLM-5.3 和 GLM-5.2 的模型 ID 是否不同智谱 API 历史上每个版本均有独立模型 ID如glm-5、glm-5.2。GLM-5.3 的具体 API 模型 ID 截至发布时尚未公布预计随 API 上线一同披露以 bigmodel.cn 开放文档为准。Q两周内开源为什么需要等待官方说明开源前需完成安全评估与模型加固这是针对安全能力漏洞发现/利用的特殊预防措施——GLM-5.3 在 ExploitBench 上大幅提升开放权重前需确保不被用于恶意漏洞利用场景。QGLM-5.3 和 DeepSeek V4 Pro 同日发布怎么选定位不同GLM-5.3 开源两周内权重可私有化部署DeepSeek V4 Pro 闭源 API 调用。编程 Agent 场景GLM-5.3 DeepSWE 66.9 略高于 V4 Pro 的 62.7长文本输出V4 Pro 最大输出 384KGLM-5.2 为 131KGLM-5.3 待确认。预算敏感团队或需要本地部署的场景GLM-5.3 开源路线更灵活。QZ.ai Code Bench 是公开测试集吗Z.ai Code Bench 是智谱自研内部评测集非公开数据集结果无法独立复现验证。第三方独立基准数据DeepSWE、Terminal-Bench来自公开评测框架可作为更客观的参照。Q调用 GLM-5.3 API 同时也想接入 DeepSeek、Kimi 等多款模型怎么管理多款模型同时维护多套 API Key 和端点会带来运维成本。通过多模型聚合 MaaS 平台如七牛云 Token Planqiniu.com/ai/plan可以统一端点管理多款国产主流大模型模型切换只改model字段不需要为每家分别维护鉴权配置。小结GLM-5.3 延续了开源第一的战略定位用后训练 Scaling 而非架构升级实现了阶段性超越高难度编程完成率超过 Claude Opus 4.8同时 token 消耗仅约 40%CyberGym 安全评测排名全球第一DeepSWE 66.9 领先同期 DeepSeek V4 Pro最高难度距 Fable 5 还有约 5 个百分点的差距。两周内开源的计划叠加 DeepSeek 涨价背景为需要开源模型的团队提供了节点选择窗口。本文信息截至 2026 年 8 月 14 日API 定价与模型 ID 以智谱 AI 开放平台bigmodel.cn正式公告为准。延伸阅读智谱 AI 开放平台GLM-5 系列 API 接入https://bigmodel.cnGLM-5 系列官方文档https://docs.bigmodel.cn/cn/guide/models/text/glm-5GLM-5.2 开源地址GitHubhttps://github.com/zai-org/七牛云 Token Plan含 GLM 系列多模型统一接入https://qiniu.com/ai/plan