
GLM-5拿下Vending Bench 2开源第一一年模拟经营的4432美元【免费下载链接】GLM-5GLM-5: From Vibe Coding to Agentic Engineering项目地址: https://gitcode.com/GitHub_Trending/gl/GLM-5GLM-5 是面向复杂系统工程与长周期智能体任务Agentic Engineering的开源大模型。在 Andon Labs 推出的Vending Bench 2基准测试中GLM-5 需要像一个真实经营者那样连续 365 天运营一家模拟自动售货机商店——进货、定价、应对突发状况最终以$4,432的账户余额拿下开源模型第一名逼近闭源旗舰 Claude Opus 4.5。Vending Bench 2 是什么让 AI 开一年店的长期运营考试与传统基准考一次答对不同Vending Bench 2 考的是长期经营模型在长达一年的模拟周期内运营一家自动售货机业务每个经营日都要做出真实决策——该不该补货、商品定价多少、现金如何周转。最终的账户余额就是模型经营能力的分数。从上图的余额曲线可以直观看到曲线会波动——这正说明模型在真实经营每一次进货、调价、应急处理都会让账户起伏而非平稳爬升GLM-5粉色 Z 标识曲线后半程加速明显在第 150 天后拉开与其他开源模型的差距最终登顶开源第一相比之下Kimi K2.5-moonshot 在第 100 天后基本进入平台期MiniMax-M2 全年几乎原地踏步。这正是长周期任务的分水岭能否在几百个决策日里持续做出有效判断而不是开头猛冲、后劲全无。4432美元成绩单GLM-5 如何拿下开源第一结合 GLM 官方技术报告中的数据各模型最终账户余额对比如下排名模型最终余额类型1Gemini 3 Pro$5,478闭源2Claude Opus 4.5$4,967闭源3GLM-5$4,432开源4GPT-5.2 (xhigh)$3,591闭源5GLM-4.7$2,377开源几个值得关注的点开源第一GLM-5 是榜单上最强的开放权重模型与闭源旗舰 Claude Opus 4.5 的差距仅约 $500较上一代翻倍相比 GLM-4.7$2,377GLM-5 的一年经营收入几乎翻倍验证了Vibe Coding 到 Agentic Engineering的代际跃迁不止会管店同一张评测图中GLM-5 在 SWE-bench Multilingual73.3、Terminal-Bench 2.056.2、τ²-Bench89.7等智能体与编码基准上均取得开源最佳水平说明长期经营能力并非孤立现象。更多成绩解读可参考官方中文文档README_zh.md。为什么 GLM-5 能管好一年生意对新手来说不必纠结架构细节记住三个关键词即可理解 GLM-5 的优势来源更大更省的 MoE 底座参数规模从 GLM-4.5 的 355B激活 32B扩展到744B激活 40B预训练数据增至 28.5T tokens——总容量更大但每次推理只激活 40B 参数兼顾能力与部署成本。DSA 稀疏注意力集成 DeepSeek Sparse Attention在保持长上下文能力的同时大幅压低部署开销。一年经营意味着海量历史决策信息长上下文能力是记得住过去、算得出未来的基础。slime 异步强化学习基础设施长周期任务的能力来自强化学习训练。GLM 团队自研的 slime 异步 RL 框架提升了训练吞吐让模型在经营模拟这类超长链条任务上反复迭代、持续变强。技术细节可查阅官方英文文档README.md。快速上手获取与部署 GLM-5想要亲自验证一年 4432 美元的经营能力可以按以下路径入手下载权重GLM-5 与 GLM-5-FP8 的完整权重已开放在 Hugging Face 与 ModelScope 双平台BF16 / FP8 两种精度见 README.md 的下载表格获取仓库git clone https://gitcode.com/GitHub_Trending/gl/GLM-5运行依赖见 requirements.txt本地部署官方已适配 vLLM、SGLang、KTransformers、Unsloth、Transformers 等主流推理框架社区贡献的 skills/glm-master-skill/SKILL.md 还整理了 GLM 生态技能与安装入口国产化部署昇腾 Ascend NPU 平台支持 vLLM-Ascend、xLLM、SGLang 等框架部署 GLM-5 系列优化要点可参考 example/ascend.md。小建议744B 参数模型对硬件要求较高个人开发者可优先使用 FP8 版本或直接通过 API 平台体验再逐步尝试本地部署。对普通用户意味着什么Vending Bench 2 的意义在于它把AI 聪不聪明从一次性的问答考试变成了一年 365 天的经营实践。GLM-5 拿下开源第一说明—— 开源模型已经能承担长期自主决策类任务持续规划、资源管理、应对不确定性️ Agentic Engineering不再是口号从写一段代码Vibe Coding到独立跑完一个长周期项目这是能力质变 对开发者和团队的启示交给 AI 的任务越长、越开放越需要选对底座模型。GLM-5 是目前开源世界里耐跑的旗舰选择。下一次当你需要 AI 连续数小时处理长任务时不妨拿 GLM-5 的这张成绩单作为选型参考。【免费下载链接】GLM-5GLM-5: From Vibe Coding to Agentic Engineering项目地址: https://gitcode.com/GitHub_Trending/gl/GLM-5创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考