GLM-5拿下Vending Bench 2开源第一:一年模拟经营的4432美元
【免费下载链接】GLM-5GLM-5: From Vibe Coding to Agentic Engineering项目地址: https://gitcode.com/GitHub_Trending/gl/GLM-5
GLM-5 是面向复杂系统工程与长周期智能体任务(Agentic Engineering)的开源大模型。在 Andon Labs 推出的Vending Bench 2基准测试中,GLM-5 需要像一个真实经营者那样,连续 365 天运营一家模拟自动售货机商店——进货、定价、应对突发状况,最终以$4,432的账户余额拿下开源模型第一名,逼近闭源旗舰 Claude Opus 4.5。
Vending Bench 2 是什么:让 AI "开一年店"的长期运营考试
与传统基准考"一次答对"不同,Vending Bench 2 考的是"长期经营":模型在长达一年的模拟周期内运营一家自动售货机业务,每个经营日都要做出真实决策——该不该补货、商品定价多少、现金如何周转。最终的账户余额,就是模型"经营能力"的分数。
从上图的余额曲线可以直观看到:
- 📈曲线会波动——这正说明模型在真实"经营":每一次进货、调价、应急处理都会让账户起伏,而非平稳爬升;
- 📊GLM-5(粉色 Z 标识曲线)后半程加速明显,在第 150 天后拉开与其他开源模型的差距,最终登顶开源第一;
- 相比之下,Kimi K2.5-moonshot 在第 100 天后基本进入平台期,MiniMax-M2 全年几乎原地踏步。
这正是长周期任务的分水岭:能否在几百个决策日里持续做出有效判断,而不是"开头猛冲、后劲全无"。
4432美元成绩单:GLM-5 如何拿下开源第一
结合 GLM 官方技术报告中的数据,各模型最终账户余额对比如下:
| 排名 | 模型 | 最终余额 | 类型 |
|---|---|---|---|
| 1 | Gemini 3 Pro | $5,478 | 闭源 |
| 2 | Claude Opus 4.5 | $4,967 | 闭源 |
| 3 | GLM-5 | $4,432 | 开源🏆 |
| 4 | GPT-5.2 (xhigh) | $3,591 | 闭源 |
| 5 | GLM-4.7 | $2,377 | 开源 |
几个值得关注的点:
- 🥇开源第一:GLM-5 是榜单上最强的开放权重模型,与闭源旗舰 Claude Opus 4.5 的差距仅约 $500;
- 📈较上一代翻倍:相比 GLM-4.7($2,377),GLM-5 的一年经营收入几乎翻倍,验证了"Vibe Coding 到 Agentic Engineering"的代际跃迁;
- 🧠不止会"管店":同一张评测图中,GLM-5 在 SWE-bench Multilingual(73.3)、Terminal-Bench 2.0(56.2)、τ²-Bench(89.7)等智能体与编码基准上均取得开源最佳水平,说明长期经营能力并非孤立现象。
更多成绩解读可参考官方中文文档:README_zh.md。
为什么 GLM-5 能管好"一年生意"?
对新手来说,不必纠结架构细节,记住三个关键词即可理解 GLM-5 的优势来源:
- 更大更省的 MoE 底座:参数规模从 GLM-4.5 的 355B(激活 32B)扩展到744B(激活 40B),预训练数据增至 28.5T tokens——总容量更大,但每次推理只激活 40B 参数,兼顾能力与部署成本。
- DSA 稀疏注意力:集成 DeepSeek Sparse Attention,在保持长上下文能力的同时大幅压低部署开销。一年经营意味着海量历史决策信息,长上下文能力是"记得住过去、算得出未来"的基础。
- slime 异步强化学习基础设施:长周期任务的能力来自强化学习训练。GLM 团队自研的 slime 异步 RL 框架提升了训练吞吐,让模型在"经营模拟"这类超长链条任务上反复迭代、持续变强。
技术细节可查阅官方英文文档:README.md。
快速上手:获取与部署 GLM-5
想要亲自验证"一年 4432 美元"的经营能力,可以按以下路径入手:
- 下载权重:GLM-5 与 GLM-5-FP8 的完整权重已开放在 Hugging Face 与 ModelScope 双平台(BF16 / FP8 两种精度),见 README.md 的下载表格;
- 获取仓库:
git clone https://gitcode.com/GitHub_Trending/gl/GLM-5,运行依赖见 requirements.txt; - 本地部署:官方已适配 vLLM、SGLang、KTransformers、Unsloth、Transformers 等主流推理框架,社区贡献的 skills/glm-master-skill/SKILL.md 还整理了 GLM 生态技能与安装入口;
- 国产化部署:昇腾 Ascend NPU 平台支持 vLLM-Ascend、xLLM、SGLang 等框架部署 GLM-5 系列,优化要点可参考 example/ascend.md。
💡小建议:744B 参数模型对硬件要求较高,个人开发者可优先使用 FP8 版本,或直接通过 API 平台体验,再逐步尝试本地部署。
对普通用户意味着什么?
Vending Bench 2 的意义在于:它把"AI 聪不聪明"从一次性的问答考试,变成了一年 365 天的经营实践。GLM-5 拿下开源第一说明——
- 🏪 开源模型已经能承担"长期自主决策"类任务:持续规划、资源管理、应对不确定性;
- 🛠️ "Agentic Engineering"不再是口号:从写一段代码(Vibe Coding),到独立跑完一个长周期项目,这是能力质变;
- 📌 对开发者和团队的启示:交给 AI 的任务越长、越开放,越需要选对底座模型。GLM-5 是目前开源世界里"耐跑"的旗舰选择。
下一次当你需要 AI 连续数小时处理长任务时,不妨拿 GLM-5 的这张"成绩单"作为选型参考。
【免费下载链接】GLM-5GLM-5: From Vibe Coding to Agentic Engineering项目地址: https://gitcode.com/GitHub_Trending/gl/GLM-5
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考