news 2026/9/15 17:10:19

GLM-5拿下Vending Bench 2开源第一:一年模拟经营的4432美元

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
GLM-5拿下Vending Bench 2开源第一:一年模拟经营的4432美元

GLM-5拿下Vending Bench 2开源第一:一年模拟经营的4432美元

【免费下载链接】GLM-5GLM-5: From Vibe Coding to Agentic Engineering项目地址: https://gitcode.com/GitHub_Trending/gl/GLM-5

GLM-5 是面向复杂系统工程与长周期智能体任务(Agentic Engineering)的开源大模型。在 Andon Labs 推出的Vending Bench 2基准测试中,GLM-5 需要像一个真实经营者那样,连续 365 天运营一家模拟自动售货机商店——进货、定价、应对突发状况,最终以$4,432的账户余额拿下开源模型第一名,逼近闭源旗舰 Claude Opus 4.5。

Vending Bench 2 是什么:让 AI "开一年店"的长期运营考试

与传统基准考"一次答对"不同,Vending Bench 2 考的是"长期经营":模型在长达一年的模拟周期内运营一家自动售货机业务,每个经营日都要做出真实决策——该不该补货、商品定价多少、现金如何周转。最终的账户余额,就是模型"经营能力"的分数。

从上图的余额曲线可以直观看到:

  • 📈曲线会波动——这正说明模型在真实"经营":每一次进货、调价、应急处理都会让账户起伏,而非平稳爬升;
  • 📊GLM-5(粉色 Z 标识曲线)后半程加速明显,在第 150 天后拉开与其他开源模型的差距,最终登顶开源第一;
  • 相比之下,Kimi K2.5-moonshot 在第 100 天后基本进入平台期,MiniMax-M2 全年几乎原地踏步。

这正是长周期任务的分水岭:能否在几百个决策日里持续做出有效判断,而不是"开头猛冲、后劲全无"。

4432美元成绩单:GLM-5 如何拿下开源第一

结合 GLM 官方技术报告中的数据,各模型最终账户余额对比如下:

排名模型最终余额类型
1Gemini 3 Pro$5,478闭源
2Claude Opus 4.5$4,967闭源
3GLM-5$4,432开源🏆
4GPT-5.2 (xhigh)$3,591闭源
5GLM-4.7$2,377开源

几个值得关注的点:

  • 🥇开源第一:GLM-5 是榜单上最强的开放权重模型,与闭源旗舰 Claude Opus 4.5 的差距仅约 $500;
  • 📈较上一代翻倍:相比 GLM-4.7($2,377),GLM-5 的一年经营收入几乎翻倍,验证了"Vibe Coding 到 Agentic Engineering"的代际跃迁;
  • 🧠不止会"管店":同一张评测图中,GLM-5 在 SWE-bench Multilingual(73.3)、Terminal-Bench 2.0(56.2)、τ²-Bench(89.7)等智能体与编码基准上均取得开源最佳水平,说明长期经营能力并非孤立现象。

更多成绩解读可参考官方中文文档:README_zh.md。

为什么 GLM-5 能管好"一年生意"?

对新手来说,不必纠结架构细节,记住三个关键词即可理解 GLM-5 的优势来源:

  1. 更大更省的 MoE 底座:参数规模从 GLM-4.5 的 355B(激活 32B)扩展到744B(激活 40B),预训练数据增至 28.5T tokens——总容量更大,但每次推理只激活 40B 参数,兼顾能力与部署成本。
  2. DSA 稀疏注意力:集成 DeepSeek Sparse Attention,在保持长上下文能力的同时大幅压低部署开销。一年经营意味着海量历史决策信息,长上下文能力是"记得住过去、算得出未来"的基础。
  3. slime 异步强化学习基础设施:长周期任务的能力来自强化学习训练。GLM 团队自研的 slime 异步 RL 框架提升了训练吞吐,让模型在"经营模拟"这类超长链条任务上反复迭代、持续变强。

技术细节可查阅官方英文文档:README.md。

快速上手:获取与部署 GLM-5

想要亲自验证"一年 4432 美元"的经营能力,可以按以下路径入手:

  • 下载权重:GLM-5 与 GLM-5-FP8 的完整权重已开放在 Hugging Face 与 ModelScope 双平台(BF16 / FP8 两种精度),见 README.md 的下载表格;
  • 获取仓库git clone https://gitcode.com/GitHub_Trending/gl/GLM-5,运行依赖见 requirements.txt;
  • 本地部署:官方已适配 vLLM、SGLang、KTransformers、Unsloth、Transformers 等主流推理框架,社区贡献的 skills/glm-master-skill/SKILL.md 还整理了 GLM 生态技能与安装入口;
  • 国产化部署:昇腾 Ascend NPU 平台支持 vLLM-Ascend、xLLM、SGLang 等框架部署 GLM-5 系列,优化要点可参考 example/ascend.md。

💡小建议:744B 参数模型对硬件要求较高,个人开发者可优先使用 FP8 版本,或直接通过 API 平台体验,再逐步尝试本地部署。

对普通用户意味着什么?

Vending Bench 2 的意义在于:它把"AI 聪不聪明"从一次性的问答考试,变成了一年 365 天的经营实践。GLM-5 拿下开源第一说明——

  • 🏪 开源模型已经能承担"长期自主决策"类任务:持续规划、资源管理、应对不确定性;
  • 🛠️ "Agentic Engineering"不再是口号:从写一段代码(Vibe Coding),到独立跑完一个长周期项目,这是能力质变;
  • 📌 对开发者和团队的启示:交给 AI 的任务越长、越开放,越需要选对底座模型。GLM-5 是目前开源世界里"耐跑"的旗舰选择。

下一次当你需要 AI 连续数小时处理长任务时,不妨拿 GLM-5 的这张"成绩单"作为选型参考。

【免费下载链接】GLM-5GLM-5: From Vibe Coding to Agentic Engineering项目地址: https://gitcode.com/GitHub_Trending/gl/GLM-5

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/15 17:08:47

MATLAB GUI实现的模板匹配车牌识别方法详解

简介:基于 MATLAB GUI 的车牌识别项目资料包,采用模板匹配算法完成车牌识别任务,完整覆盖车牌定位、字符分割、汉字识别、数字与字母识别等关键环节,适合正在做课程设计、毕业设计或希望入门图像识别的 MATLAB 学习者参照使用。整…

作者头像 李华
网站建设 2026/9/15 17:08:43

CNN手写数字识别APP开发:从模型训练到zip打包部署全流程

简介:基于CNN的手写数字识别完整项目,面向深度学习初学者、课程设计或毕业设计人员,涵盖从模型训练到桌面应用部署的全流程。压缩包共30个文件,主要包含Python源码、预编译pyc、训练好的模型参数pkl、界面截图png、Windows可执行e…

作者头像 李华
网站建设 2026/9/15 17:07:02

域名申请的流程速查手册:避坑指南

域名申请的流程速查手册:避坑指南 网站被黑挂马不知道怎么办?别慌,这往往是基础不牢的连锁反应。很多站长在初期为了省事,没搞清 域名申请的流程 ,导致解析混乱、备案缺失,给黑客留了后门。今天这份 速查手册…

作者头像 李华
网站建设 2026/9/15 17:05:52

UQLab概率分布转换指南:非高斯变量到标准高斯空间的完整实现

从事不确定度量化这块工作的朋友,对UQLab应该不陌生。这个MATLAB工具箱把输入建模、抽样、灵敏度分析、可靠性分析串成了一条流水线,上手确实快。但真到了自己搭模型的时候,很多人会卡在一个看似基础的问题上:手里明明是一堆威布尔…

作者头像 李华