📖标题:QwenGyre: An Elastic Reinforcement Learning Framework for Training xLong-Horizon Agents
🌐来源:arXiv, 2609.33848v1
🛎️文章简介
🔸研究问题:当大语言模型智能体执行耗时数小时、交互数百次的“极长周期”(XLong)任务时,如何解决因执行时间差异巨大导致的GPU闲置,以及因复杂分支路径产生的数据冗余问题?
🔸主要贡献:提出了QWENGYRE框架,通过弹性调度动态分配GPU资源,并利用轨迹处理器去重分支数据,显著提升了长周期智能体强化学习的训练效率和性能。
📝重点思路
🔸弹性调度器(Elastic Scheduler):打破传统将GPU固定划分为推理池和训练池的模式。该调度器能实时监控未完成的推理任务量,在不中断正在运行的智能体执行的前提下,将空闲的GPU动态重新分配给训练任务。它支持流式训练,允许新加入的GPU节点无缝接入正在进行的训练批次,从而最小化等待时间。
🔸轨迹处理器(Trajectory Processor):针对长周期任务中因上下文压缩、子智能体委托产生的非线性分支轨迹,构建共享前缀的“轨迹树”。该模块保留每个模型输出的原始上下文,对超时但仍有部分进展的任务进行评分而非直接丢弃。在生成训练样本时,它根据角色优先级选择有限数量的轨迹,并对共享前缀只计算一次损失,避免数据冗余和权重偏差。
🔸黑盒兼容设计:整个框架无需修改现有的智能体运行环境(Harness),通过代理记录模型调用和工具响应,实现了与底层执行逻辑的解耦,便于应用于各种封闭或快速迭代的智能体系统。
🔎分析总结
🔸训练速度大幅提升:在NL2RepoBench、DeepSWE等基准测试中,QWENGYRE相比传统的异步(Async)方法提速最高达1.78倍,相比 colocate(交替使用)方法提速最高达1.85倍。
��