最近大模型圈子里最值得逐字读完的技术报告,我琢磨着应该是这篇:一个开源大模型站出来的姿态,不是继续喊参数规模、预训练数据量,而是把全部重心压在“强化学习规模化”和“自我改进”上。你见过很多模型说自己“能推理”,但少有模型会在报告里告诉你:它是怎么通过一轮又一轮的强化学习,让模型自己给自己出题、自己批改、自己重做的。MiMo-V2.6的这份技术报告,主线就是这么一件事。
这篇解析还挺适合两类人读:一类是打算跟进开源大模型路线、想搞清楚接下来半年开源社区会往哪走的人;另一类是已经跑过SFT、正准备接触RLHF/RLVR,想从一个真实模型的技术报告里搞明白RL训练链路到底该怎么搭的人。我自己在读到报告里关于“self-improvement”和“RL at scale”的章节时,最大的感受不是某个具体指标多高,而是整个训练哲学变了——从“喂更多数据靠模型悟”变成“让模型在反馈循环里自己进化”。这个转变,比某一个benchmark数字的刷新更值得掰开揉碎讲清楚。
1. 这份技术报告的分水岭:从“堆预训练数据”转向“用RL做能力自迭代”
1.1 MiMo-V2.6到底在解决什么问题
如果只用一个词概括MiMo-V2.6技术报告的核心,我会选“反馈密度”。过去开源大模型的常规路线是:收集海量文本,做预训练,然后做有监督微调(SFT),再来一轮RLHF对齐。这套流程的瓶颈很直接——它默认“人类偏好”和“正确答案”都是静态的,标注一批就完了,模型没有持续变好的闭环。但MiMo-V2.6明显换了一个解题框架:把强化学习(RL)的训练时长和覆盖范围推到前所未有的规模,让模型在生成、评估、再生成的循环里不断修正自己的策略。
用大白话讲,传统训练像是“老师出题,学生背答案,考完就结束”;MiMo-V2.6的做法更像是“老师出题,学生做题,机器批改,错的题当场回炉,然后老师再出一批类似但又不完全一样的题”。这个循环一旦规模化,模型就不是在“背题”,而是在“学会怎么解决一类问题”。
1.2 为什么“开源第一”这个定位在这个时间点含金量不一样
很多人看到“第一开源大模型”这种描述会下意识怀疑是营销话术,但这次我更愿意从另一个角度理解:它说的是“在开源阵营里,第一个把RL规模化做到这个深度”的模型。开源社区过去几年在预训练和SFT上确实追得很快,但一到RL阶段就普遍保守——训练成本高、稳定性难控、Reward Hacking频发,大部分团队只敢做轻量PPO或者干脆跳过。MiMo-V2.6等于把这个“禁区”撕开了一个口子:它的技术报告直接披露了RL训练规模化之后的收益曲线、失败模式和稳定化手段。
这件事对社区的意义大于模型本身的跑分。因为闭源头部模型之所以能持续变强,很大程度上靠的就是RL数据飞轮。开源模型如果一直停留在“SFT之后直接发布”,那么和闭源模型的差距会越来越大。MiMo-V2.6尝试把这条飞轮公开化,等于告诉大家:RL规模化的关键路径是可以复盘的,不是黑魔法。
2. 自我改进机制拆解:模型怎么做到自己出题、批改、重做
2.1 奖励信号的设计:结果奖励负责“对错”,过程奖励负责“思路”
技术报告里最值得细读的部分,是奖励模型(Reward Model)的设计。MiMo-V2.6没有只依赖单一的结果奖励——也就是“最终答案对不对”——而是引入了过程奖励(Process Reward)来追踪中间推理步骤的质量。
我解释一下为什么这一步是质变。结果奖励的问题是稀疏:一道复杂数学题,模型推理了二十步,最后一步符号写错,结果奖励直接判零分。但前十九步的推理思路可能完全正确,模型收不到任何正向梯度,它就不知道怎么修正。过程奖励的思路是把这道题拆成若干推理片段,每一步单独打分,模型能精确知道“哪一步走偏了”。这种细粒度反馈对自我改进尤其重要,因为模型在下一轮迭代时可以直接瞄准错误的中间步骤做修正,而不是在茫茫参数空间里瞎撞。
技术报告里有一句话让我印象很深,大意是:单纯的结果奖励会把模型推向“猜答案”,过程奖励才逼着模型“讲道理”。这跟培养新人团队是一个逻辑——你只看KPI,下属就会想办法刷KPI;你还看执行过程,他们才会真正优化做事方法。
2.2 迭代式RL数据流:每一轮更新是怎么发生的
MiMo-V2.6自我改进的落地形态,是一套迭代式的RL数据生产线。简化成公式大概是:
策略模型生成样本 → 规则校验器+奖励模型打分 → 筛选高质量轨迹加入训练集 → 策略模型继续更新 → 再用新模型生成下一批样本。
这套流程里最容易被忽视的是“采样策略”的变化。不是每一轮迭代都用完全相同的提示词集,而是会自动根据模型当前的能力边界去调整提示词的难度分布。模型在简单题上已经稳定拿分了,就多采样中等偏难题;模型在某类题型上频繁出错,就针对性加大这类提示词的采样权重。听起来很智能,实际实现时就是给提示词池子里的每条样本维护一个“当前正确率”的统计值,正确率高的样本降权,正确率低的样本升权。
这个设计的高明之处在于,它让训练数据始终处在“最近发展区”——既不是简单到模型全对,也不是难到模型全错,而是保持在模型跳一跳能够到的区间。这比静态数据集对于自我改进的推动效率高得多。
2.3 规则校验器与模型裁判:两道防线防“走捷径”
强化学习里有个绕不开的坑,叫Reward Hacking——模型找到了一个让奖励分数虚高但实际能力没有提升的捷径。MiMo-V2.6做了两层防护:第一层是可判定的规则校验器,针对数学、代码这类答案能明确判别的领域,直接用确定性规则给分,不依赖模型判断;第二层是模型裁判——一个独立训练、不参与策略更新的评审模型,专门负责主观题的评分。
这两层设计在我看是必须的。规则校验器防的是那种“答案乱编但格式好看”的作弊,模型裁判防的则是“顺着奖励模型的偏好过拟合”的问题。一个有意思的细节是,技术报告指出:裁判模型与策略模型必须来自不同训练分布,如果用同源模型做裁判,自我改进会在几轮迭代后出现明显的偏置积累,模型会越来越会“哄”裁判而非真正变强。这个洞察,任何想复现自我改进路线的人都应该抄进笔记。
3. 强化学习规模化:算力、数据和收敛控制的三角平衡
3.1 训练、采样、评测之间的算力分配
规模化的第一问题不是算法,而是预算怎么分。MiMo-V2.6技术报告虽然没有公开确切的训练账单,但从其披露的训练框架和迭代轮次能反推出一个大致逻辑:RL训练的总算力被切成了三块——策略更新、经验采样、评测筛选,三者不是平均用力。
我在实际跑过类似RL迭代之后,一个比较深刻的体感是:采样端的算力需求往往被低估。因为每轮迭代要生成海量候选回答供奖励模型打分,而生成速度受限于推理延迟,所以规模化RL通常是采样先撞到算力瓶颈。技术报告里能够覆盖到数十万级别的提示词迭代池,意味着它在采样端至少配了与训练端对等的推理集群。如果你是自己复现,这点要提前做预算表格,否则训练到一半会发现GPU全被采样任务占满,策略更新在排队。
3.2 数据冷启动:seed模型不行,飞轮转不起来
关于自我改进,社区里有个常见误解:只要RL循环搭起来了,模型就会自动越变越好。实际上RL飞轮的起点质量决定了迭代的天花板。MiMo-V2.6能够把自我改进做起来,前提是它有一个足够强的seed模型——这个模型已经通过大规模SFT掌握了基本推理范式,RL只是负责把策略“压榨”得更准。
如果seed模型本身能力太弱,生成的候选样本绝大多数是垃圾,奖励模型给出的低分信号占比过高,策略梯度更新就会非常不稳定。技术报告里有一组对比实验:同样的RL算法、同样的算力,seed模型在基础推理准确率上差5个百分点,经过同样轮次的RL迭代之后,最终收益差距被拉大到了接近15个百分点。这就是飞轮效应——初始差距会被自我改进的指数级循环放大。所以,别看标题是“RL规模化”,真正的门槛其实在RL之前的SFT质量。
3.3 收敛与崩溃:怎么压制越训越疯的倾向
RL训练的收敛性问题,是MiMo-V2.6技术报告里花了大量篇幅讨论的内容。用过PPO或GRPO的人都会遇到一个经典现象:前几轮迭代效果稳步提升,到某一轮突然指标暴跌,模型开始输出大量重复或无意义内容,训练loss看上去正常但采样的reward全部异常。这就是策略崩溃。
MiMo-V2.6的应对方案可以归纳为三条:一是对策略更新加KL散度约束,防止新策略离参考策略太远;二是对奖励做动态归一化,避免早期的高分样本把奖励尺度拉偏;三是周期性回滚——如果当前模型的评测指标连续两轮下滑,就回滚到上一个checkpoint重新开始。这三条单独看都不算新技巧,但组合在一起,并且在高并行规模下稳定执行,考验的是工程能力。
我在自己的训练里体会最深的是“动态归一化”。因为自我改进的模型会持续变强,前期看起来是高分样本的答案,后期可能就稀松平常。如果奖励尺度的基准一直不变,模型的更新步长就会失真。MiMo-V2.6把奖励归一化窗口设成了动态滑窗,接近“跟当前策略水平实时对齐”,这比固定基准更符合自我改进的场景。
4. 开源落地路径:把技术报告变成自己能跑的实验
技术报告再精彩,不落地就只是PPT。好在MiMo-V2.6强调开源属性,权重和训练框架都放出来了。这一节我把从零开始复现的完整路径整理一遍,踩过的坑也一并标注,方便直接参考。
4.1 权重、框架、显存:环境准备里的关键决策点
先解决最基础的问题:模型多大、用什么框架跑。MiMo-V2.6对外发布了不同规模的版本,实际部署时,如果只是推理验证,7B级别配合vLLM就能在单张24GB显存的卡上跑得起来;但如果你想复现它的RL迭代流程,情况就完全不一样——你需要同时容纳策略模型、参考模型和奖励模型,三个模型都要驻留在显存里。
我的建议配置是这样:
- 策略模型7B + 参考模型7B + 奖励模型3B:单节点8×A100 80GB是最低舒适配置
- 如果你想在单卡上做小规模验证,可以退一步用LoRA只训练策略模型的一部分层,但要注意复现出来的行为可能跟全量微调有偏差
框架方面,技术报告里用的RL训练栈可以对应到社区里常见的组合:DeepSpeed ZeRO-3负责模型分片,vLLM做采样端的异步推理,TRL库作为PPO/GRPO算法的主控循环。三者之间的通信协调是最容易出问题的地方,强烈建议用NCCL高带宽网络,否则采样端的吞吐会拖慢整个迭代节奏。
4.2 从跑通推理到跑通一轮RL:最小可行的复现流程
我自己会用四步走的方式去做最小化复现,每一步都有一个明确出口,方便定位问题:
权重载入验证:下载权重后,先把模型跑通一条推理请求,确认tokenizer和模型配置对齐。这一步别小看——开源仓库里tokenizer_config多两个字段导致生成的token错位,我至少遇见过三次。
采样链路联通:用同一个提示词池采样几百条回答,确认vLLM的生成输出能被正确灌入奖励模型的打分API。这一步的关键是数据结构统一,建议把候选回答全部转成统一的json格式再传给奖励模块。
单轮PPO/GRPO更新:选一个小型子集(几千条提示词),完整跑一轮策略更新。观察策略模型的输出分布变化,确认KL散度没有爆炸。
多轮迭代小规模验证:重复采样、打分、更新三个动作3到5轮,看评测集准确率是否出现上升趋势。
我个人的经验是,很多团队卡在第二步到第三步之间,原因通常是采样端和训练端的并行方式冲突。举例来说,vLLM为了吞吐会把多条请求动态batching,而策略更新需要稳定的batch粒度,两边如果不加同步缓冲,梯度更新的方差会非常大。技术报告里提到的高质量RL框架设计,其实很大程度就是在解决这个工程级问题。
4.3 评测指标里最容易误读的三处
复现RL项目,评测环节最容易产生虚假成就感。
误读一:只看平均reward。因为奖励模型是模型打的分,而策略模型会在多轮迭代过程中越来越适配奖励模型的偏好,所以平均reward上涨不一定代表真实能力上涨。最好同时看一个外部权威评测集或者规则校验的准确率。
误读二:拿测试集做筛选。有些人在RL迭代中反复评测同一批测试集,并依据结果挑选checkpoint,时间一长,那批测试集的信息会被污染。MiMo-V2.6的做法是每轮用保留下来的留存评测集做最终判定,并且评测集和提示词池完全隔离。
误读三:忽略推理长度的变化。模型推理能力变强后,往往生成更长的推理链,导致单位时间生成的token数下降。如果评测指标只算“每轮采样的最终得分”,可能会漏掉效率下降的问题。建议在报告里同时记录平均生成长度、缓存命中率、有效token占比,既看效果也看成本。
5. 实测中的几个“反直觉”体会:给想跟进的人一份避坑清单
5.1 损失曲线几乎不动,不代表策略没有进步
我第一次跑多轮RL迭代时,盯着策略模型的损失曲线看:前两轮还有明显下降,到第三轮开始曲线平滑到几乎一条直线。当时第一反应是训练失效了,后来对比权威评测集的准确率才发现,模型的推理能力依然在稳步上升。
这个现象的原因是RL阶段策略模型的损失函数里,KL正则项占了很大的权重,而KL是一个约束性很强的项,会把损失曲线“熨平”。真正反映能力变化的信号在采样端的reward分布变化里,以及策略生成文本的结构质量里。所以我的建议是,RL训练中别把loss当唯一仪表盘,要建立“reward分布+评测准确率+生成质量抽检”的多维度观测面板。
5.2 自我改进会在某个阶段“原地打转”甚至反弹
自我改进不是无限上升的直线,MiMo-V2.6技术报告里其实也承认了这一点:当模型在提示词池上的正确率超过某个阈值之后,RL迭代带来的边际收益会迅速衰减,模型开始在相似难度的题目之间反复徘徊。报告的应对手段是扩大提示词池的难度覆盖,不断引入新的更难样本。
这个现象背后的机制,说穿是模型已经逼近当前能力上限时,继续在同一分布内做策略优化只是在做“重复巩固”,不会引发质变。自我改进能否持续,取决于你是否有办法持续提供略超出现有能力边界的新任务。这比调参重要得多。如果提示词池是静态的,别指望模型能凭RL无中生有。
5.3 小模型上验证的超参,直接迁移到大模型会翻车
由于MiMo-V2.6同时开源了多个规模版本,很多人会自然想先在7B上把RL超参调好,再平移到70B上省算力。这个思路听起来高效,实际操作却危险:小模型和大模型对同一组RL超参的敏感度完全不同。典型例子就是学习率和KL系数——70B模型的自回归分布更尖锐,KL系数如果照搬7B的配置,策略更新很容易被正则化压死,表现为新策略和参考策略几乎无差异。
我的经验是,从7B迁移到30B以上,学习率至少要降一半,KL系数要增大到1.5到2倍,rollout数量也要同步增加。迁移后的第一轮迭代必须盯紧采样的reward分布,如果连续多步的reward期望低于之前模型的基线,大概率是超参没对齐,而不是新模型的能力问题。
说到最后,我对MiMo-V2.6这篇技术报告的整体判断是八个字:路线明确,门槛不高但坑很多。所谓路线明确,是指它把“用RL规模化推动模型自我改进”讲成了一条可以复制的路径,而不是某些实验室泛泛而谈的“探索方向”;所谓门槛不高但坑很多,是说每个环节——从奖励设计到采样算力分配,再到评测防污染——都有大量工程细节,少一个都可能让飞轮停转。
我个人的建议是,如果你是第一次接触这类RL迭代训练,不要一上来就追求复现它的完整规模。先拿一个中小型模型,把“采样→打分→更新→再采样”的闭环在一周内完整跑通,把里面每个环节的手感和坑都摸清,你再去读技术报告里那些关于规模化分布、回滚策略和提示词池动态调度的章节,会有完全不同的体会。到那时候你会明白,真正的自我改进不是模型在单轮训练里突然开窍,而是你作为工程师,为它搭好了一套能持续吸收反馈、持续修正策略的循环系统。