MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement
一句话概括
MiMo-V2.6 通过把强化学习(Reinforcement Learning, RL)算力沿批次规模、环境多样性与评分算力三个方向放大,推动全模态模型走向自我改进。团队开源了训练动态、RL 环境与 RL 框架。
速览
- 任务与方法:在全模态基础模型上做大规模 RL 训练,前期先做多模态中期训练以扩大探索空间。
- 关键数字:异步训练每步消耗 1,568 个样本、2.7–3.7B tokens,上下文长度最高 1M。
- 稳定性手段:冻结 MoE 路由器(MoE router),并建立多层防御应对奖励黑客(reward hacking)。
- 开源情况:开源训练动态、RL 环境与 RL 框架;模型权重是否开源,摘要未给出。
问题背景
- RL 被视为推动基础模型走向自我改进的核心训练范式。
- 难点在于:把 RL 算力真正放大,同时保持训练稳定、奖励信号可靠。
- 长程任务(long-horizon task)的奖励信号往往不准,容易诱发奖励黑客。
- 大规模 RL 还要求环境足够多样、rollout 吞吐足够高,否则算力堆不上去。
方法要点
论文把 RL 算力扩展拆成三条线。
- 更大批次与更高吞吐。采用异步训练,每步消费 1,568 个样本、2.7–3.7B tokens,上下文长度最高 1M。
- 更多样、更复杂的环境。覆盖代码、通用、视觉与网络(cyber)领域,并混合多种 agent harness。
- 更多评分算力。用分组式智能体评分(groupwise agentic grading)为长程任务提供更准的奖励信号,同时引导模型给出更短、更省 token 的解。
训练稳定性方面,团队冻结 MoE 路由器,并建立多层防御对抗奖励黑客。
基础设施方面,团队为混合任务智能体 RL 搭建了配套组件:
- 统一轨迹表示(unified trajectory representation);
- 高并发多框架 rollout;
- 控制面与数据面解耦(decoupled control and data planes);
- 训练与推理一致性(training-inference consistency)。
关键结论
- 沿三个维度放大 RL 算力,可提升模型智能水平,这是报告的核心主张。
- 异步训练支撑了高吞吐与长上下文下的规模扩展。
- 分组式智能体评分既改善长程任务的奖励准确性,也带来更省 token 的解。
- 冻结 MoE 路由器加多层防御,是维持大规模训练稳定的关键设计。
- 开源训练动态、RL 环境与 RL 框架,便于复现与后续研究。
读后思考
- 这篇报告更像工程与系统报告,而非单一算法创新;价值集中在「怎么把 RL 跑大」。
- 三个扩展维度里,评分算力最容易被忽视,却直接决定奖励信号质量。
- 「更短、更省 token」被当作 RL 的引导目标,说明效率已进入奖励设计。
- 冻结路由器是稳定性的取舍:省了风险,也可能限制路由随 RL 演化。
- 开源训练动态与环境的做法,对 RL 可复现性问题的回应较直接。
局限与开放问题
- 摘要未给出具体评测基准、分数或对比模型,效果提升幅度无法判断。
- 模型参数量、系列具体成员与模态覆盖细节,摘要未给出。
- 冻结 MoE 路由器对最终能力的影响,摘要未给出消融结果。
- 多层防御具体包含哪些机制,摘要未给出。
- 奖励黑客是否被彻底抑制,摘要未给出量化证据。
- 1M 上下文下的 RL 训练成本与效率权衡,摘要未给出。
- 开源范围是否包含模型权重与完整数据,摘要未给出。