EMON TECH MEDIA · PAPERS — DNA·52CD39

MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement

MiMo-V2.6 通过把强化学习(Reinforcement Learning, RL)算力沿批次规模、环境多样性与评分算力三个方向放大,推动全模态模型走向自我改进。团队开源了训练动态、RL 环境与 RL 框架。

发表日期

作者

Xiaomi LLM-Core Team, :, Zongming Qiao, Ziyue Hua, Zirui Ou, Zihao Yue 等

影响力

86.4

阅读时长

约 4 分钟

标签

推理

MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement

一句话概括

MiMo-V2.6 通过把强化学习(Reinforcement Learning, RL)算力沿批次规模、环境多样性与评分算力三个方向放大,推动全模态模型走向自我改进。团队开源了训练动态、RL 环境与 RL 框架。

速览

  • 任务与方法:在全模态基础模型上做大规模 RL 训练,前期先做多模态中期训练以扩大探索空间。
  • 关键数字:异步训练每步消耗 1,568 个样本、2.7–3.7B tokens,上下文长度最高 1M。
  • 稳定性手段:冻结 MoE 路由器(MoE router),并建立多层防御应对奖励黑客(reward hacking)。
  • 开源情况:开源训练动态、RL 环境与 RL 框架;模型权重是否开源,摘要未给出。

问题背景

  • RL 被视为推动基础模型走向自我改进的核心训练范式。
  • 难点在于:把 RL 算力真正放大,同时保持训练稳定、奖励信号可靠。
  • 长程任务(long-horizon task)的奖励信号往往不准,容易诱发奖励黑客。
  • 大规模 RL 还要求环境足够多样、rollout 吞吐足够高,否则算力堆不上去。

方法要点

论文把 RL 算力扩展拆成三条线。

  1. 更大批次与更高吞吐。采用异步训练,每步消费 1,568 个样本、2.7–3.7B tokens,上下文长度最高 1M。
  2. 更多样、更复杂的环境。覆盖代码、通用、视觉与网络(cyber)领域,并混合多种 agent harness。
  3. 更多评分算力。用分组式智能体评分(groupwise agentic grading)为长程任务提供更准的奖励信号,同时引导模型给出更短、更省 token 的解。

训练稳定性方面,团队冻结 MoE 路由器,并建立多层防御对抗奖励黑客。

基础设施方面,团队为混合任务智能体 RL 搭建了配套组件:

  • 统一轨迹表示(unified trajectory representation);
  • 高并发多框架 rollout;
  • 控制面与数据面解耦(decoupled control and data planes);
  • 训练与推理一致性(training-inference consistency)。

关键结论

  • 沿三个维度放大 RL 算力,可提升模型智能水平,这是报告的核心主张。
  • 异步训练支撑了高吞吐与长上下文下的规模扩展。
  • 分组式智能体评分既改善长程任务的奖励准确性,也带来更省 token 的解。
  • 冻结 MoE 路由器加多层防御,是维持大规模训练稳定的关键设计。
  • 开源训练动态、RL 环境与 RL 框架,便于复现与后续研究。

读后思考

  • 这篇报告更像工程与系统报告,而非单一算法创新;价值集中在「怎么把 RL 跑大」。
  • 三个扩展维度里,评分算力最容易被忽视,却直接决定奖励信号质量。
  • 「更短、更省 token」被当作 RL 的引导目标,说明效率已进入奖励设计。
  • 冻结路由器是稳定性的取舍:省了风险,也可能限制路由随 RL 演化。
  • 开源训练动态与环境的做法,对 RL 可复现性问题的回应较直接。

局限与开放问题

  • 摘要未给出具体评测基准、分数或对比模型,效果提升幅度无法判断。
  • 模型参数量、系列具体成员与模态覆盖细节,摘要未给出。
  • 冻结 MoE 路由器对最终能力的影响,摘要未给出消融结果。
  • 多层防御具体包含哪些机制,摘要未给出。
  • 奖励黑客是否被彻底抑制,摘要未给出量化证据。
  • 1M 上下文下的 RL 训练成本与效率权衡,摘要未给出。
  • 开源范围是否包含模型权重与完整数据,摘要未给出。

本页为科普精读;细节以 arXiv 原文为准。就本篇提问请点左下角「论文研读助手」。