核心信息
小米定位了 MiMo-V2.6 模型中工具调用重复的问题,该问题浪费上下文并导致任务卡顿,根源是强化学习训练中的奖励盲区。团队通过一个仅在 12 步、约 7k 样本上训练的轻量级重复专门化 RL 教师模型完成了修复。
要点
- 该问题导致模型重复输出相同或高度相似的调用,影响 MiMo Desktop、MiMo Code 和 OpenCode 的性能。
- 根本原因:洪泛惩罚仅在单轮超过 32 次调用时触发,低于阈值的低效行为未被惩罚。
- 修复方案:轻量 RL 教师模型仅用约 7k 样本训练 12 步,无需大规模重训。