小米新模型训练直播首秀:一小时烧20万的背后

Feng 5 阅读 AI资讯

罗福莉也学雷军玩直播,小米新范式训练首次公开,一小时狂烧20万

爱范儿·2026年09月17日 13:34难点 AI 强化钻研极限
就在刚刚,小米 Mi Mo 小组公布了最新进展。
小米 Mi Mo 负责人罗福莉在 X 底座发文表示,过去近半年小组一直环绕一个问题展开探究:强化学习(RL)还能扩展到什么级别。
她透露,目前 Mi Mo-V 2.6 正处于 RL 训练过程中,小组正于拓展三个方向的规模,包括计算资源、训练环境与作业体系,与奖励评估机理。将来几周,小米 Mi Mo 小组将陆续公开更多手段细节。

配图

直播🔗
与此同时,罗福莉还分享了 Mi Mo-V 2.6 的实时调参页面,使外界首次看到这一代模型强化钻研时期的部分训练状态。
从罗福莉公开的调参页面来看,Mi Mo-V 2.6 当前正在进行一次大体量 Agent 强化钻研实验。页面呈现了范式训练进度、Token 消耗、训练开销、样本数量以及多个内部度量变化。
目前训练页面中包含两个版本,分别是 Mi Mo-V 2.6-Pro 和 Mi Mo-V 2.6-Flash。

配图

其中,Mi Mo-V 2.6-Pro 当前处于 step 12 阶段,累计训练样本抵达约 301K,训练开销约 806,349 美元,累计消耗 Token 达到 25.1B。
累计训练样本抵达约 426K,训练开销约 354,499 美元,Mi Mo-V 2.6-Flash 当前处于 step 17 时期。
两个版本当前累计训练成本已经超过 116 万美元,平均每小时计算成本约达到 3.09 万美元(折合人民币 20.72 万元)。不过,从训练面板的数据来看,小米此次公开的重点并不是成本,而是展示 RL 训练过程中模型如何通过大规模任务交互不断提升能力。

Mi Mo-V 2.6 正在难点 RL 的规模界限

罗福莉在 X 中提到,Mi Mo-V 2.6 本轮强化学习训练重心拓展了三个方向。
第一个方向是计算规模。
她表示,团队将单个训练 step 的规模提升到约 2B tokens,同时采用 1568 个 prompts × 16 rollouts 的训练方式,并使用 fully async,也就是完全异步训练。
按照这一配置计算,单个训练 step 理论上会产生约 2.5 万次模型尝试,相当于让 AI 同时探索大量不同解决路径。

配图

在这种训练方法下,模型面对一个作业时,不会只产出一次答案,而是会同时尝试好几类解决方案,再依据奖励反馈判断哪些路径更加管用。
对于 Agent 范式来说,大体量探索能力非常要害。过去的大范式更多依靠预训练取得知识,再借助监督微调调整输出方式。
但当 AI 开始承担编程、办公、资料分析等繁复任务后,范式需要的不只是回答难题,还需要规划步骤、调用利器、校验结果。
强化学习的价值,就在于让范式借助大量尝试和反馈,逐步形成更管用的作业落实策略。
第二个方向是训练环境。罗福莉表示,团队扩大了 environments 和 harnesses,引入 multi-task agentic RL,将多个任务环境混合到一次训练流程中。

配图

从 Mi Mo-V 2.6 实时监控面板展现的数据来看,当前调参作业覆盖视觉、代码、通用任务以及聊天任务。
页面中可以看到 visual/dataset-jz 3d、visual/dataset-gta V、visual/dataset-vs 3e 等视觉数据集,也包含 code/dataset-4qn 等代码作业,与 general、chat 类数据集。
这说明 Mi Mo-V 2.6 并不是只优化某一种能力,而是在尝试让模型并且适应相异类型的 Agent 情形。

配图

第三个方向是增加评判系统的计算投入。
罗福莉提到,小组引入了 agentic in-group credit assignment,并融合 test-case 和 rubric-based rewards。
复杂 Agent 任务通常含有多个落实流程。
范式可能需要先搜索信息,再拟定策略,然后调用工具完成作业。
罗福莉提到,团队采用智慧体式的组内出力归因,并结合验证用例和评分细则提供奖励。直面好几类作业和多条落实轨迹,评判体系须要带来有区分度的反馈,帮助模型从不同尝试中学习更有效的任务执行策略。
更细致的奖励分配机制,可以帮助模型学习更加有效的执行路径。
从页面中的度量变化来看,Mi Mo-V 2.6 的奖励相关指标正在伴着调参推动提升。
Pro 的均值奖励由调参早期约 0.55 提高至 0.582,Flash 则由约 0.52 提高至 0.570,比如从 critic/rewards/mean 曲线来看。

配图

调参页面透露出的信号,小米正在押注 Agent 纪元

除了呈现训练流程,罗福莉公开的训练页面还透露了 Mi Mo-V 2.6 当前的本领变化。
截至发稿前,从该训练面板的数据来看,Mi Mo-V 2.6-Pro 当前 Deep SWE v 1.1 benchmark 得分达到 63.72,Mi Mo-V 2.6-Flash 得分达到 60.77。
Deep SWE 主要用来测试范式的软件工程本领,涵盖代码理解、修改以及复杂开发作业处置。
与此同时,训练页面中的上下文长度指标也持续增长。其中,ctx_total_length 数据显示,Mi Mo-V 2.6-Pro 当前平均上下文长度已经接近 10 万 Token,Flash 版本也超过这一规模。
对于 Agent 模型而言,长上下文本领意味着模型能够延续记住此前的操作流程、利器反馈以及任务状态,这也是完成繁复工作的基础。

配图

值得注意的是,此次小米公开的是调参过程,而并非最终范式成绩。
过去,大范式公司一般只在模型发布时公布参数、榜单成绩和应用案例,调参过程往往处于黑盒状态。此次罗福莉分享实时训练页面,让外界可以看到范式训练中的计算体量、任务组成以及本领变化。
当下,Pro 和 Flash 的调参仍在继续。
随着曲线延伸,我们将能延续追踪三个关系:计算投入与能力提升的关系,落实长度与任务成效的关系,与环境多元性与模型适应能力的关系。
罗福莉提出的「强化钻研能扩容多远」,也将通过这些关系逐步得到回答:增加的计算,能否让范式在更多环境中,更平稳、更高效地做完复杂任务。

Feng
这位作者很神秘,还没有填写简介。