ARTICLE SIGNAL

小米大模型强化学习揭秘:直播训练一小时烧3万美金

AI资讯,AI新闻,大模型,人工智能,小米AI大模型MiMo-V2.6强化学习训练全程直播,揭秘RL模型在计算量、环境与评分三大维度的扩展法则。深入解读一小时耗资3万美元背后的AGI技术逻辑与LLM前沿探索,关注AI门户获取更多AI日报。

type
status
date
slug
summary
tags
category
icon
password
网址
在近期沉寂了近半年之后,小米AI团队负责人罗福莉带着一项震撼AI新闻圈的硬核操作高调回归:直接对小米新一代大模型的强化学习(Reinforcement Learning, RL)训练过程进行了全网现场直播。这不仅在人工智能行业内引发了轰动,更让无数关注AGI发展的开发者和研究人员直呼过瘾。
点开直播页面,这与其说是一个枯燥的技术监控大屏,不如说是一个令人心跳加速的“烧钱现场”。据统计,从Pro模型开始训练算起的36小时内,两款模型已经消耗了超过108万美元的算力成本,平均每小时烧掉3万美元(约合人民币21万元)。在这个页面上,训练花费、运行步数、奖励曲线的波动,甚至是哪个节点的显卡出现了故障,全都毫无保留地公开。相比于openai的闭门造车,或者chatGPTclaude的黑盒训练,小米这次“开放训练过程”的举动,无疑为AI资讯界投下了一枚重磅炸弹。
想要持续追踪此类前沿的AI日报LLM动态,欢迎访问我们的AI门户,获取最及时的行业解析与技术风向。接下来,我们将深入剖析这场“烧钱直播”背后,小米在强化学习Scaling(扩展)法则上的三大核心探索。

成绩初显:Flash与Pro模型的双线狂飙

目前直播展示的是MiMo-V2.6版本的Flash和Pro两款模型的训练实况。虽然训练才刚刚开始一天多,但两者在强化学习过程中的能力提升已经肉眼可见。
数据显示,Pro模型的dynsam/avg@n指标从第1步的约0.565稳步提升至0.614,而Flash模型则凭借更低的起点快速追赶,从0.514跃升至0.603。在最新公开的DeepSWE v1.1离线评测中,Pro和Flash分别斩获了62.24和60.77的分数。虽然距离顶尖水平(如DeepSeek-Flash v1.1的74.2%)还有追赶空间,但Flash模型快速逼近Pro的趋势,展示了强化学习在模型微调阶段的巨大潜力。

突破传统:探索强化学习的Scaling Law

自今年4月份开源MiMo-v2.5之后,小米团队究竟在闭关修炼什么?罗福莉给出的答案非常纯粹:探索强化学习究竟能扩展(Scaling)到多远。
大模型的预训练阶段,Scaling Law(扩展法则)早已被验证:更多的高质量数据 × 更庞大的参数量 × 更强的算力 = 更智能的模型。这也是当前LLM发展的基础共识。然而,进入后训练(Post-training)和强化学习阶段,前沿模型是否也能遵循类似的法则?如果持续增加模型面对的任务环境种类、增加每轮生成的轨迹数量、投入更多算力去评判这些轨迹的优劣,模型的能力是否能无上限地持续进化?
小米通过MiMo-V2.6的训练给出了他们的解题思路:沿着计算量、环境/执行框架、评分计算三个维度进行极致扩展。

维度一:计算量的极致扩展与全异步流水线

第一个扩展维度最为直观,即做大强化学习本身的计算规模。
在MiMo-V2.6的训练中,每一个训练Step大约需要处理高达20亿个Token。其配置极其奢华:1568个提示词(Prompt) × 每个Prompt生成16条Rollout(行动轨迹)。这意味着,面对同一个问题,模型不是简单地给出一个答案,而是要尝试16种不同的解题思路和行动路径。一轮下来,会产生超过2.5万条Rollout。对于复杂的Agent任务而言,一条Rollout包含了数十轮的思考、工具调用、环境反馈和迭代,这也是为什么单个Step的Token消耗量能达到数十亿级别。
更具技术含量的是,整个系统采用了完全异步(Fully Async)的执行方式。传统的RL训练像是一条同步流水线,必须等待所有样本生成完毕、统一评分、更新模型后,才能进入下一轮。但在大规模Agent训练中,这种方式会导致严重的算力闲置。小米构建了一套持续运转的异步系统:有的Agent正在环境中执行任务,有的在等待判分,有的正在计算Reward,生成、执行、评分和训练并发进行,将硬件利用率推向了极致。

维度二:多任务环境与执行框架的深度融合

第二个方向是环境与执行框架(Environments and Harnesses)的扩展。
MiMo-V2.6致力于打造多任务智能体强化学习(Multi-task Agentic RL)。在同一次RL训练中,代码编写、通用逻辑、视觉处理、Chat对话等不同类型的任务被混合在一起。更重要的是,这些任务运行在不同的Harness(执行框架)中。
例如,一个编程Agent需要终端访问权限,能够修改代码、运行测试并阅读报错信息;而一个视觉Agent则面对完全不同的工具链和成功判定条件。小米在直播页面特别展示了“Batch Composition(批次构成)”,这表明模型在每一个Step中,都在从海量、异构的任务环境中汲取经验。这种多环境的融合,是通往通用人工智能AGI)的必经之路。

维度三:评分算力的暴增与细粒度信用分配

第三个Scaling方向往往容易被外界忽视,那就是给“打分”本身投入海量算力(Grader Compute)。
在强化学习中,奖励信号(Reward)的质量决定了模型进化的上限。对于简单的代码任务,跑一下Test Case就能知道对错;但对于开放式的Agent任务,仅仅给出一个“成功”或“失败”的最终结果,学习信号过于粗糙。
这就引出了一个核心难题:信用分配(Credit Assignment)。假设模型为了完成任务执行了40个步骤(搜索、阅读、写代码、排错等),如果最后只反馈一个“Reward=1”,模型根本不知道这40步里,哪一步是画龙点睛,哪一步是多此一举。
为此,小米引入了Agentic In-group Credit Assignment机制。结合“每个Prompt生成16条Rollout”的设定,系统通过对比同组内的多条轨迹,提取出比单纯“成败”细致得多的奖励信号。系统投入大量算力去评估:在相同的起点下,哪些具体的行为分支导致了更好的结果?哪些动作应该被鼓励,哪些应该被抑制?这种细粒度的评分,让海量经验真正转化为了高质量的训练信号。

总结:一切的背后皆是算力

小米MiMo-V2.6的这场直播,向我们完整展示了一套现代化的强化学习扩展体系:通过扩展计算量让模型产生海量经验,通过扩展环境让经验变得丰富多样,再通过扩展评分算力从经验中榨取最精准的学习信号。
诚如业内专家所言,这三大扩展维度的背后,本质上都是对算力的极致渴求与高效利用。当预训练的红利逐渐见顶,如何让模型在与环境的交互中持续自我进化,将是下一代大模型竞争的主战场。
在这个AI技术日新月异的时代,无论是探索AI变现的创业者,还是钻研Prompt工程的开发者,紧跟行业最前沿的步伐至关重要。获取更多深度AI资讯AI新闻以及全球大模型发展动态,请持续关注我们的AIGC门户,让我们共同见证AGI时代的到来。
Loading...

没有找到文章