新方法LEEPS提升大模型强化学习效率

LEEPS通过改进提示采样,降低大模型强化学习中的无效计算,并在多项推理基准上取得更高成绩 。
币界网报道:
研究人员提出了一种名为 LEEPS 的提示采样方法,目标是降低大语言模型在强化学习训练中的无效计算。该方法主要用于带可验证奖励的强化学习流程,重点解决提示采样阶段的效率问题。基准测试显示,它在不明显拖慢训练的情况下,提高了模型在数学和通用推理任务上的表现。
无效 rollout 会消耗算力
在这类训练中,模型通常会针对同一提示生成多次 rollout,再根据奖励结果更新参数。如果这些 rollout 最终得到完全相同的奖励,这一轮训练就几乎无法提供有效学习信号,但仍会消耗算力和生成预算。
为减少这类浪费,研究人员通常会在 rollout 生成前先筛选提示。但现有方法往往面临取舍:如果过度依赖过去已经证明有效的提示,训练覆盖面会变窄;如果过度探索不确定提示,又会降低有效样本占比。
LEEPS动态分配提示预算
LEEPS 的设计思路,是在“复用已知有效提示”和“继续探索未知提示”之间动态分配资源,而不是固定采用某一种比例。它会把候选提示分成两组:一组是历史上更容易产生有效学习信号的提示,另一组是价值仍不明确的提示。
随后,系统会根据两组提示近期产生“非平凡奖励”的情况,动态调整 rollout 预算。这里的“非平凡奖励”,指的是同一提示下不同 rollout 之间存在有意义的奖励差异,这类样本更有助于训练继续学习。
两种模型规模均优于基线
在探索部分,LEEPS 还会利用潜在表示空间中的相邻提示,以及历史 rollout 结果,优先挑选更可能产生有效奖励差异的未知提示。也就是说,它不是随机探索,而是更有针对性地把算力投向更可能带来学习信号的样本。
1.5B 模型相对最强基线提升 2.6%
7B 模型相对最强基线提升 3.7%
3 项分布外推理基准也取得最高均分
研究结果显示,LEEPS 在两种模型规模和 9 项基准测试中都优于最强基线。在 6 项数学推理基准上,Qwen2.5-Math-1.5B 和 Qwen2.5-Math-7B 都取得了最高平均分,说明这一方法的收益并不只局限于单一任务。
每步额外增加约 2 秒
从效率看,LEEPS 每个训练步骤只增加约 2 秒在线采样开销。研究还提到,采用这一方法的模型在训练过程中通常能更快达到更强表现,而不只是最终分数更高。
对于需要大规模强化学习训练的团队来说,这类改进意味着可以用较小的额外采样成本,换取更少的无效生成和更快的性能提升。在算力资源持续紧张的背景下,这类训练效率优化仍是大模型研发的重要方向。
免责声明:本文内容来源于公开信息整理,仅供学习研究之用,不构成任何投资、法律等领域的建议和依据。据此操作,风险自担。
相关阅读
更多 区块链
XRP守住1.30美元,期货持仓继续回落
XRP暂守1.30美元上方,期货未平仓合约从22.5亿枚降至21.2亿枚,市场情绪受美国立法受阻和美联储加息拖累 。

Taboola拟收购英国广告科技公司Dianomi
Taboola宣布拟收购专注金融广告的英国公司Dianomi,交易金额最高约 2700 万英镑 。

外媒:106 美元成 SOL 短线关键位
外媒称,SOL 短线关注 100 美元支撑与 106 美元阻力,放量突破后上方目标指向 115 美元和 130 美元 。

SEC放开许可型AMM路径,Uniswap再受关注
SEC 为许可型 AMM 交易打开合规路径,带动市场重新关注 Uniswap v4 及其许可池设计,UNI 价格同步走强 。

SEC设五年豁免路径,代币化美股迎来美国试点
SEC推出五年期豁免框架,为代币化美股在美国本土链上交易提供试点路径,但仅限许可制 AMM、完整股东权利代币,且发行人可反对上线 。

美国参议院搁置AI数据中心电价法案
美国参议院搁置一项涉及 AI 数据中心用电成本分担的法案,电网升级费用归属成为两党争议焦点 。