强化学习
强化学习是机器学习的一个核心分支,研究智能体如何通过与环境的交互来学习最优行为策略。与监督学习不同,强化学习不依赖标注数据,而是通过试错和延迟奖励信号来发现能最大化累积奖励的行为方式[^c1]。
强化学习的思想可追溯至1950年代,经历了从图灵的奖惩机制概念、明斯基的SNARC机器到萨缪尔的跳棋程序等早期探索。1980年代,巴托和萨顿建立了现代强化学习的理论框架,提出了时序差分学习和演员—评论家架构。1989年Q学习被提出,1992年TD-Gammon取得突破——这些里程碑工作奠定了算法基础。进入深度学习时代后,DQN、AlphaGo、PPO等突破将强化学习推向新的高度[^c1]。2025年,ACM将图灵奖授予巴托和萨顿,表彰其对强化学习的奠基性贡献[^c2]。与此同时,NVIDIA与David Silver创立的Ineffable Intelligence合作构建大规模RL基础设施,推动RL向能够自主发现新知识的"超级学习者"方向演进[^c3]。主要云厂商也开始将强化学习作为托管服务推出:AWS在SageMaker AI中提供多轮强化学习服务,用于在多步智能体任务上微调模型[^c5];微软Frontier Tuning通过引导式强化学习环境持续捕捉企业行为信号,建立企业活动与模型行为之间的反馈回路[^c6]。
在大语言模型领域,以GRPO和DAPO为代表的可验证奖励驱动方法正在取代传统的RLHF范式,成为LLM后训练的主流选择[^c4]。2026年以来,RL在LLM中的应用正在快速扩展:Pair-GRPO家族通过梯度等价定理统一了偏好约束框架[^c7];G2D流水线展示了短GRPO预热后接离线DPO可以匹配或超越纯粹在线RL[^c18];理论证明GRPO算法隐藏着过程奖励模型结构,λ-GRPO修正了步骤奖励不平衡缺陷[^c19];元认知即奖励(MaR)将元认知知识覆盖率和调节保真度纳入奖励维度[^c20];ContextRL通过对比上下文选择目标提升长时域推理和多模态性能[^c21];TRACER将遗憾匹配与角色特定GSPO奖励结合,实现协作多LLM推理[^c22]。研究表明RL在预训练早期即可生效,挑战了SFT→RL的标准流程[^c8];DARTS通过主动分布塑形将rollout吞吐量提升1.77倍;EchoRL和Reasoning Arena分别从优势退化和奖励区分度两个角度改进了RLVR训练效果;高斯信任区域策略优化(GTR)重新设计了信任区域机制以提升非平稳环境下的鲁棒性。CPPO针对LLM自回归生成的位置不对称性提出了位置加权信任区域阈值[^c15]。一项从第一性原理出发的综述将所有策略优化方法统一到轨迹侧和奖励侧这两个组织轴上[^c16]。在理论方面,RLVR相比SFT在回溯学习能力上被证明具有推理时计算复杂度的指数级优势[^c13]。GRPO的U-统计量理论分析揭示其渐进等价于拥有理想价值函数的预言机算法[^c35]。SPIRAL提出将顺序推理、并行采样和多轨迹聚合统一为端到端训练框架,扩展效率比GRPO高出11倍[^c12]。G2PO将线性智能体轨迹转化为全局状态转移图以解决长时域奖励稀疏问题[^c17]。在训练稳定性方面,GEOALIGN识别并修正rollout的方向不一致性导致的振荡更新[^c9],而DCMDP通过差异约束马尔可夫决策过程管理训练-推理引擎差异[^c10]。在系统效率方面,RolloutPipe通过流水线化重叠rollout生成与训练,将总时间缩短30%以上[^c11]。NebulaExp-8B提供了完全透明、可复现的端到端后训练流水线和多教师在线策略蒸馏方法[^c14]。在可验证奖励研究的前沿,RLVR正沿三个方向深化:DBB从统计估计角度缓解群组RLVR的样本低效与方差崩塌[^c45];在不完美验证器下,基于非对称噪声率的向前/向后校正提供无偏奖励修正[^c46];LongRLVR证明仅结果奖励在长上下文接地中导致梯度消失,并引入稠密可验证的上下文奖励[^c47]。
在RLHF理论方面,CPO证明DPO与RLHF的等价性是有条件的而非普遍成立[^c31];PM RLHF揭示了KL正则化导致的偏好崩塌问题,通过偏好匹配正则化器实现了29%-41%的对齐改善[^c32];SAFE通过双软最小评论家和熵门控KL调节实现了稳定、抗崩溃的RLHF训练[^c33]。在奖励建模理论方面,2026年的因果信息论研究严格证明了过程奖励模型(PRM)相对于结果奖励模型(ORM)的优势——基于结果奖励的强化学习会使模型偏好学习表面统计相关性而非真正的因果推理链[^c43]。
在算法创新方面,UP(无界正非对称优化)作为即插即用模块可无缝集成到多种RL算法中,通过无裁剪正优势梯度最大化探索能力[^c28]。FADE将优势函数沿符号轴和难度轴正交分解,为GRPO等算法提供了统一的理解框架。R2VPO用显式策略比率方差约束替代启发式裁剪。系统性研究揭示了RLVR训练中熵崩溃的驱动因素,Positive-Advantage Reweighting方法通过调整正优势token损失权重来缓解熵崩溃。CME(跨模型熵)将验证器模型的平均对数似然作为无标签奖励信号,将RLVR从可验证领域扩展到开放式指令跟随[^c29]。GRPO的理论与算法创新持续深化:FRPO推导了带逐token f-散度正则化的GRPO在策略梯度,通过未来KL修正实现过程级信用分配[^c36];PowerFlow将无监督RLIF重构为分布匹配问题,以α-幂分布定向增强逻辑推理或解锁创造力[^c37];VANE以结果与语义过程双重新颖性度量引导RLVR中的高价值探索[^c38];VAM通过言语化动作掩码实现LLM RL后训练中的可控探索[^c39];ReSkill将技能创建嵌入GRPO群组结构,实现技能与策略的协同进化[^c40]。RL中的峰值偏差(Trace-Mediated Peak Bias)被形式化定义并证明与人类峰终法则存在计算层面的联系[^c23]。
在离线强化学习方面,PRGS提出了面向Transformer的精细化子轨迹切片框架,通过自动筛选高质量子轨迹将Transformer类方法的平均性能提升15.8%[^c34]。在智能体训练基础设施方面,Agent World Model(AWM)通过全自动管线生成了1000个代码驱动的合成环境,为多轮工具使用智能体的RL训练提供了可扩展的多样化环境资源[^c30]。
2026年的一项重要实证发现挑战了RL训练需要全参数更新的行业共识——RL后训练的大部分收益集中在Transformer的少数中间层,单层训练即可匹配甚至超越全参数训练,在第16层上单层训练的贡献度达到了1.07[^c27]。这一发现为大幅降低RL训练算力消耗打开了新路径。RLPT(预训练数据强化学习)将RL进一步扩展到预训练阶段,从通用文本数据中通过下一段推理目标推导奖励信号。ProRL v2证明持续RL训练可让1.5B参数模型在3000步以上持续提升并超越更大规模的DeepSeek-R1-7B。自主后训练系统实现了无人干预的LLM后训练闭环,在一个30B参数模型上跨数周完成四轮后训练,并登上公开推理挑战排行榜[^c44]。
在基础理论方面,2026年的研究发现了深度强化学习中一种名为峰值偏差(Trace-Mediated Peak Bias)的系统性失效模式——处于中等资格迹深度时智能体会偏好高峰值回报而非高累积回报的轨迹,与人类峰终法则认知偏差存在计算层面的联系[^c23]。在评估基准方面,Agentick提供了面向RL、LLM、VLM、混合和人类智能体的统一序列决策基准,包含37个程序化生成任务[^c25];棱镜基准OPG-D3引入Oracle Performance Gap指标,用于衡量训练-测试划分对泛化失败风险的掩盖程度。在奖励模型评测方面,RewardBench家族持续扩展:MM-JudgeBench首次对多语言多模态评判模型进行大规模评测,覆盖60K余条两两偏好实例与25种语言[^c48];IF-RewardBench将指令跟随评估从成对比较扩展为基于偏好图的列表式范式[^c49]。在部署范式方面,持续强化学习被提出为部署后智能体应采纳的学习范式,以应对环境动态变化、任务目标漂移等四种非平稳性来源[^c24]。在计算机使用智能体领域,ACuRL以零人工数据的自主课程强化学习框架持续适应环境变化,在无灾难性遗忘的前提下带来3%-29%的绝对性能提升[^c50]。
在物理世界应用方面,2026年由John Carmack和Richard Sutton联合主导的Physical Atari系统首次实现了真实物理世界中长时间不间断的强化学习,直接回应了模拟环境与现实之间的核心鸿沟问题。在科研自动化领域,MetaResearcher框架将多智能体群体架构与自反思元奖励机制相结合,探索RL驱动深度研究智能体的前沿路径。在机器人领域,全球首个面向真实机器人RL的大规模开源数据集RW-RL-Dataset发布,标志着工业机器人从"会模仿"向"能自愈"的关键跨越。在人类-AI协作方面,PASD(Partner-Aware Skill Discovery)提出了面向合作伙伴行为的深度分层技能发现框架,使智能体适应多样化的人类协作风格[^c26]。在机器人奖励设计方面,RDA(奖励设计智能体)利用视觉语言模型将语义理解注入奖励设计,在ManiSkill和HumanoidBench任务上显著提升策略的指令对齐[^c42]。在智能体内部世界模型方面,RWML通过模拟-现实差距奖励训练LLM智能体的动作条件世界模型,与策略RL结合后在ALFWorld和τ²-Bench上超越直接策略RL[^c41]。
强化学习的方法体系涵盖价值基方法(Q学习、DQN)、策略梯度方法(PPO)、最大熵方法(SAC)、信任区域方法(GTR)、离线强化学习(CQL、IQL、BFQ)以及模型基方法(MuZero、Dreamer)等。其应用领域从游戏扩展至机器人操作、自动驾驶、电商推荐、大语言模型训练和智能体系统等广泛场景。