本文参考了开源课程 Hands-On Modern RL 的知识框架梳理强化学习Reinforcement Learning, RL从基本概念到大模型对齐的完整脉络希望能帮助刚接触 RL 的读者建立一张全局地图。一、什么是强化学习强化学习是一类求解序列决策问题的计算方法。一个智能体Agent处于某个环境Environment之中在每个时刻观察环境的状态State据此做出一个动作Action环境接收到动作后转移到新状态并反馈给智能体一个标量的奖励Reward信号。智能体的最终目标是最大化整个交互过程中获得的累积奖励。这个定义里有三个关键点值得留意序列决策智能体需要连续做出多步选择当前的决定会影响未来的走向。反馈只有奖励不像监督学习那样有标准答案可以模仿智能体唯一能得到的信息就是这一步得了多少分。优化目标是长期累积智能体不能只顾眼前的单步得分而要着眼于整个过程的总回报。核心交互循环强化学习的运作可以概括为一个不断重复的循环智能体在时刻t tt观察到状态s t s_tst​据此选择动作a t a_tat​环境执行该动作后转移到新状态s t 1 s_{t1}st1​并返回奖励r t 1 r_{t1}rt1​重复第一步。这个循环不断进行下去就会产生一条轨迹s 0 , a 0 , r 1 , s 1 , a 1 , r 2 , s 2 , … s_0, a_0, r_1, s_1, a_1, r_2, s_2, \ldotss0​,a0​,r1​,s1​,a1​,r2​,s2​,…这里有几组容易混淆的概念状态与观测状态State是对环境的完整描述比如一盘国际象棋的全部信息而观测Observation往往只是部分信息比如游戏角色只能看到附近的画面。工程实践中大家常常不严格区分。动作空间分为离散动作空间比如角色只能左、右、跳、蹲四选一和连续动作空间比如机械臂关节角度可以取任意实数二者需要用不同类型的算法来处理。累积回报与折扣因子如果智能体只盯着眼前这一步的奖励做决策行为就会变得非常短视。因此真正需要优化的目标是累积回报ReturnG t G_tGt​——从当前时刻起直到一局结束未来所有奖励的加总。但把未来的奖励直接相加会有一个问题越靠后的奖励不确定性越大——就像迷宫里的老鼠眼前的小奶酪唾手可得远处的大奶酪却可能要冒着遇到猫的风险。为了体现未来的收益不如现在的收益值钱这一直觉我们引入折扣因子Discount Factorγ \gammaγ取值在 0~1 之间通常设为 0.95~0.99G t r t 1 γ r t 2 γ 2 r t 3 ⋯ ∑ k 0 ∞ γ k r t k 1 G_t r_{t1} \gamma r_{t2} \gamma^2 r_{t3} \cdots \sum_{k0}^{\infty} \gamma^k r_{tk1}Gt​rt1​γrt2​γ2rt3​⋯k0∑∞​γkrtk1​拆开来看其实很直观紧挨着当前时刻的奖励r t 1 r_{t1}rt1​不打折相当于乘以γ 0 1 \gamma^01γ01走两步才能拿到的r t 2 r_{t2}rt2​打一次折乘以γ 1 \gamma^1γ1以此类推。因为γ \gammaγ是一个小于 1 的数指数越高衰减得越快所以γ \gammaγ的取值就决定了智能体看多远γ \gammaγ越小智能体越短视越倾向于抓住眼前的小利益γ \gammaγ越接近 1智能体越有耐心越愿意为长远收益承担风险。整个强化学习的理论大厦都建立在一个被称为奖励假设的哲学立场之上任何目标都可以表述为最大化期望累积奖励。只要能把好与坏量化成数字信号强化学习就有办法让智能体学会应对。二、如何求解两条路线所有强化学习算法本质上都在回答同一个问题如何选择动作以最大化累积回报G t G_tGt​回答这个问题之前需要先认识一个核心概念——策略Policyπ \piπ它就是智能体的大脑给定当前状态输出该采取的动作。策略又分为确定性策略同一状态永远输出同一动作和随机性策略输出的是动作的概率分布天然带有探索能力。训练的终极目标就是找到一个最优策略π ∗ \pi^*π∗。围绕如何找到最优策略发展出两条截然不同的路线。路线一基于价值Value-Based这条路线的思路是先弄清楚每个动作值多少分再选分数最高的那个。这就好比走迷宫时每个岔路口都立着一块牌子写着往左走预计能拿 80 分往右走预计能拿 30 分你自然会选往左。这块牌子对应的就是动作价值函数Q 函数Q π ( s , a ) E π [ G t ∣ s t s , a t a ] Q^{\pi}(s, a) \mathbb{E}_{\pi}\left[G_t \mid s_t s, a_t a\right]Qπ(s,a)Eπ​[Gt​∣st​s,at​a]问题是还没走到终点怎么知道未来一共能拿多少分答案是边走边猜边猜边纠错。这背后的理论基石是马尔可夫决策过程MDP它的核心假设是未来只取决于当前状态与过去无关。有了这个假设我们才能推导出贝尔曼方程Bellman Equation当前的 Q 值 眼前的即时奖励 下一步的 Q 值。也就是说Q 值不需要把整局游戏走完才能算而是可以逐步拆解、逐步修正。具体过程是这样的一开始所有岔路口的分数都是乱写的随机初始化。走了一步拿到 1 分同时发现下一个路口的估计值是 10 分于是就把这一步的估计更新为 11011 分。不断重复这个“用下一步的估计去修正上一步的估计”的过程所有 Q 值最终都会收敛到真实值收敛的终点满足贝尔曼最优方程。有了准确的 Q 值最优策略呼之欲出永远选 Q 值最高的动作即a ∗ arg ⁡ max ⁡ a Q ∗ ( s , a ) a^* \arg\max_a Q^*(s, a)a∗argmaxa​Q∗(s,a)。这条路线的代表算法是从经典的 Q-Learning一路发展到深度学习时代的 DQN。路线二基于策略Policy-Based这条路线跳过了打分这一步直接学习看到什么状态就做什么动作。同样是走迷宫这次不给每条路打分而是反复走很多遍走到终点就强化沿途的每一个选择掉进陷阱就削弱相应的选择。走得多了好动作被选中的概率自然上升坏动作被选中的概率自然下降。形式化地讲策略π θ \pi_\thetaπθ​由参数θ \thetaθ定义训练目标是最大化期望回报J ( θ ) E π θ [ G t ] , θ ∗ arg ⁡ max ⁡ θ J ( θ ) J(\theta) \mathbb{E}_{\pi_\theta}[G_t], \quad \theta^* \arg\max_\theta J(\theta)J(θ)Eπθ​​[Gt​],θ∗argθmax​J(θ)这条路线的代表算法是从最基础的 REINFORCE一路发展到今天大模型对齐中被广泛使用的 PPO。Actor-Critic探索与利用的平衡这两条路线各有短板而它们的短板恰好指向了强化学习中一个核心矛盾——探索与利用Exploration vs. Exploitation是继续选已知最好的动作稳拿收益还是冒险尝试未知动作以期发现更好的策略就像选餐厅天天光顾同一家好吃的店可能会错过街角那家更好吃的但天天换新店尝鲜又容易经常踩雷。基于价值的路线擅长打分但探索能力不足基于策略的路线擅长探索但打分不够精确。Actor-Critic架构把两条路线结合了起来用价值路线训练一个评委Critic来评估动作的好坏再用策略路线训练一个演员Actor来选择动作。Critic 是一个价值函数负责给动作打分Actor 是策略函数π θ ( a ∣ s ) \pi_\theta(a|s)πθ​(a∣s)根据 Critic 的评分动态调整自己的行为—— 被打高分的动作以后多选被打低分的动作以后少选。两者相互促进评分越准演员进步越快演员尝试的动作越多样评委看到的数据也越丰富评分也随之更准。这有点像资深导演和年轻演员的关系导演指出问题演员据此改进而演员的新尝试也不断刷新导演对好表演的认知。另外按照智能体是否学习环境本身的运作规律算法还可以分为两大类无模型Model-Free方法不关心环境内部如何运转只关心某个动作能带来多少收益无论是基于价值、基于策略还是 Actor-Critic只要是靠在环境中反复试错来积累经验都属于这一类。基于模型Model-Based方法则会先在脑海中构建一个环境模型用来预测如果这样做环境会变成什么样比如 AlphaGo 就掌握了围棋规则可以在落子前于脑内推演后续走势。现代强化学习工作尤其是大模型对齐和复杂交互环境主要还是以 Model-Free 方法如 DQN、PPO、DPO 等为主因为它们更通用、适用范围更广。从表格到神经网络在状态空间很小的场景比如只有十几个格子的迷宫里Q 函数或策略函数可以直接用一张表格表示——每一行对应一个状态每一列对应一个动作查表即可决策这正是经典 Q-Learning 的做法。但在像 Atari 游戏这样的复杂场景中一帧画面就有几万个像素每个像素还有上百种取值可能的状态数量远远超出了表格能容纳的范围。深度强化学习Deep RL的解决办法是用神经网络来压缩这张无限大的表格网络以状态为输入以 Q 值或动作概率为输出不需要逐行记忆而是通过参数权重实现泛化——见过相似的画面就能推断出差不多的分数。据此又可以对算法做出细分网络输出打分表的属于 Value-Based如 DQN输出行为概率分布的属于 Policy-Based如 REINFORCE同时具备两种输出的属于 Actor-Critic如 PPO。三、大模型时代的强化学习前面讨论的智能体-环境-奖励框架最早是在游戏和机器人等传统场景中发展起来的。一个自然的问题是这套框架遇上大语言模型会发生什么变化2016 年 AlphaGo 击败李世石证明了强化学习在完美信息博弈中的威力而真正把强化学习推向大众视野中心的是 2022 年 ChatGPT 的发布——人们发现让大模型从能说话进化到说好话的关键技术正是强化学习。在游戏里奖励信号是清晰、自动的吃到金币加分掉进坑里扣分。但当我们希望 AI好好说话时问题就变得棘手了怎样算好的回答礼貌、有用、安全这些标准都很难被环境自动量化打分。RLHFReinforcement Learning from Human Feedback基于人类反馈的强化学习给出了第一套系统性方案分三步完成从能说话到说好话的转变监督微调SFT用人工撰写的高质量对话样本微调模型让它先学会基本的对话格式。奖励模型训练RM让人类标注员对模型的多个候选回答进行排序训练出一个能模拟人类偏好的打分模型。强化学习优化RL以奖励模型给出的分数作为反馈信号用 PPO 等算法进一步优化模型的回答策略。在这一大背景下大模型时代的强化学习逐渐演化出两条主要路线路线一基于偏好的对齐RLHF / DPO。当评判标准取决于人类是否喜欢时比如语气是否礼貌、内容是否安全环境无法自动打分只能先用人工标注训练一个奖励模型再用它来指导 RL 训练。DPODirect Preference Optimization则更进一步巧妙地把奖励信号隐藏进策略概率比之中绕开了显式训练奖励模型这一步让对齐流程大幅简化。路线二基于可验证奖励的强化学习RLVR。当任务转向数学、代码或复杂推理时答案对错本身就是客观可判定的不再需要依赖主观的人类偏好。以 DeepSeek-R1-Zero 为代表的一批前沿工作证明不需要预先做 SFT也不需要训练额外的奖励模型仅凭一个基于规则的反馈信号纯强化学习就足以驱动基础模型自发涌现出长链条的思维过程Chain-of-Thought和强大的推理能力。这被认为是当前通向更通用智能的最前沿探索方向之一。值得一提的是 PPO 在这个新时代里角色的转变从游戏控制年代的集大成算法变成了整个大模型对齐工业的地基。但 PPO 需要额外训练一个 Critic 网络来评估动作好坏对参数量巨大的语言模型而言这意味着相当可观的算力开销。GRPOGroup Relative Policy Optimization应运而生它用组内相对优势取代了 Critic 网络——针对同一个提示采样出多个回答在这些回答之间互相比较优劣直接从相对排序中学习。这一简化大幅降低了训练成本,也使其成为开源社区对齐大模型的主流选择之一。四、未来从对话到行动强化学习正在从让 AI 做单步决策走向让 AI 完成完整任务这条路上有三个值得关注的方向。第一智能体强化学习Agentic RL。目前的大语言模型本质上还是单轮问答机器——问一句答一句。但现实任务往往需要多轮交互规划旅行要多次搜索比价调试代码要反复运行测试、读报错、改代码再验证。Agentic RL 训练的正是能够在环境中连续行动、调用外部工具、并根据中间反馈动态调整策略的智能体这是从对话模型跨越到自主智能体的关键一步。第二多模态与具身智能。强化学习正在突破纯文本的边界视觉-语言模型VLM把 RL 延伸到图像理解和视觉推理领域而具身智能Embodied AI则将 RL 推向真实物理世界让机器人通过试错学会行走、抓取、操作。这里最大的挑战是仿真与现实之间的差距Sim-to-Real Gap——在虚拟环境中训练出的策略,到了真实世界可能完全失效。域随机化Domain Randomization等技术正在缓解这一问题同时Model-Based RL与自我博弈Self-Play也在打开新的可能性。第三也可能是最终的走向——通向更通用的智能。从游戏到语言从语言到视觉从视觉再到物理世界强化学习每一次跨界扩展都在验证同一件事——让智能体自己在试错中学习比人类手把手编码知识更有效。而这条路的尽头或许就是通用人工智能AGI。