在强化学习领域,近端策略优化(PPO)算法已成为大语言模型(LLM)对齐人类偏好的主流工具。然而,不少从业者和研究者注意到一个“矛盾”现象:PPO依赖Reward Model(奖励模型)来提供反馈信号,为什么还需要额外引入一个Critic Model(批评模型或价值模型)?这背后实则藏着强化学习从“试错”走向“高效稳健”的关键设计。

一、Reward Model:给行为打分的“裁判”

首先,Reward Model的角色是明确的。在RLHF(基于人类反馈的强化学习)中,人们无法为每一次模型输出都给出人工评分,因此训练出一个能模拟人类偏好的奖励模型。它接受输入(如对话上下文与模型回答),输出一个标量分数——分数越高,说明该回答越符合人类期望。PPO的优化目标正是最大化这个分数的期望值。

然而,Reward Model本身存在一个致命缺陷:稀疏性与方差。它只能给出最终结果的评分(比如整个回答好不好),却无法告诉模型“这个回答中的哪一步导致了高分”。换句话说,它是一个“只关心结果,不关心过程”的裁判。在长序列决策中(如生成多轮对话或长篇文章),仅靠最终奖励来调整策略,会导致梯度噪声巨大、训练极不稳定。

二、Critic Model:过程评估的“副驾驶”

正是在这一背景下,Critic Model应运而生。它的学名是“状态价值函数”,负责预测一个状态(或一组token序列)在后续能获得的累计奖励期望。简单理解:Critic Model并不直接判断当前输出“好不好”,而是判断“以当前状态出发,按现有策略走下去,最终能得多少分”。

这个预测值被称为“基线”。PPO算法利用Critic Model的输出,将动作的奖励与基线相减,得到“优势函数”(Advantage Function)。优势函数代表“当前动作比平均水平好多少”。这样一来,模型不再被Reward Model的绝对分数牵着走,而是专注于“哪些动作显著优于平均表现”,从而大幅降低方差。

三、为什么不能只用Reward Model?

如果去掉Critic Model,PPO会退化为一种叫“REINFORCE with baseline”的更原始的算法。此时,策略梯度计算公式为:梯度 = 奖励 × 动作概率的梯度。这个公式有两个问题:

  1. 所有动作都被“非负奖励”推动:只要Reward Model给的正分,无论大小,模型都会趋向于增加该动作的概率,导致更新方向模糊。
  2. 方差爆炸:Reward Model的评分可能有噪声(比如人类偏好不一致),而观测到的单次奖励波动很大。没有基线,梯度更新就像随机游走,训练需要大量样本才能收敛。

而Critic Model提供了局部最优的“锚点”。它将Reward Model的全局分数“分解”到了每一步,使得每个动作的更新信号都基于“相对优势”,而非绝对分数。这好比高考作文评分——Reward Model是阅卷老师给的最终分数(60分),Critic Model则告诉你“相比平均水平(50分),你的结构组织好了10分,语言平淡扣了5分……”,从而指导你具体改进哪里。

四、实践经验:Critic Model如何与PPO共生?

在主流开源实现(如DeepSpeed Chat、TRL库)中,PPO的训练循环通常包含以下步骤:

  1. 利用Reward Model对生成的序列(如“一句话”)计算最终奖励。
  2. 利用Critic Model计算每个token位置的基线价值。
  3. 计算优势函数 = 实际奖励 - 预测价值 + 未来折扣奖励(GAE算法优化)。
  4. 策略模型(Policy Model)根据优势函数优化动作概率,同时Critic Model也更新自身,使其价值预测更准确。

值得注意的是,Critic Model通常与策略模型共享部分参数(如共用的transformer层),但输出头不同。初期双方同步训练,Critic Model的价值预测从粗糙逐渐精准,反过来又稳定策略更新,形成正向循环。

五、结论:分工明确的“裁判”与“教练”

Reward Model和Critic Model并非重复建设,而是互补协作。Reward Model提供最终目标(“你要达到这个分数”),Critic Model则提供路径地图(“你现在的位置值多少分,下一步怎么走更稳妥”)。没有Critic Model,PPO就如同一辆只有导航终点却没有实时路况反馈的汽车,极易偏航。

在即将到来的AGI竞赛中,强化学习算法的效率就是生命线。理解Critic Model的必要性,不仅是技术问题,更是理解如何让机器在稀疏奖励中学会“举一反三”的哲学。未来,随着模型参数量激增,更高效的Critic设计(如集成价值头、隐式价值网络)或将成为下一波研究热点。