本页把算法公式映射到 verl 的 tensor 字段、mask、normalization 和 loss registry。第一轮只覆盖 GAE、GRPO outcome advantage、vanilla PPO loss、value loss 与 KL;其他 loss variant 作为扩展对照。
本页问题
rm_scores如何变成token_level_rewards?- GAE 与 GRPO 分别依赖哪些字段,在哪个维度做 baseline 和 normalization?
old_log_probs、currentlog_probs与advantages如何构成 policy ratio 和 clipped objective?loss_agg_mode如何改变 token、sequence 和 batch 的权重?- KL 放在 reward 中和放在 actor loss 中有何实现差异?
Source Anchors
Algorithm-to-Field Mapping
reward / score -> rm_scores / token_level_rewards
behavior policy -> old_log_probs
current policy -> model_output.log_probs
reference policy -> ref_log_prob
credit signal -> advantages
critic target -> returns
valid action tokens -> response_mask