本页在同一 V1 trainer 中对比 PPO 与 GRPO。比较对象不是算法名,而是实际启用的 role、batch field、forward pass、loss 和 resource cost。
Shared Path
prompt
-> rollout
-> reward
-> old/reference log-prob
-> advantage
-> actor updateExpected Differences
PPO:
critic role
-> values
-> GAE / returns
-> critic update
-> actor update
GRPO:
repeated responses per prompt
-> group reward statistics
-> group-relative advantages
-> actor update without criticSource Anchors
- need_critic / need_reference_policy
- _step_once branches
- advantage estimators
- critic update
- actor update
Comparison Dimensions
- required models and GPU memory;
- rollout count and prompt grouping;
- advantage bias/variance;
- reward scale sensitivity;
- sequence/token normalization;
- compute and communication cost;
- metrics required for debugging;
- suitability for long-horizon Agent trajectories。